← 목록
기타 2026-06-21 4KB 읽기 4분

LLM삼진추론 — A+B+C 확장 (2026-06-21)

개요

세션4 LLM 회귀 스위트에 3방향 확장: 멀티헤드 어텐션 / 토크나이저 / Metal GPU.

A — 회귀 강화 (멀티헤드 + d=8 L=3)

신규 파일

  • pkg/libs/삼진멀티헤드.한선 — n_head분할 삼진 어텐션 라이브러리
  • tests/삼진멀티헤드_골든.한선 — 2케이스 수기 골든 (ALL PASS)
  • tests/삼진SLM_d8L3.한선 — d=8, L=3 SLM 수렴 검증 (손실 101→2)

골든값 (수기 검증 완료)

  • 케이스1 (n_keys=2): [1,1,1,-1] ✓
  • 케이스2 (n_keys=3): [1,1,0,1] ✓
  • 수기계산 함정: 75/100 = VM bal_div = 1 (round(0.75)=1, r=-25), 50/100 = 0 (동점→truncate)
  • B — 토크나이저 (char-level ternary 임베딩)

    신규 파일

    • pkg/libs/삼진토크나이저.한선 — 토크나이저+임베딩 테이블 라이브러리
    • tests/삼진토크나이저_데모.한선 — "크라" → token → embed → SLM → logits E2E

    버그 & 수정

    • VM 균형 mod 음수: 53356%128 = -20 (bal_div 특성). 수정: 만약 (id < 0) { id = id + vocab_size }
    • 임베딩 테이블: (id+j)%3 → VM bal_div 결과가 자동으로 {-1,0,1}. 추가 변환 불필요.

    C — Metal GPU 백엔드 (VM=GPU bit-exact)

    신규 파일

    • tests/삼진_matmul.metal — Metal MSL 삼진 행렬곱 커널 (trit_matmul + bal_div_vec)
    • tests/삼진_metal_test.m — Objective-C 런타임 컴파일 + 검증 하네스
    • tests/삼진_metal_test.한선 — VM 레퍼런스 동반

    결과

    • Metal device: Apple M2 Max
    • C_gpu = C_vm = [-1,2,1,3,3,0,-3,-1,-4,1,4,-3,2,-2,-2,8]
    • PASS — VM=Metal bit-exact, 불일치=0

    D — 세션4 추가 확장 ⑬⑭⑮⑯ (2026-06-21)

    ⑬ base-3 트릿 패킹 (BitNet 대응)

  • pkg/libs/삼진패킹.한선 — 균형3진 base-3 패킹 라이브러리
  • 삼진_팩(trits, base, 개수): packed = Σ trit_i · 3^i (왼시프트=×3^i)
  • 삼진_언팩(packed, 개수): 균형 자리추출 반복 (t = p%3, p=(p-t)/3)
  • 삼진_팩행렬곱(A, m, k, Wpacked, n): 행별 언팩 후 부호누산 MAC
  • 검증: 9트릿 라운드트립 PASS, 팩행렬곱 == 언팩행렬곱 PASS
  • 압축률: 4트릿/정수 (행당), 최대 18트릿/정수 (3^18≤INT_MAX)
  • ⑭ NEON 멀티스레드 matmul

  • tests/삼진가속_mt.c — pthread row-partition 병렬화
  • 512×512×512, 40 iters, Apple M2 Max:
  • 단일스레드: 12.4 ms/iter → 4스레드: 4.0 ms (3.15x) → 8스레드: 2.9 ms (4.43x)
  • 불일치=0 (단일 vs 멀티, bit-exact)
  • ⑮ LayerNorm 역전파 전층 학습

    • tests/삼진LN역전파학습.한선 — 선형→LN→선형 전층 LN 역전파
    • 손실 50→5 단조감소 ✓ (12스텝)

    ⑯ 어텐션 value 투영 STE 학습

    • tests/삼진어텐션학습.한선 — 어텐션 Wv STE 학습
    • 손실 10→2 단조감소 ✓

    통합 회귀 최종 결과 (2026-06-21 갱신)

    세션4_LLM_회귀.sh — 19항목 ALL PASS (실패 0건)
      ①커널골든10/10 ②NEON6.77x ③STE학습 ④SLM_E2E d4L2
      ⑥2층MLP ⑦멀티토큰 ⑧bal_divNEON 샤딩
      ⑨멀티헤드2/2 ⑩d8L3수렴 ⑪토크나이저 ⑫Metal GPU(M2 Max bit-exact)
      ⑬트릿패킹 ⑭MT-NEON5.05x ⑮LN역전파 ⑯Wv-STE학습
      ⑰완전트랜스포머블록E2E ⑱다층스택깊이안정 ⑲스택+헤드STE학습
    

    잔여 갭

    • nvcc (Jetson Thor 도착 시 NVIDIA GPU 검증)
    • 토크나이저: 대어휘 vocab (BPE), 시퀀스 어텐션 + KV캐시
    • 실제 언어 데이터셋 학습 루프 (배치, 에폭)
    • 트릿 패킹: 18트릿/정수 풀 압축 벤치마크