← 목록
기타 2026-07-18 5KB 읽기 5분

이해 라우터 패키징 용량·속도·대응력 + 최소 SLM 연결 기대효율

실측 2026-07-18. 목적: 현재 라우터 패키지 특성 + claude -p 세분을 최소 로컬 SLM으로 대체 시 기대효율.

① 패키징 용량 (VM 727KB 공유 별도)

아티팩트용량
의미어라우터서버.toau162KB
의미어라우터_모델.psv274KB
방사형이웃·클러스터·표준.json~3KB
라우터 코어 패키지442KB
- crownyc VM 727KB는 크라우니 전체 공유(이미 번들). 라우터 추가분 ~440KB로 초경량.

② 기대 속도 (실측)

경로지연비중
결정론 티(상주 서버)~29ms/req (토큰0)30%
세분 claude -p haiku ×3판정관~57s/case (19s×3)70%
- ★병목 = 세분 LLM(외부 claude -p). 70% 케이스가 ~57s → 시스템 실효속도를 지배.
  • 상주 서버로 모델로드는 0.92s→~20-29ms 해결됐으나, 세분 LLM 지연이 남은 최대 병목.

③ 대응력 (4상 분포·정확도)

4상비중정확
티(결정론)30%99.0%
세분(LLM 필요, 2.9지선다)70%후보포함 85.3%(천장)
- 세분 무료 베이스라인(NB top-1, LLM無): 62.8%.

④ 최소 SLM 연결 기대효율 (핵심)

세분은 top-3 후보 중 택1(2.9지선다) 제약 분류 — 개방생성 아님 → 최소 모델로 충분.

방식지연크기세분 정확토큰
현재: claude -p haiku ×3~57s외부 API~83%(표본 5/6)무거움
무료 베이스: NB top-1~0ms062.8%0
KB급 NB+바이그램(bag-of-words)~msKB62.7%(무개선)0
최소 SLM = 소형 어텐션(삼진어텐션.한선급)~10-100ms~MB~72-80% 목표0
Qwen-0.5B급(참고)~50-200ms~500MB-1GB~83%+0

★실측 정정 (가정 폐기)

  • KB급 NB(바이그램 포함)는 세분에 무효(62.7%, -0.2%p) — 세분 갭(63→85%)은 bag-of-words 피처로 못 메움. 혼동쌍은 문맥/순서 의존(그래서 LLM이 83%).
  • 따라서 "최소 사이즈"의 하한 = 문맥 포착 소형 어텐션 모델(삼진어텐션.한선/삼진임베딩 계열, ~MB), KB 바구니모델 아님.
  • Qwen-0.5B는 ~83% 도달하나 500MB+로 "최소"엔 과대. 젯슨 토르 타깃엔 삼진어텐션(수MB)이 적정 균형.

기대효율 요약 (정직)

  • 속도: 세분 57s → ~10-100ms = ~500-5000× 가속. 시스템 전체 ms-지연·완전 로컬.
  • 크기: 효과적 최소 = 소형 어텐션 ~MB(KB NB는 무효 확인). Qwen급은 과대.
  • 정확: ~72-80% 목표(어텐션이 문맥 포착). LLM 83% 근접, +9-17%p over NB. 완벽은 아니나 저확신분만 claude 폴백.
  • 토큰/의존성: 0(로컬). 외부 claude -p 제거 → 오프라인·비용0·젯슨 이식.

권장 아키텍처

세분 = 최소 로컬 SLM(top-3 제약 분류기, 한선씨 삼진MLP 재학습 or 초저용량LLM.한선 확장). claude -p는 SLM 저확신 시에만 폴백(옴 중의 옴). → 70% 세분이 로컬 ms·토큰0, 잔여 극소만 외부.

검증·잔여

  • 실측: 패키지 442KB·티 29ms/99%·세분 claude 57s·NB베이스 62.8%·천장 85.3%.
  • 다음 단계(선택): 최소 SLM 프로토타입 학습(세분 3지선다 전용) → 실제 정확·지연 실측으로 ~75-80% 목표 확증.
  • 재사용 자산: libs/초저용량LLM.한선(7KB)·삼진MLP.한선·어텐션분류.한선.

세분 SLM 프로토타입 실측 확증 (2026-07-18, 정직한 결과)

4상균형3진 학습 로직 (설계+검증)

  • 아키텍처: 삼진임베딩→어텐션/MLP→트릿분류, 전 구간 균형3진 W∈{-1,0,+1}, STE.
  • 4상-gated 학습률: 티(맞음·고마진)=미세유지 / 타(틀림·고마진)=강교정 / 옴(저마진)=탐색 / 음(참 top3밖)=강학습.
  • ★핵심 통찰: 음=skip(lr0)은 초기 랜덤모델서 ~86% 스킵→학습굶음(32%). 음=강학습(lr0.10)이 정답: 32%→55.1%(+23%p). 모델이 가장 틀린 것을 가장 세게 학습.

실측 (홀드아웃, 세분 321건)

방식정확
규칙 NB61.4%
from-scratch SLM(삼진MLP·어텐션, 음수정)55.1% (어텐션 46%·MLP 38→55%)
LLM claude~83% · 천장 85%
- ★~72-80% 목표는 from-scratch로 미달(~55%, NB 61%도 못 넘음). 실수MLP도 32%=학습로직 문제였고 수정 후 55% 상한.
  • 원인: 2324실례는 문맥모델 from-scratch 학습에 소량. NB의 bag-of-words 스무딩이 소량데이터서 더 일반화. LLM 83%는 대규모 사전학습.

정직한 경로 (밸런싱 재정의)

  • 현재 최선 로컬 도구 = 규칙(NB) 61% > from-scratch SLM 55%. 밸런싱은 당장 NB 우위.
  • ~72-80% 로컬 SLM 도달 경로:
1) 지식증류(distillation): claude로 10k+ 실례 라벨링→SLM 학습(LLM 지식 전이). ★가장 유망. 2) 사전학습 소형모델(Qwen-0.5B) 파인튜닝.
  • from-scratch 삼진 SLM은 한선씨 포팅 보류(55%<NB, 태우기 전 프리체크로 확인).