이해 라우터 패키징 용량·속도·대응력 + 최소 SLM 연결 기대효율
실측 2026-07-18. 목적: 현재 라우터 패키지 특성 + claude -p 세분을 최소 로컬 SLM으로 대체 시 기대효율.
① 패키징 용량 (VM 727KB 공유 별도)
| 아티팩트 | 용량 |
|---|
| 의미어라우터서버.toau | 162KB |
| 의미어라우터_모델.psv | 274KB |
| 방사형이웃·클러스터·표준.json | ~3KB |
| 라우터 코어 패키지 | 442KB |
- crownyc VM 727KB는 크라우니 전체 공유(이미 번들). 라우터 추가분 ~440KB로 초경량.
② 기대 속도 (실측)
| 경로 | 지연 | 비중 |
|---|
| 결정론 티(상주 서버) | ~29ms/req (토큰0) | 30% |
| 세분 claude -p haiku ×3판정관 | ~57s/case (19s×3) | 70% |
- ★병목 = 세분 LLM(외부 claude -p). 70% 케이스가 ~57s → 시스템 실효속도를 지배.
- 상주 서버로 모델로드는 0.92s→~20-29ms 해결됐으나, 세분 LLM 지연이 남은 최대 병목.
③ 대응력 (4상 분포·정확도)
| 4상 | 비중 | 정확 |
|---|
| 티(결정론) | 30% | 99.0% |
| 세분(LLM 필요, 2.9지선다) | 70% | 후보포함 85.3%(천장) |
- 세분 무료 베이스라인(NB top-1, LLM無):
62.8%.
④ 최소 SLM 연결 기대효율 (핵심)
세분은
top-3 후보 중 택1(2.9지선다) 제약 분류 — 개방생성 아님 → 최소 모델로 충분.
| 방식 | 지연 | 크기 | 세분 정확 | 토큰 |
|---|
| 현재: claude -p haiku ×3 | ~57s | 외부 API | ~83%(표본 5/6) | 무거움 |
| 무료 베이스: NB top-1 | ~0ms | 0 | 62.8% | 0 |
KB급 NB+바이그램(bag-of-words) | ~ms | KB | 62.7%(무개선) ✗ | 0 |
| 최소 SLM = 소형 어텐션(삼진어텐션.한선급) | ~10-100ms | ~MB | ~72-80% 목표 | 0 |
| Qwen-0.5B급(참고) | ~50-200ms | ~500MB-1GB | ~83%+ | 0 |
★실측 정정 (가정 폐기)
- KB급 NB(바이그램 포함)는 세분에 무효(62.7%, -0.2%p) — 세분 갭(63→85%)은 bag-of-words 피처로 못 메움. 혼동쌍은 문맥/순서 의존(그래서 LLM이 83%).
- 따라서 "최소 사이즈"의 하한 = 문맥 포착 소형 어텐션 모델(삼진어텐션.한선/삼진임베딩 계열, ~MB), KB 바구니모델 아님.
- Qwen-0.5B는 ~83% 도달하나 500MB+로 "최소"엔 과대. 젯슨 토르 타깃엔 삼진어텐션(수MB)이 적정 균형.
기대효율 요약 (정직)
- 속도: 세분 57s → ~10-100ms = ~500-5000× 가속. 시스템 전체 ms-지연·완전 로컬.
- 크기: 효과적 최소 = 소형 어텐션 ~MB(KB NB는 무효 확인). Qwen급은 과대.
- 정확: ~72-80% 목표(어텐션이 문맥 포착). LLM 83% 근접, +9-17%p over NB. 완벽은 아니나 저확신분만 claude 폴백.
- 토큰/의존성: 0(로컬). 외부 claude -p 제거 → 오프라인·비용0·젯슨 이식.
권장 아키텍처
세분 = 최소 로컬 SLM(top-3 제약 분류기, 한선씨 삼진MLP 재학습 or 초저용량LLM.한선 확장). claude -p는 SLM 저확신 시에만 폴백(옴 중의 옴). → 70% 세분이 로컬 ms·토큰0, 잔여 극소만 외부.
검증·잔여
- 실측: 패키지 442KB·티 29ms/99%·세분 claude 57s·NB베이스 62.8%·천장 85.3%.
- 다음 단계(선택): 최소 SLM 프로토타입 학습(세분 3지선다 전용) → 실제 정확·지연 실측으로 ~75-80% 목표 확증.
- 재사용 자산: libs/초저용량LLM.한선(7KB)·삼진MLP.한선·어텐션분류.한선.
세분 SLM 프로토타입 실측 확증 (2026-07-18, 정직한 결과)
4상균형3진 학습 로직 (설계+검증)
- 아키텍처: 삼진임베딩→어텐션/MLP→트릿분류, 전 구간 균형3진 W∈{-1,0,+1}, STE.
- 4상-gated 학습률: 티(맞음·고마진)=미세유지 / 타(틀림·고마진)=강교정 / 옴(저마진)=탐색 / 음(참 top3밖)=강학습.
- ★핵심 통찰: 음=skip(lr0)은 초기 랜덤모델서 ~86% 스킵→학습굶음(32%). 음=강학습(lr0.10)이 정답: 32%→55.1%(+23%p). 모델이 가장 틀린 것을 가장 세게 학습.
실측 (홀드아웃, 세분 321건)
| 방식 | 정확 |
|---|
| 규칙 NB | 61.4% |
| from-scratch SLM(삼진MLP·어텐션, 음수정) | 55.1% (어텐션 46%·MLP 38→55%) |
| LLM claude | ~83% · 천장 85% |
- ★
~72-80% 목표는 from-scratch로 미달(~55%, NB 61%도 못 넘음). 실수MLP도 32%=학습로직 문제였고 수정 후 55% 상한.
- 원인: 2324실례는 문맥모델 from-scratch 학습에 소량. NB의 bag-of-words 스무딩이 소량데이터서 더 일반화. LLM 83%는 대규모 사전학습.
정직한 경로 (밸런싱 재정의)
- 현재 최선 로컬 도구 = 규칙(NB) 61% > from-scratch SLM 55%. 밸런싱은 당장 NB 우위.
- ~72-80% 로컬 SLM 도달 경로:
1)
지식증류(distillation): claude로 10k+ 실례 라벨링→SLM 학습(LLM 지식 전이). ★가장 유망.
2) 사전학습 소형모델(Qwen-0.5B) 파인튜닝.
- from-scratch 삼진 SLM은 한선씨 포팅 보류(55%<NB, 태우기 전 프리체크로 확인).