크라우니 LLM 엔진 설계 + 블랙박스 구분 + 전체 파이프 (2026-06-29, 분석/기획)
0. 전체 목표 구조
자연어 →[LLM 인코더]→[문화필터(개인→표준)]→[의미어 SLM 결정론 코어]→[문화필터(출력/KPS구문)]→[LLM 디코더]→ 자연어
- LLM = 유창성 전담(인/디코더). 의미·인과·결정론 = SLM 코어. 문화필터 = 양쪽(입력 개인화 흡수 / 출력 개인·KPS 재표현).
1. 대화도구 vs 명령/구현도구 — 블랙박스 구분 (구현완료)
이중경로 4상: 명령/구현=업무 → 결정론(티/옴/타, byte-identical,
크라우니블랙박스 차단). 대화=서비스/친절 →
음(에너지 블랙박스 양자, personable) 허용.
libs/도구분류.한선(7/7): 도구분류(req)→"명령|결정론"/"대화|블랙박스허용", 블랙박스허용(req)→0/1.
- 명령 신호(만들·구현·코드·정렬·계산·수정…)→블랙박스 차단(결정론만). 대화 신호(힘들·생각·위로·추천…)→블랙박스 허용. 모호=대화 기본.
- 의미: 구현/명령은 절대 비결정 양자 안 거침(재현성·인과). 대화만 음 블랙박스로 친절·다양성(같은의도 다른표현).
2. 경쟁 3사 LLM 특화점 (2025–2026, 웹근거)
| Google Gemini 2.5 | OpenAI GPT(4o/o3) | Anthropic Claude(Sonnet4.5/Opus4.5) |
|---|
| 특화 | 롱컨텍스트 1M·네이티브 멀티모달·Sparse MoE·TPU·속도 | 추론(reasoning) RL·도구사용 RL·생태계 | 코딩(SWE-bench 80%+)·에이전트(30h+)·컴퓨터유즈·안전성 |
| 아키 | Sparse MoE(용량/연산 분리) | omni+추론 RL | 긴맥락 에이전트 정렬·확장사고예산 |
| 약점 | 클라우드·로컬불가 | 추론모델 지연·비용 | 멀티모달 좁음·비용 |
공통: 전부 클라우드·초대형 → 크라우니 온디바이스와 직접경쟁 아님.
벤치마킹=특화 역량(아키 철학).
3. 크라우니 전용 로컬 LLM 설계 (핵심 결론)
LLM은 작아도 된다 — 인/디코더(번역+제약디코딩)는 reasoning 불필요.
- 규모: 양방향 단일 Qwen3 1.7B(Apache 2.0) 1개, 또는 인코더 Gemma3 270M + 디코더 Qwen3 1.7B. 닫힌어휘+제약디코딩+QLoRA로 sub-1B(0.3~0.7B) 현실적.
- 양자화/하드웨어: 4-bit(AWQ/Q4) + TensorRT-LLM, 젯슨 Orin 30~50+ tok/s(7B Q4≈14tok/s 대비 3-4B는 실용).
- 어휘: 의미어 ~2만으로 토크나이저 prune → embedding/LM-head 축소.
- 출력: XGrammar 류 제약디코딩(닫힌 의미어/KPS 문법 강제 → 환각 물리차단·최대100배 가속, 코어 결정론 보존).
- 학습: QLoRA로 NL↔의미어 번역쌍만 파인튜닝(reasoning 데이터 불필요). 학습셋=튜플적재.js의 (자연어,표준어,의미어패킷,KPS구문) — 한글 먼저.
- 벤치마킹 철학: Gemini MoE "용량/연산 분리"(SLM코어=expert, LLM=얇은 인/디코더) + OpenAI "위임 라우팅"(LLM이 추론 말고 SLM코어/문화필터에 위임).
- 후보 라이선스 안전순: Apache2.0(Qwen3·Mistral)·MIT > Gemma > Llama 커뮤니티.
4. 구축 현황 (이번 세션까지)
- ✅ 의미어 SLM 코어(코드북·합성연산자·인과엔진·연산분류·KPS구문·의미어생성) 한선씨 130+/PASS
- ✅ 문화필터 입력(문화계층 동적로딩, 자생폐회로) + 출력(KPS구문) + 회원패턴추출
- ✅ 블랙박스 구분(도구분류)
- ✅ LLM 브리지(claude CLI, 구독인증) — 로컬 LLM 전 단계 부트스트랩
- ✅ 학습 튜플 수집 파이프(한글)
- ✅ 한국어 코드북 137개념(색·온도+Concepticon 120)
5. 필요 잔여 (로컬 LLM 실체화)
출처(연구)
Gemini 2.5 TR(arXiv 2507.06261)·OpenAI o3/o4·Anthropic Sonnet4.5/Opus4.5·Qwen3/Gemma3 270M·XGrammar(arXiv 2502.05111)·Jetson Orin LLM 벤치·QLoRA. (상세 URL=연구 산출물)
파일
libs/도구분류.한선(+테스트) · 코드북.psv(137 병합) · 패턴추출.js·문화변화추출.js(토큰화 보강) · 튜플적재.js
[추가] Qwen3 vs 후보 정밀비교 — 한글 우선 결론 수정 (2026-06-29)
웹근거 비교 결과
"Qwen3 기본" 권고 수정. 한국어 절대품질은 한국어특화 상용모델이 우위.
- A.X 4.0 Light 7B(SKT, Apache2.0): KMMLU 78.3(GPT-4o↑)+한국어토큰 33%효율 = 한국어 최강+청정라이선스. 한국어 품질 단일 1순위.
- HyperCLOVA X SEED 1.5/3B(Naver, SEED<10M MAU): 소형 온디바이스 한국어 최적(4bit 1.5B≈1.2GB·29tok/s) = 인코더 1순위.
- Qwen3 1.7B/4B(Apache2.0 무제한): 생태계·라이선스 무결 = 디코더(의미어→NL)+제약디코딩 적합. ⚠0.6B 4bit −10%.
- Gemma3 270M(상용): 초임베디드(<1GB) FT전용 + ~2만 prune + 한국어 QLoRA 보강.
- ⚠️상용 차단: EXAONE 전버전(NC)·Kanana-nano2.1B(CC-NC)·Qwen2.5-3B(Research). 상용화이트리스트=Qwen3·Gemma3·Llama3.2·Phi·A.X Light·Kanana1.5/2·SEED·Trillion.
- 통찰: reasoning불필요+제약디코딩 모델크기무관+~2만 vocab prune 인도메인무손실 → "작고 한국어잘하는 상용모델"이 정답. thinking 번역이득0(arXiv2510.11919).
- 권장조합: 인코더 SEED1.5B / 디코더 Qwen3 1.7-4B / 한국어품질단일 A.X Light 7B. 출처: A.X(huggingface skt/A.X-4.0-Light)·SEED(naver-hyperclovax)·Qwen3(arXiv2505.09388)·Kanana(arXiv2502.18934)·EXAONE NC라이선스.