← 목록
기타 2026-06-29 6KB 읽기 6분

크라우니 LLM 엔진 설계 + 블랙박스 구분 + 전체 파이프 (2026-06-29, 분석/기획)

0. 전체 목표 구조

자연어 →[LLM 인코더]→[문화필터(개인→표준)]→[의미어 SLM 결정론 코어]→[문화필터(출력/KPS구문)]→[LLM 디코더]→ 자연어
  • LLM = 유창성 전담(인/디코더). 의미·인과·결정론 = SLM 코어. 문화필터 = 양쪽(입력 개인화 흡수 / 출력 개인·KPS 재표현).

1. 대화도구 vs 명령/구현도구 — 블랙박스 구분 (구현완료)

이중경로 4상: 명령/구현=업무 → 결정론(티/옴/타, byte-identical, 크라우니블랙박스 차단). 대화=서비스/친절 → 음(에너지 블랙박스 양자, personable) 허용.
  • libs/도구분류.한선(7/7): 도구분류(req)→"명령|결정론"/"대화|블랙박스허용", 블랙박스허용(req)→0/1.
  • 명령 신호(만들·구현·코드·정렬·계산·수정…)→블랙박스 차단(결정론만). 대화 신호(힘들·생각·위로·추천…)→블랙박스 허용. 모호=대화 기본.
  • 의미: 구현/명령은 절대 비결정 양자 안 거침(재현성·인과). 대화만 음 블랙박스로 친절·다양성(같은의도 다른표현).

2. 경쟁 3사 LLM 특화점 (2025–2026, 웹근거)

Google Gemini 2.5OpenAI GPT(4o/o3)Anthropic Claude(Sonnet4.5/Opus4.5)
특화롱컨텍스트 1M·네이티브 멀티모달·Sparse MoE·TPU·속도추론(reasoning) RL·도구사용 RL·생태계코딩(SWE-bench 80%+)·에이전트(30h+)·컴퓨터유즈·안전성
아키Sparse MoE(용량/연산 분리)omni+추론 RL긴맥락 에이전트 정렬·확장사고예산
약점클라우드·로컬불가추론모델 지연·비용멀티모달 좁음·비용
공통: 전부 클라우드·초대형 → 크라우니 온디바이스와 직접경쟁 아님. 벤치마킹=특화 역량(아키 철학).

3. 크라우니 전용 로컬 LLM 설계 (핵심 결론)

LLM은 작아도 된다 — 인/디코더(번역+제약디코딩)는 reasoning 불필요.
  • 규모: 양방향 단일 Qwen3 1.7B(Apache 2.0) 1개, 또는 인코더 Gemma3 270M + 디코더 Qwen3 1.7B. 닫힌어휘+제약디코딩+QLoRA로 sub-1B(0.3~0.7B) 현실적.
  • 양자화/하드웨어: 4-bit(AWQ/Q4) + TensorRT-LLM, 젯슨 Orin 30~50+ tok/s(7B Q4≈14tok/s 대비 3-4B는 실용).
  • 어휘: 의미어 ~2만으로 토크나이저 prune → embedding/LM-head 축소.
  • 출력: XGrammar 류 제약디코딩(닫힌 의미어/KPS 문법 강제 → 환각 물리차단·최대100배 가속, 코어 결정론 보존).
  • 학습: QLoRA로 NL↔의미어 번역쌍만 파인튜닝(reasoning 데이터 불필요). 학습셋=튜플적재.js의 (자연어,표준어,의미어패킷,KPS구문) — 한글 먼저.
  • 벤치마킹 철학: Gemini MoE "용량/연산 분리"(SLM코어=expert, LLM=얇은 인/디코더) + OpenAI "위임 라우팅"(LLM이 추론 말고 SLM코어/문화필터에 위임).
  • 후보 라이선스 안전순: Apache2.0(Qwen3·Mistral)·MIT > Gemma > Llama 커뮤니티.

4. 구축 현황 (이번 세션까지)

  • ✅ 의미어 SLM 코어(코드북·합성연산자·인과엔진·연산분류·KPS구문·의미어생성) 한선씨 130+/PASS
  • ✅ 문화필터 입력(문화계층 동적로딩, 자생폐회로) + 출력(KPS구문) + 회원패턴추출
  • ✅ 블랙박스 구분(도구분류)
  • ✅ LLM 브리지(claude CLI, 구독인증) — 로컬 LLM 전 단계 부트스트랩
  • ✅ 학습 튜플 수집 파이프(한글)
  • ✅ 한국어 코드북 137개념(색·온도+Concepticon 120)

5. 필요 잔여 (로컬 LLM 실체화)

  • Qwen3 1.7B(또는 Gemma3 270M) 젯슨 배포 + 4bit 양자화
  • 의미어 ~2만 토크나이저 prune
  • XGrammar 제약디코딩(의미어/KPS 문법) 결선
  • QLoRA NL↔의미어 파인튜닝(튜플 학습셋 한글부터) — 학습셋 규모 확보가 선결
  • claude CLI → 로컬 LLM 교체(T3 티어), claude는 부트스트랩/폴백
  • 형태소 분석기(현 경량 스트리퍼 "연하게→연" 과절단 한계)

출처(연구)

Gemini 2.5 TR(arXiv 2507.06261)·OpenAI o3/o4·Anthropic Sonnet4.5/Opus4.5·Qwen3/Gemma3 270M·XGrammar(arXiv 2502.05111)·Jetson Orin LLM 벤치·QLoRA. (상세 URL=연구 산출물)

파일

libs/도구분류.한선(+테스트) · 코드북.psv(137 병합) · 패턴추출.js·문화변화추출.js(토큰화 보강) · 튜플적재.js

[추가] Qwen3 vs 후보 정밀비교 — 한글 우선 결론 수정 (2026-06-29)

웹근거 비교 결과 "Qwen3 기본" 권고 수정. 한국어 절대품질은 한국어특화 상용모델이 우위.
  • A.X 4.0 Light 7B(SKT, Apache2.0): KMMLU 78.3(GPT-4o↑)+한국어토큰 33%효율 = 한국어 최강+청정라이선스. 한국어 품질 단일 1순위.
  • HyperCLOVA X SEED 1.5/3B(Naver, SEED<10M MAU): 소형 온디바이스 한국어 최적(4bit 1.5B≈1.2GB·29tok/s) = 인코더 1순위.
  • Qwen3 1.7B/4B(Apache2.0 무제한): 생태계·라이선스 무결 = 디코더(의미어→NL)+제약디코딩 적합. ⚠0.6B 4bit −10%.
  • Gemma3 270M(상용): 초임베디드(<1GB) FT전용 + ~2만 prune + 한국어 QLoRA 보강.
  • ⚠️상용 차단: EXAONE 전버전(NC)·Kanana-nano2.1B(CC-NC)·Qwen2.5-3B(Research). 상용화이트리스트=Qwen3·Gemma3·Llama3.2·Phi·A.X Light·Kanana1.5/2·SEED·Trillion.
  • 통찰: reasoning불필요+제약디코딩 모델크기무관+~2만 vocab prune 인도메인무손실 → "작고 한국어잘하는 상용모델"이 정답. thinking 번역이득0(arXiv2510.11919).
  • 권장조합: 인코더 SEED1.5B / 디코더 Qwen3 1.7-4B / 한국어품질단일 A.X Light 7B. 출처: A.X(huggingface skt/A.X-4.0-Light)·SEED(naver-hyperclovax)·Qwen3(arXiv2505.09388)·Kanana(arXiv2502.18934)·EXAONE NC라이선스.