LLM↔크라우니 의미어코드 파이프라인 — 완성 설계
개요
크라우니코드는 자연어 유창성 목표없음=LLM 담당. 자연어→[LLM 인코더]→의미어코드→[크라우니 AGI코어]→의미어코드→[LLM 디코더]→자연어. 의미어코드=인터페이스. 울트라 워크플로우(4설계→opus). breadth갭 해소(역할분리로 양쪽 우위 합산).핵심: 65 seed 병목 = 로더 배선문제(실측 정정)
어휘=1,603 색인 + 3,254 FAB + 105 조합규칙(374,400 합법조합) + 148,825 학습줄 + 3,083 매핑. '65 seed'는 의미어임베딩.한선 사전로더가 60+시드만 적재하는 배선문제(G1 글루로 해소). 임베딩은 큐브왕복 모듈일 뿐, 코어=셀코어+컴포저+결정론경로.인과 100%는 크라우니 코어 구간(의미어코드 IN→OUT)에만 — LLM 인코더/디코더 구간은 비결정(정직).
All four designs' core assets verified on disk (의미어_index 1603행, 의미어사전 933행/105규칙, FAB 의미어.dat 3254레코드, 학습.dat 148,825행, semantic_map 3083행, 컴포저·셀코어·음필터·결정론경로·디스패처·패킷·의미어색인 .한선 모두 실존). 봉합 설계를 산출한다.
의미어코드 파이프라인 통합 설계 v1.0 — LLM↔크라우니 봉합
총괄 아키텍트 결의. 4개 설계(프로토콜·인코더·규칙코어·디코더E2E)를 하나의 파이프라인으로 봉합한다. 모든 수치는 디스크 실측에 발을 둔다. LLM 구간 비결정은 정직하게 인정하고, 인과 100% 주장은 크라우니 구간에만 건다.
1. 전체 파이프라인 한 장
유창성·세계지식 = LLM 책임 │ 인과·결정론·에너지 = 크라우니 책임
┌────────────────────────────────────────────┐ │ ┌──────────────────────────────────────┐
자연어 ──▶ [LLM 인코더] ──▶ 의미어코드(IN) ──▶│ │ │──▶ [크라우니 AGI코어 SemCore] ──▶ 의미어코드(OUT)
(열린집합) Haiku/Sonnet (S-식, 닫힌집합) │ │ │ 이중경로 4상 │
│ │ │ ├ 티옴타: 규칙체인→고정점 │
│ │ │ │ (byte-identical·규칙ID추적) │
│ │ │ └ 음: 음필터(방향고정·세부변동) │
자연어 ◀── [LLM 디코더] ◀── 의미어코드(OUT)◀──│ │ │◀── 감사로그(원문해시|경로|규칙ID|4상) │
(4상 톤) +#품사/#도메인 메타 │ │ └──────────────────────────────────────┘
└────────────────────────────────────────────┘ │ LLM 호출 0회, 5~50ms, 토큰 0
비결정(스키마 바운딩) │ 결정론·재현
★ 경계선 = 음(U) ★
구간별 책임 계약 (봉합의 핵심 — 책임이 절대 섞이지 않는다):
| 구간 | 입력→출력 | 결정성 | 인과추적 | 비용 | 환각 위험 |
|---|---|---|---|---|---|
| LLM 인코더 | 자연어 → 의미어코드 | 비결정 | 없음(스키마로 바운딩) | Haiku ~$0.0005 | 닫힌어휘 대조로 차단 |
| 크라우니 SemCore | 의미어코드 → 의미어코드 | byte-identical | 100% 규칙ID 체인 | 토큰0, 5~50ms | 구조상 불가(생성 안 함) |
| LLM 디코더 | 의미어코드+메타 → 자연어 | 비결정 | 메타가 어형만 결정 | Haiku ~$0.000025 | "새 정보 금지" 지시 |
2. 의미어코드 프로토콜 — 확정
2.1 어휘 = 닫힌집합 (실측)
| 층 | 자산 | 실측 | 와이어 역할 | ||
|---|---|---|---|---|---|
| L1 원자 | 의미어_index.dat | 1,603행 (동작1146/명사444/수식10) | 토큰 head(연산자) | ||
| L2 조합 | 의미어사전.dat | 933행 / 105 조합규칙 (30카테×39동작×20수식×16패턴 = 374,400 합법조합) | head 수식 변조 | ||
| L3 로직 | 의미어.dat (FAB) | 3,254 레코드 | 호출: 형 본체 | ||
| 캐시 | 학습.dat | 148,825행 (intent\ | han\ | 코드, 36ms grep) | 토큰0 직행 |
| 매핑 | semantic_map.dat | 3,083행 (intent\ | @의미코드\ | 키워드) | intent→@코드 |
2.2 와이어 포맷 (정본 = 텍스트 S-식)
lisp@의미어코드 v1
@어휘 index:1603 fab:3254 사전:105
(의미어[.수식] 슬롯:값 …)
의미어= L1 표면형 (id 아님 — LLM은 단어를 안정적으로 다룸, 크라우니가 행번호로 해석).수식= L2 20종 중 0~1개 (비동기/병렬/안전/삼진/규칙기반…)슬롯= RPN슬롯 5종 고정:작업(962)/대상(314)/수식(214)/조건(60)/연결(50). 값은 리터럴 또는 중첩 의미어코드(=조합).
lisp(충돌감지 대상:플레이어 대상:장애물) ; 단일
(셀생성.비동기 대상:사용자맵 작업:(키설정 대상:id 연결:값)) ; 수식+중첩
(호출:피보나치 입력:10) ; L3 FAB, @테스트 10→55 자기검증
2.3 두 표현면 — 텍스트(교환) ↔ 큐브(연산)
텍스트 1단위는 결정론적으로 1개 큐브(27트릿)로 해석. 의미어임베딩.한선의 존 레이아웃: T[0..8] 긍정데이터 9 / O[9..17] 명령 9 / A[18..23] 부정·체이닝 6 / U[24..26] 이관 3, 트릿 1→T / -1→A / 0→O, 음플래그는 큐브와 별도. 임베딩_조회/임베딩_역조회로 무손실 왕복.
2.4 검증 — 3단 게이트 (값싼 것부터)
- 구문: 괄호 균형, 슬롯∈5종, 수식∈20종 → 위반 시 hard reject.
- 어휘: head∈1603 ∨ 호출체∈3254 → 미스 시 거부 아님, 음 강등.
- 타입: 의미어사전
인자|반환타입정합. FAB는@테스트로 자기검증.
2.5 하위호환 불변식
- id = 행번호 = 불변, 어휘 추가는 append-only → 구 시퀀스 영구 유효.
@어휘핀 불일치 시 거부 않고 교집합 모드(없는 id는 음) graceful degrade.- 메이저 버전업(v2)은 슬롯 5종/큐브 존 레이아웃 변경 시에만.
3. "AGI 결" 규칙코어 — 일반성과 경계
3.1 "결"의 정의
결 = 닫힌 의미어 공간 위의 결정론적 추론 클로저. 만능 oracle이 아니다. 세 가지만 보장: 인과추적·결정론·정직한 모름(음 이관).
3.2 무엇이 일반적인가 (커버 ON — 티옴타 결정론)
- 조합 일반화: 3,254 FAB × 105 조합규칙 = 374,400 합법조합. 새 자연어 표현이 아니라 새 로직 조합을 처리. 처음 보는 조합도 규칙 공간 안이면 연산.
- 코드생성: 매니페스트→서버/핸들러,
컴포저.한선 조립이 byte-identical 보장 (노트장 57ms·토큰0 실증). - 규칙판정: 조건→변경,
셀코어.han 룰체인실행(고정점까지) — 의사결정·거버넌스 정본. - 구조화연산·계산: CRUD·맵·셀·배열·직렬화·고정소수점·3진산술 (VM 함정 준수: 나눗셈 자연반올림·정수 오버플로·배열 GC 없음).
3.3 무엇이 경계인가 (커버 OFF → 음 이관, 메타규칙 자동 판정)
- 1603 색인 밖 어휘 → 인코더(LLM)로 반환 + 새 의미어 학습요청
- 룰체인 0회 적용(발동 규칙 없음) → 음
- 컴포저 핸들러 미해결 → 501 stub → learn/SLM MISS → 음
- 후보 생성됐으나 그림자 hanseonc 컴파일 실패 → 음 강등 (★환각이 라이브로 새는 것 차단)
- 유창성·세계지식·열린질문 → 애초에 코어 영역 아님, 디코더 몫
3.4 결정론 + 인과추적
- 결정론:
결정론경로.한선계약 — 동일 입력→동일 출력. learn DB는 SHA256(정규형) grep 직접반환(생성 없음→항상 동일), 컴포저는 템플릿 조립(LLM 없음). 로그입력해시|경로|규칙ID|결과해시|타임스탬프. - 인과추적: 매 회차
감사로그에 발동 규칙 누적,룰설명이 "AND 슬롯[x]>=v → 통과(실제=…)" 텍스트 출력. 출력 1트릿마다 어느 규칙이 왜 발동했는지 역추적. - 음 경로만 비결정: 음필터는 방향 고정·세부 변동(양자). byte-identical을 약속하지 않고 범위·방향만 보증. 결정론 주장은 티옴타 경로 한정 — 이 분리가 정직성의 핵심.
3.5 재귀 안전 경계 ("로직으로 로직으로 로직")
- 규칙체인 반복(런타임):
이번적용==0고정점 탐지 내장 → 수렴 보장, 깊이 무제한 안전. - 메타규칙 재추출: L2까지 안전(374,400 유한·검증가능). L3+는 그림자컴파일 통과 산출만 다음 층 승격 — 검증 게이트가 곧 깊이 안전판.
- 자생 수렴(학습): 음→채움→learn add→다음 사이클 티 자동수렴. 외부 시간축이라 발산 없음.
4. breadth 갭 해소 논증
4.1 "65 seed 병목" 결론 정정 (실측)
Track B의 "65 seed 병목"은 의미어임베딩.한선 한 모듈의 시드 사전일 뿐이며 전체 코어 자산이 아니다. 실측 정정:
| 잘못된 전제 | 실측 (디스크 확인) |
|---|---|
| "어휘 65개 병목" | 1,603 색인 + 3,254 FAB + 105 조합규칙(374,400 합법조합) + 148,825 학습줄 + 3,083 매핑 |
| "임베딩이 코어" | 임베딩(45KB)은 큐브 왕복 모듈일 뿐. 연산 코어 = 셀코어(96KB)+컴포저(38KB)+결정론경로 |
4.2 분업이 양쪽 우위를 동시에 갖는 이유
기존 "breadth=LLM 승" 갭은 이기려는 프레임이 틀렸다. 봉합은 경쟁이 아니라 역할 분리로 양쪽 우위를 합산한다:
LLM 단독: breadth ✓ 유창성 ✓ │ 인과 ~0% 재현 ✗ 비용 高
크라우니 단독: breadth ✗ 유창성 ✗ │ 인과 100% 재현 ✓ 비용 0
─────────────────────────────────────────────────────────────
봉합: breadth ✓ 유창성 ✓ │ 인과 100%(코어구간) 재현 ✓(코어구간) 비용 20~200배↓
└ LLM이 메움 └ 크라우니가 메움
- 유창성·세계지식·열린 폭 = LLM이 인코더/디코더에서 100% 담당. 크라우니는 만들려 하지 않는다.
- 인과·결정론·에너지(음) = 크라우니 코어가 닫힌 어휘 위에서 100% 보장. LLM은 못 준다.
- 경계선 = 음(U): §2.4/§3.3의 음 강등이 곧 "영혼(규칙)/육체(LLM)" 경계. 등록 어휘는 결정론, 미등록은 LLM 유창성으로 흐릿하게 통과 → 갭이 사라지는 게 아니라 각자 강점 영역으로 라우팅된다.
5. ★완성 계획★ — 빠진 글루 최소목록 + 첫 E2E 데모
5.1 이미 존재하는 실자산 (재사용, 신규 작성 불필요)
의미어임베딩.한선,의미어색인.한선— 큐브 왕복·역조회결정론경로.한선,음필터.한선,음필터공백슬롯.한선,티옴타좌표.한선— 이중경로의미어패킷.한선,크라우니코어_디스패처.한선— E2E 패킷/4경로 (컴파일 완료)컴포저.한선(조립),셀코어.han(룰체인실행),e2e파이프라인.js(포트 9955 글루)
5.2 빠진 글루 — 최소 4개 (메인세션 직후 구현 명세)
| # | 산출물 | 위치 | 명세 | 의존 |
|---|---|---|---|---|
| G1 | 임베딩_사전생성 확장 | 의미어임베딩.한선 수정 | 현재 60+ 시드 적재 → 의미어_index.dat 1603행 로더로 교체. 행 파싱 의미어\|도메인\|서브토픽\|품사\|KPS\|RPN슬롯 → 큐브화. append-only. | 의미어_index.dat |
| G2 | 의미어코드_파싱 + 의미어코드_큐브화 | 의미어패킷.한선에 추가 | §2.2 텍스트 S-식 → 맵{head,수식,슬롯,음,중첩} → 큐브벡터. 미등록 head면 음=1, U존 점화. 함정: 부분(s,시작,글자수(s)) (N=배타적 종료인덱스) | G1, 임베딩_조회 |
| G3 | 프로토콜_검증 (3단 게이트) | 의미어패킷.한선에 추가 | §2.4. 반환 맵{통과[큐브화], 음강등[{줄,후보,거리}], 거부[{줄,단계,사유}]}. 어휘 미스=음강등(거부 아님), 구문/타입만 hard reject | G2, 임베딩_역조회 |
| G4 | 의미어코어결의 래퍼 + 의미어적재 + 셀상태를_의미어코드로 + 디코딩_메타동반 | 크라우니코어_디스패처.한선에 추가 | §3.2 데이터흐름 A~G. 적재→도메인게이트→룰체인실행(고정점)→감사→OUT. 미해결 시 음이관. 디코딩 메타는 의미어_index 4·2·6·5번 필드 주입 | 셀코어.han, 결정론경로, 음필터 |
- semantic_map.dat 3필드→5필드 (
||@ARG타입|@RETURN타입append, 3083행 자동화) - L3 메타재귀 게이트를 501브리지 그림자검증에 명시 연결 (현재 미배선)
5.3 첫 E2E 데모 — "배열에서 가장 큰 값을 찾아줘" (실 자산)
입력(자연어): "배열에서 가장 큰 값을 찾아줘"
[Stage 1] LLM 인코더 (Haiku, 폴백=키워드매칭)
normalize(synonyms.dat) → "배열 최대 검색"
학습.dat grep "검색|최대" → 후보 도출
출력: (검색.없음 대상:배열 작업:최대)
@어휘 index:1603 fab:3254 원문해시:4712c11f
[Stage 2] 크라우니 SemCore (LLM 0회, ~5ms)
의미어코드_파싱 → {head:검색, 슬롯:{대상:배열,작업:최대}, 음:0}
프로토콜_검증: head∈1603 ✓, 슬롯∈5종 ✓ → 통과
의미어코어결의: 도메인=배열 게이트 → learn HIT(SHA256 grep)
→ 4상=티, 경로=learn_HIT, 결과=한선씨 코드(byte-identical)
감사로그: 4712c11f|learn_HIT|20260628...|티|검색 → /tmp/크라우니_인과체인.log
[Stage 3] LLM 디코더 (Haiku, 폴백)
디코딩_메타동반: #품사:동작 #도메인:배열 #슬롯:작업 #검증:byte-identical
출력: "[검색] 배열 최댓값을 찾는 코드를 완성했습니다 (경로: learn_HIT)
\n함수 최대값(arr){...}\n```\n인과추적: 4712c11f → 규칙ID 20260628..."소요: ~216ms (LLM 폴백), 코어 구간 ~5ms 토큰0 재현: 같은 의미어코드 IN → 같은 인과ID·같은 코드 OUT ```
검증 게이트(데모 합격 기준):
/tmp/크라우니_인과체인.log에원문해시|경로|인과ID|4상|의미어1줄 기록 ✓- 동일 IN 2회 실행 → 코어 OUT byte-identical ✓
- 환각 head(예
(존재안함어휘 …)) 입력 → 거부 아닌 음 강등 + 최근접 후보 제시 ✓ - 코어 구간 LLM 호출 0회 확인 ✓
6. 단계 로드맵
| 단계 | 범위 | 산출 | 검증 게이트 |
|---|---|---|---|
| 즉시 (1세션) | G1~G4 글루 + 첫 E2E 데모 | 데모 1건 그린 | §5.3 게이트 4종 통과, 코어 byte-identical |
| 중기 (수 세션) | 의미어코드 커버리지 활용 | ① 학습.dat 토큰0 적중률 누적(검증통과분 자동 append) ② 의미어캐시 활성화 ③ decompose.sh 복합의도 분해(다단 결선) ④ 도메인 필터로 Haiku 토큰절감 | 토큰0 적중률 ≥70% 측정, 비용 ~$0.61/일(1000호출) 실측, 환각 음강등율 측정 |
| 장기 | 토르(Jetson) 온디바이스 코어 | 크라우니 코어 구간(룰엔진+컴포저+learn grep)을 엣지 SLM 노드로. LLM 인코더/디코더는 클라우드 유지(폭 담당) | 코어 구간 토큰0이므로 온디바이스 적합(하드웨어비교 R4티 부합), 인과로그 동등성 검증 |
7. 솔직한 리스크
- LLM 인코딩 환각 (의미어 위조): 닫힌집합 1603/3254 정확일치 대조로 반드시 걸린다(자유생성 불가). 다만 LLM이 틀린 등록 의미어를 고를 수 있음(위조 아닌 오선택) → 타입검증(V3)+FAB
@테스트자기검증으로 2차 차단. 완전 차단 아님 — 오선택은 디코더 단계까지 갈 수 있고, 이때는 사용자 재질의로만 잡힘.
- 왕복 의도 손실: 자연어→의미어코드→자연어 2회 LLM 변환. 미등록 개념의 음 강등은 의도 일부를 흐릿하게 통과시킴 → 디코더가 자유서술로 메우나 원의도와 어긋날 수 있음. 완화:
원문해시필드를 코어 통과시켜 원본↔출력 인과 연결, 그러나 의미 보존 자체는 보장 못 함.
- 크라우니 커버영역 한계: §3.3 경계 밖은 전부 음. 현실 작업의 상당 비율이 코어 영역 밖(열린 추론·세계지식)이면 코어 기여도가 낮아짐. 코어는 "코드생성·규칙판정·구조화연산·계산"에서 강하고 그 밖은 LLM 의존. 과대평가 금지 — 코어가 전 작업을 결정론화하는 게 아니라 특정 도메인만.
- 거대SLM2 = 분류기:
거대SLM2.한선은 분류기이며 생성은 미검증. 그래서 생성경로는 SLM이 아니라 컴포저(결정론)+learn(재현)이 담당, SLM은 음 경로 후보제안에만 쓰고 반드시 그림자컴파일로 거른다. 역전파 opcode 공백·VM 학습 느림 → 코어는 "학습"이 아니라 "규칙적재+조합", 학습은 외부 learn.sh·셀코어 룰추출(오프라인) 위임.
- 글루 미구현 정직 고지: G1~G4(
임베딩_사전생성1603 로더 확장,의미어코드_파싱/큐브화,프로토콜_검증,의미어코어결의/의미어적재/셀상태를_의미어코드로)는 본 설계의 신규 시그니처로 아직 미작성. 재사용 기반(임베딩_조회/역조회,룰체인실행,컴포저 조립,의미어패킷/크라우니코어_디스패처스켈레톤)은 실존·컴파일 완료. L3 메타재귀↔501브리지 그림자검증 배선과 1603 밖 어휘의 LLM 재호출 규약은 미정의.
봉합 결론: 4설계는 모순 없이 하나의 파이프라인을 이룬다. 경쟁 프레임("LLM을 이긴다")을 역할분리 프레임("음 경계로 라우팅")으로 교체하면 breadth 갭이 해소된다. 인과 100%·재현은 크라우니 코어 구간에 한정해 정직하게 주장하고, 종단 유창성은 LLM에 위임한다. 즉시 실행 항목은 G1~G4 글루 4종과 §5.3 E2E 데모 1건이며, 모든 재사용 기반은 디스크에 실존함을 확인했다.
관련 실파일(절대경로): /Users/ef/crowny-butler/libs/{의미어임베딩,의미어색인,의미어패킷,크라우니코어_디스패처,결정론경로,음필터,음필터공백슬롯,티옴타좌표,거대SLM2}.한선, /Users/ef/crowny-services/컴포저.한선, /Users/ef/Downloads/CrownyTVM/std/셀코어.han, /Users/ef/CrownyOS/crownyc/data/crownycode/패턴/의미어_index.dat(1603), /Users/ef/crowny-win-pkg/크라우니코드셋/intent/의미어사전.dat(105), /Users/ef/Downloads/CrownyTVM/crownycode-improved-backup-20260527181441/fab/의미어.dat(3254), /Users/ef/.crownycode/학습.dat(148,825), /Users/ef/crowny-butler/e2e파이프라인.js(:9955).