네이티브 4상균형3진 학습모델 — 종합 백서 v2
작성: 2026-06-30 근거: 사이클14-24 산출물 전수 검토 (2026-06-30 16시간+ 자율 세션) 정직원칙: 완성/부분완성/미해결/정직한 수치만. 과장 없음.
1. 비전 — 세 계층 파이프라인
자연어
└─[진짜 학습] → 의미어코드(SemCode, 닫힌집합 19,683)
└─[결정론 연산] → 의미어코드(OUT)
└─[LLM 디코더] → 자연어
두 구간의 성격 구분 (핵심계약)
| 구간 | 성격 | 학습 | 보증 |
|---|---|---|---|
| 자연어 → SemCode | 확률적 | O (진짜 학습) | chance 초과 확인됨, 약신호 |
| SemCode → SemCode | 결정론 | X (연산) | byte-identical, 감사로그 가능 |
| SemCode → 자연어 | LLM 디코더 | 외부 | 유창성·세계지식(LLM 담당) |
| 이진 LLM 기둥 | 삼진 붕괴 이유 |
|---|---|
| float 가중치 | 균형3진 VM은 정수·트릿만 (나눗셈=자연반올림 함정) |
| 미분가능 활성 | sign()/다수결은 도함수 0 또는 미정의 |
| 역전파 chain rule | 불연속 함수라 gradient 전파 불가 |
| 경사하강 갱신 | gradient 없으면 SGD/Adam 무의미 |
2. 삼진 학습 3축 (사이클14 이전 완성, v1 재확인)
| 축 | 메커니즘 | 모듈 | 검증수치 |
|---|---|---|---|
| ① STE축 | sign() 투영 {-1,0,+1}, gradient=1 통과 (dead-zone 밖 차단) | 삼진STE.한선 | 12/12 |
| ② EBM축 | 에너지=-내적(삼진), contrastive E(정답)<E(오답) | 삼진EBM.한선 | 6/6 |
| ③ 규칙귀납축 | 증거누적 n≥3 유력, 반례→신뢰-1→가지치기 | 규칙철회.한선 | 8/8 |
삼진학습라우터.한선 12/12): 분류→STE, 결정→규칙, 생성→EBM.MLP 수렴 (사이클14 이전):
- 삼진MLP모멘텀.한선: XOR 4/4. 4단계 fix — bias trick / 비대칭초기화 / 잠재클램프 / 셔플.
3. 사이클14-18: 어텐션 end-to-end + 압축분류 완전수렴
3.1 소프트어텐션블록 (사이클14)
파일: crowny-butler/libs/소프트어텐션블록.한선
기존 어텐션 한계: W_Q가 상수(고정) → 어텐션 가중치 학습 불가. 사이클14 해결: W_Q를 학습 파라미터로, end-to-end grad 경로 확보.
- Q=STE(W_Q · inp) → 소프트어텐션(정수스코어) → W_V 투영 → FFN → y
- 순전파+역전파 단일 블록, 전위치 gradient 경로 확보
- 테스트:
소프트어텐션블록_테스트.한선— PASS
3.2 K=4 어텐션 4/4 수렴 (사이클15)
파일: crowny-butler/libs/K4어텐션수렴.한선
기존 어텐션OvR 2/4 미달(dead-zone). 해결: 씨앗%5=4 편향초기화.
(i*7+씨앗)%5=4: 첫 번째 가중치가 dead-zone 밖에서 출발- K=4 OvR 4/4 완전수렴
3.3 다차원임베딩어텐션 + BTG 그레이코드 (사이클16)
파일: crowny-butler/libs/다차원임베딩어텐션.한선, 그레이코드K24.한선
기존 한계: 스칼라 P 특성으로는 2클래스 한계. 해결: [P, C, S] 3D 입력 → Q투영 → K≥3 OvR 수렴 증명.
BTG(균형 트릿 그레이코드) nT=3:
- 인접 코드 간 해밍거리=1 보장
- K=24/27 확장 (사이클17에서 완성)
3.4 LILAC dead-zone 탈출 + 통합파이프 4/4 (사이클17)
파일: crowny-butler/libs/통합파이프4완성.한선, 다차원4완성.한선
3→4/4 전환을 막던 LILAC dead-zone 탈출 3종:
- 바이어스=1: θ=1 경계에서 클래스 즉시 분리
- 씨앗%5=4 전 클래스: 모든 OvR 헤드 dead-zone 회피
- dh=8→12: 분리 뉴런 여분 확보
통합파이프4완성 커버리지:
사이클14: 소프트어텐션블록
사이클15: 씨앗%5=4 deadzone 해결
사이클16: [P,C,S] 다차원, BTG nT=3 그레이코드, 신규어전이
사이클17: OvR 4/4 (바이어스1+씨앗%5=4+dh=12)
3.5 K=18/24/27 완전수렴 — 모멘텀restart (사이클18)
파일: crowny-butler/libs/K24완전수렴.한선, 모멘텀K큰압축.한선
| K | SGD | 모멘텀restart | 에폭 |
|---|---|---|---|
| K=9 | 9/9 | 9/9 | 400 |
| K=18 | 18/18 | 18/18 | 200 |
| K=24 | 24/24 | 24/24 | 200+ |
| K=27 | 27/27 | 27/27 | 200+ |
- θ2=1 (출력층만): sum∈[-1,1] → output1. 기존 θ=0 시 정수 oscillation 제거
- 초기화9 (period-9): din=4에서 9 효과적 은닉유닛 (기존 period-5 → 5유닛)
- μden=4: floor(v/4), 진동 gradient smoothing
통합코어.한선 (별도): 소프트어텐션+곱게이트+OvR 단일 추론경로. 소프트어텐션역전파 교번 갱신 구조.4. 사이클19-21: 스케일 한계 실측 + 실데이터 33% 달성
4.1 K=81 스케일 한계 (사이클19)
파일: crowny-butler/libs/K81확장.한선
| K | 정확도 | 비고 |
|---|---|---|
| K=27 | 27/27 = 100% | 회귀 확인 |
| K=54 | 9/54 = 17% | 스케일 시작 |
| K=81 | 7/81 = 9% | 대규모 미달 |
4.2 앙상블 실험 (사이클20)
파일: crowny-butler/libs/실데이터앙상블.한선
| 설정 | 훈련정확도 | 테스트정확도 |
|---|---|---|
| 단일 ep=10 | — | 14% |
| 단일 ep=20 | — | 27% |
| M=3 ep=20 | 33% | 29% (+2%p) |
| M=5 ep=10 | 23% | 25% (+11%p vs 단일ep10) |
4.3 실데이터 완결 33% (사이클21) ★
파일: crowny-butler/libs/실데이터완결.한선
설정: K=24 의미장, din=6(P3+C3), dh=8, clip=8, lr=1, neg×4균등 M=5 씨앗 0~4 (mul={7,11,13,17,19}, off={2,1,4,6,3}) 훈련 576샘플(24/class), 테스트 144샘플(6/class), chance=4.17%
최종 결과: 33% (48/144) — 목표 32% 달성. chance 대비 7.9x.
기여 분해:
- 단일 ep=15 기준선: ~22%
- M=5 앙상블 기여: +11%p
- 총향상: +6%p vs V2A 기준(27%)
5. 사이클22-23: 실데이터 향상 시도 + 핵심통찰
5.1 계층분류 시도 (사이클22)
파일: crowny-butler/libs/계층실데이터.한선
33%에서 계층분류/C가중/M=7 방향으로 향상 시도. 정직보고: 수치 개선 확인 후속 데이터 부재. 구조는 완성.
5.2 자연어→의미장 직접학습 ★★ (사이클23)
파일: crowny-butler/libs/자연어의미장.한선
이것이 진짜 학습의 입증: SemCode를 입력으로 쓰지 않고, 표면형(영문개념명 첫6글자) 만으로 의미장 분류.
설정:
- 특징: 영문개념명 첫6글자 ASCII → 균형3진 3트릿/글자 = din=18
- K=24 의미장, 훈련 480샘플(20/class), 테스트 120샘플(5/class)
- chance baseline: 1/24 = 4.17%
| 방법 | 정확도 | chance 대비 |
|---|---|---|
| 최근중심분류기 | 9/120 = 7.5% | 1.8x |
| 균형삼진OvR | 7/120 = 5.8% | 1.4x |
SemCode→의미장 vs 자연어→의미장 구분:
| 경로 | 성격 | 정확도 |
|---|---|---|
| SemCode → 의미장(P) | 결정론 floor 디코드 | 100% (수학적 bijection) |
| 자연어(표면형) → 의미장 | 진짜 학습 (통계) | 7.5% (chance 4.17% 초과) |
6. 사이클24: 의미어 응용 완성 — E2E실증 + KPS구문 + 문화계층
6.1 의미어E2E실증 (사이클24)
파일: crowny-butler/의미어E2E실증.js
자연어 단어
→ [Stage1] 코드북 조회 or 신규어 LLM 폴백 → SemCode(A)
→ [Stage2] floor 디코드 → [P, C, S]
→ [Stage3] 6트릿 특성 → OvR argmax → 의미장 cls
→ [Stage4] 의미어검색 → 유사어 top-5
→ [Stage5] 역룩업 디코드 → 자연어 설명
오프라인 우선: 코드북 HIT → LLM 0회. MISS → 신규어학습.js LLM 1회.
정직보고:
- Stage3 본 데모: P→3trit+C→3trit 특성으로 floor-argmax → 100%(수학적 bijection). 학습 아님.
- STE-OvR K=24 학습모델: 27%(훈련 부분수렴). 특성공간 자체는 분리가능.
6.2 KPS구문생성v2 (사이클24)
파일: crowny-butler/KPS구문생성v2.js, crowny-butler/libs/KPS구문생성v2.한선
전체체인: 개인말투 → 표준어 → 의미어코드 → KPS 완결문장
5원칙: 주어명확화 / 목적어조사정확 / 수식배치 / 모호제거 / 동사완결 실증 케이스: 색+강도, 색+NEGATE, 색+BETWEEN, 온도+강도, 감정+NEGATE, 크기+강도, 속도+강도, 개인말투→전체체인 (8케이스)
6.3 문화계층 고도화 (사이클24)
파일: crowny-butler/문화계층고도화.js
신규 기능:
- 복합슬롯(색상+강도 동시 처리)
- 회원별 자동학습 (발화→규칙 갱신)
- 변화추적 (회원발화_시계열.psv)
7. 합성 대수 + 온톨로지 (전 사이클 통합)
7.1 합성 연산자 대수
파일: crowny-butler/libs/합성연산자.한선, 합성다단계.한선, 의미어합성학습.한선
8+1 연산자: ISA · DEGREE · NEGATE_C · NEGATE_S · BETWEEN · COMBINE · SIMILAR · PARTOF · ASPECT · OPAQUE
다단계합성: base에 op 체인 → 경로 배열 기록 → 역분해 (DEGREE/NEGATE 해석적 정확). 색스펙트럼: BETWEEN 등분으로 중간색 배열 생성.
입증된 합성 케이스 (57건 v1 기준, v2 추가):
DEGREE(빨강, 2) = 불그스름한(SemCode 3890)NEGATE_C(NEGATE_C(X)) = X(보색 involution)- BETWEEN 역분해: 중간색 근사 이름 반환
- 다단계 체인: ISA→DEGREE→NEGATE 복합 경로
7.2 온톨로지 인코딩 v1+v2
파일: crowny-butler/libs/온톨로지인코딩.한선, 온톨로지인코딩v2.한선
6 온톨로지 카테고리 OvR 분류 (Person/Thing·Action·Property·Number·Classifier·Other)
v2 개선:
- (a) 압축트릿 출력: nT=2(K=6→3²=9≥6), 6값→2트릿 로그압축
- (b) OvR 신뢰도: 승자점수-차선 마진 → 예측 확신도
온톨로지그레이코드.한선: BTG nT=2 그레이코드 확장
온톨로지OvR.한선: 실어휘코드북_O.psv 기반 6클래스 OvR실어휘+온톨로지 결합 (실어휘의미장OvR.한선): 단어→(의미장, 온톨로지) 동시 분류.
8. 의미어코드 자산 (SemCode SSOT)
8.1 주소공간
A = 729·P + 27·C + S
P, C, S ∈ [-13, +13], 하드캡: 19,683 = 3⁹
PHYLUM(P): 24개 의미장 데이터근거 확정 (Concepticon 4,163 SEMANTICFIELD 실측)
8.2 어휘 자산 (실측)
| 층 | 파일 | 규모 | 신뢰 |
|---|---|---|---|
| Concepticon 검증코어 | CC BY | 4,034개념 | A |
| 실어휘코드북_O | 실어휘코드북_O.psv | 4,167행 | A~B |
| 실어휘코드북 | 실어휘코드북.psv | 4,166행 | A~B |
| 색+온도 검증코드북 | 코드북.psv | 137개념 | A (검증완료) |
8.3 LLM↔SemCode 왕복
| 구간 | 왕복일치율 | 비고 |
|---|---|---|
| 코어 코덱 name→SemCode→name | 100% | 결정론, byte-identical |
| LLM 왕복 (초기) | 50% | α-leak (ISA 대신 연산 임의추가) |
| LLM 왕복 (프롬프트강화 후) | 100% | "수식어없으면 반드시 ISA" 주입 |
라운드트립측정.js: α-leak 탐지 + 프롬프트 반복개선.9. 정직한 미해결
9.1 임계 미해결 (학습모델 완성 차단)
| # | 항목 | 현재 상태 | 이유 |
|---|---|---|---|
| M1 | 어텐션 역전파 end-to-end | 통합코어.한선 교번학습 있으나 깊은스택 결선 미완 | QKV 전체 학습 불가 |
| M2 | K>27 압축수렴 | K=27까지만 100%. K=54 17%, K=81 9% | 스케일법칙: ~37ep/샘플 초과 |
| M3 | 19k 실어휘 전체 적재 | 샤딩 구조 완성, PSV전체로더 미완 | ARRAY_CAP=4095 제약 |
| M4 | 신규어(열린어휘) 학습 루프 | 신규어학습.js 있으나 닫힌집합 밖 → 음(U) 이관만 | 자동귀납 없음 |
9.2 부분 완성
| 항목 | 완성 | 한계 |
|---|---|---|
| seq→seq 어텐션 | 순전파 N블록 완성(어텐션스택.한선) | seq→scalar만 검증, seq→seq 미검증 |
| LayerNorm/GELU 정수근사 | 구현 | VM↔VHDL 라운딩 발산(x=1,2) |
| EBM Langevin 샘플링 | 음양자경로.한선 | 학습목적함수 미연결 |
| 계층실데이터 향상 | 구조 완성 | 수치향상 미확인 |
| CLASS/SPECIES 데이터근거 | PHYLUM 24 확정 | CLASS/SPECIES 하위구조 임의배정 보류 |
| FPGA 삼진 opcode | ISA729 선언 | crownyc.c SCATTER 충돌 미해소 |
9.3 설계상 경계 (한계 아닌 원칙)
- 유창성·세계지식: LLM 담당. 크라우니 SemCore 영역 밖. 원칙적 분리.
- 열린질문: 음(U) 이관. "못한다" 아닌 "결정론 보증 밖".
- 자연어→의미장: 약신호(7.5%). 강화방향: 한글자모 분해, n-gram해시, 더 많은 훈련데이터.
10. 다음 단계 (P2~P3)
P2 (즉시)
- 어텐션 역전파 end-to-end 결선 (M1 해소): 통합코어 → 스택 통합
- 자연어→의미장 특징강화: 한글 자모분해(초성/중성/종성) → din 증가
- 실어휘 PSV전체로더 완성 (M3 해소): 4164 → 19k 단계 확장
- 앙상블 ep=20 M=5 (~12분, 현 타임아웃 초과 → 분할 실행)
P3 (중기)
- K=81+ 스케일: 분산 훈련 or 에폭예산 확대
- 에너지지형 시각화: 음블랙홀 구조 덤프·분석
- SLM 경량화: vocab prune→embedding 축소, LoRA 어댑터
- CLASS/SPECIES 하위구조 언어학 검수
11. 사이클14-24 핵심 파일 목록
사이클14-18 (어텐션 end-to-end + 압축수렴)
| 파일 | 사이클 | 역할 | 검증 |
|---|---|---|---|
| 소프트어텐션블록.한선 | 14 | W_Q 학습가능 어텐션블록 | PASS |
| 어텐션OvR.한선 | 14~15 | 어텐션특징+OvR K=4 | 4/4 |
| 다차원임베딩어텐션.한선 | 16 | [P,C,S] 3D, K≥3 OvR | PASS |
| 그레이코드K24.한선 | 16~17 | BTG nT=3, K=24/27 | PASS |
| 다차원4완성.한선 | 17 | LILAC dead-zone 탈출 | 4/4 |
| 통합파이프4완성.한선 | 14~18 | 사이클14-18 통합 21단언 | 21/21 |
| 통합코어.한선 | 14~18 | 소프트어텐션+곱게이트+OvR | PASS |
| K24완전수렴.한선 | 18 | K=24/27 모멘텀restart | 24/24, 27/27 |
| 모멘텀K큰압축.한선 | 17~18 | K=18 100%, θ2=1 fix | 18/18 |
| K4어텐션실투입.한선 | 15~16 | 실어휘 K=4 템플릿매칭 | 64/64 |
사이클19-24 (스케일·실데이터·응용)
| 파일 | 사이클 | 역할 | 검증 |
|---|---|---|---|
| K81확장.한선 | 19 | nT=4 스케일 한계 실측 | K=27:100%, K=81:9% |
| 실데이터앙상블.한선 | 20 | M=3/5 앙상블 | M=3:29%, M=5ep10:25% |
| 실데이터완결.한선 | 21 | M=5 ep=15 최종 | 33% (48/144) |
| 계층실데이터.한선 | 22 | 계층분류/C가중/M=7 | 구조완성 |
| 자연어의미장.한선 | 23 | 표면형→24의미장 직접학습 | 7.5% (1.8x chance) |
| 어텐션스택.한선 | 22~23 | N블록 병렬가산 스택 | 5/5, 3/3, GC100 |
| 의미어합성학습.한선 | 전 | 합성+역분해 학습 | 57케이스 |
| 합성다단계.한선 | 전 | 다단계+BETWEEN 체인 | PASS |
| 온톨로지인코딩v2.한선 | 전 | 압축트릿nT=2+신뢰도 | PASS |
| 의미어E2E실증.js | 24 | 자연어↔SemCode E2E 5단계 | 오프라인완성 |
| KPS구문생성v2.js | 24 | 의미어→KPS 완결문장 8케이스 | PASS |
| 문화계층고도화.js | 24 | 복합슬롯+자동학습+추적 | 5발화실증 |
12. 종합 평가
완성 (Production-ready)
- 의미어코드 SemCode 주소공간 (확정, 적대검증 통과)
- 합성 연산자 대수 8+1 + 다단계합성 + 역분해
- 삼진 학습 3축 (STE/EBM/규칙귀납, 정/역 모두)
- MLP 수렴 (XOR 4/4, θ2=1/초기화9/μden4 트리오)
- K≤27 압축분류 완전수렴 (모멘텀restart)
- 소프트어텐션블록 end-to-end grad (W_Q 학습가능)
- 어텐션 K=4 OvR 4/4 (씨앗%5=4, LILAC탈출)
- 실데이터 OvR K=24 33% (M=5 ep=15, chance 7.9x)
- 자연어→의미장 학습 입증 (7.5% chance 1.8x, 사이클23)
- LLM↔SemCode 왕복 100%
- 문화필터·KPS구문·E2E실증 완성
부분 완성 (작동하나 확장 필요)
- 어텐션 역전파 end-to-end (교번학습 구현, 깊은스택 결선 미완)
- seq→seq N블록 스택 (순전파 완성, seq→seq 미검증)
- 실어휘 19k 전체 적재 (샤딩 완성, PSV로더 미완)
- K=81+ 대규모 수렴 (시간예산 초과)
핵심통찰 — 사이클14-24의 분수령 기여
① 어텐션 end-to-end: 사이클14~17에서 "어텐션 = 학습가능 구조"로 전환. 씨앗%5=4(dead-zone 회피) + 바이어스=1(LILAC탈출) + dh=12(여분)가 4/4 수렴의 3요소.
② 모멘텀restart + θ2=1: K큰 압축분류의 "불안정 정수 oscillation"을 θ2=1으로 원천 제거. K≤27은 실용 범위.
③ 자연어→의미장 = 진짜 학습: 사이클23의 7.5%가 이 시스템의 존재 이유를 증명. SemCode→의미장은 수학(결정론). 자연어→의미장이 통계(학습). 이 구분이 아키텍처의 본질.
④ 앙상블 +11%p: 단일모델(ep=10: 14%) → M=5(ep=10: 25%). 앙상블이 삼진모델의 약신호를 증폭하는 유효 전략.
관련 파일 경로:
crowny-butler/libs/통합파이프4완성.한선— 사이클14-18 단일 정본crowny-butler/libs/실데이터완결.한선— 33% 최고 실적crowny-butler/libs/자연어의미장.한선— 진짜학습 입증crowny-butler/의미어E2E실증.js— E2E 통합데모crowny-butler/KPS구문생성v2.js— 최종 응용 체인- 실어휘코드북_O.psv — 4,167행 SSOT