크라우니 음성-코드 연결모델 (Voice → Code)
음성인식 → 자연어 → 의미어 → 한선씨코드. 크라우니 LLM/SLM + 양자추론(MPS/Grover/큐트리트) 적극 사용. 2026-07-04 착수. 오푸스 아키텍팅 + 속행집사 병렬.
큰 그림
[음성 WAV]
↓ STT (기구축: 원시U디코드) — 4상 트릿, O슬롯 전파
[확정음절 + O슬롯후보] ← 불확실성을 argmax로 죽이지 않고 격자로 보존
↓ 격자 전개 (격자.한선)
[자연어 후보격자] — O슬롯 조합 = 후보 한글 시퀀스 집합 (조합폭 상한)
↓ 의미어 매핑 (의미어연결.한선, crowny-base 재사용)
[의미어 후보공간] — 닫힌 어휘(~수만 코드), 벡터형 4상3진, 미등록 버림
↓ ★양자추론 (양자탐색.한선 — Grover 오라클/확산 + 큐트리트)
[최우도 의미어 시퀀스] ← O슬롯 해석격자를 √N 탐색으로 붕괴
↓ 의미어 → 한선씨 코드젠 (템플릿 결정론)
[한선씨 코드] → crownyc VM 실행 → [결과]
왜 양자가 진짜로 쓰이나 (라벨 아님)
STT의 O슬롯 K개 × 후보 C개 = 최대 C^K 해석경로. 고전 탐색 O(C^K).
- Grover(상벡오라클 911 + 확산 912): 오라클 = "유효 의미어 명령인가 + 문맥정합" → 진폭증폭 → √(C^K) 탐색.
- 큐트리트(928-931): T/O/A 트릿을 3준위 양자로 네이티브 표현 — 삼진 구조와 동형(2진 인코딩 오버헤드 0).
- MPS(918-925, χ=128): 저얽힘 대규모 상태 — "8000큐비트"의 물리적 근거(2^n 저장 아님, n·χ²·d 텐서).
정직 게이트 (토르 교훈: 목표라벨≠달성라벨)
각 단계는 실측 검증된 것만 채택. 특히:
- 양자: Grover 실측 측정확률·MPS 실동 최대 큐비트를 숫자로. "8000"이 안 돌면 도는 수치로 정정.
- 의미어→한선씨: 생성코드가 실제 컴파일·실행돼야 채택(crownycode agent 폴백=garbage 금지).
- 해소: O는 O로 유지, 해소는 "제안"(신뢰도맵 불변).
모듈
| 모듈 | 파일 | 담당 | 상태 |
|---|---|---|---|
| 격자 전개 | 격자.한선 | 메인(오푸스) | 착수 |
| 의미어 연결 | 의미어연결.한선 | 속행집사 | 조사중 |
| 양자 탐색 | 양자탐색.한선 | 속행집사 | 조사중 |
| 오케스트레이터 | 연결모델.한선 | 메인 | 대기 |
| STT (입력) | crowny-voice/* | 기구축 | 완료 |
진행 (2026-07-04)
- 지반조사 실측: 양자 실재(MPS χ=128·Grover 오라클911/확산912·큐트리트928-931 삼진네이티브) / 의미어 실재(crowny-base 의미어매핑.한선 + crowny-butler 파이프) / 자연어→의미어 추출 작동, 의미어→한선씨 폴백=garbage(직접 템플릿으로 대체).
- 결정론 백본 완성·검증: 격자.한선(O슬롯 카테시안 전개, 2슬롯→4조합)·관용매칭.한선(편집거리 스냅, 상대임계로 과잉스냅 버그 교정: "3"→"합" 차단)·의미어연결.한선(닫힌어휘35, E2E 5/5 컴파일실행)·연결모델.한선(격자에서최선=고전 총거리최소 탐색). E2E: ["?","안녕"]+후보["추력","출력","출격"]→정확히 "출력" 선택→
출력값("안녕")실행가능. 2슬롯→반복문 i 부터 0 까지 3 { 출력값("야") }. - 양자 자리 확보: 격자에서최선의 고전 탐색을 양자탐색.한선 Grover가 √N 대체(플러그인 지점 명확).
- 병렬 진행: 양자탐색.한선 실증(Grover 측정확률·MPS 8000큐비트 진위·큐트리트) / 명령어휘 STT 학습(12명령어 실오디오 관통).
관통 데이터모델
토큰열(일부 "?" O슬롯) + 슬롯후보 → 격자전개 → 각 후보 총편집거리 채점 → 최소 선택 → 명령을한선씨. 숫자·OOD=인자 통과(오확정0 원칙). 어휘 스냅은 상대임계(거리<토큰길이)로 짧은 인자 보호.★전체 관통 완결 (2026-07-07)
- 양자 실증(정직 교정): Grover 상태벡터 94% 실측(다중타깃 유효집합 25%→96% 증폭). MPS 클램프 1024(8000 아님). 8000큐비트=스태빌라이저(914,≤16384,Clifford전용)≠MPS, Grover와 동시불가 — 라벨 교정(reference_crownyc_quantum_engines 메모리). 큐트리트931=심플렉틱(유사도는 해밍 별도). 양자탐색.한선·양자연결.한선 검증.
- 양자 격자필터 배선: 음성을코드양자() — 잡음 격자 유효집합 Grover증폭 → 고전 최소거리. 실측 잡음8후보→유효3→94%증폭→출력값("안녕").
- 명령어휘 STT: 12명령어 학습(top1 91.7%, 오확정0). 실오디오 3/3 top1.
- ★진짜 음성→실행코드 완결: 실오디오관통.한선 —
출력_demo.wav(실 say오디오,rate190 novel) → 인식(출력,판정O,후보) → O슬롯격자 → 양자필터 →출력값("안녕")→ 컴파일·실행 → "안녕" 출력. 실버그교정: v2 후보집합이 top1 누락 → top1 앞세움.반복_demo→반복 정확선택+인자부족 정직플래그(garbage 아님). - 한계(정직): 인자(안녕/out.txt)는 오픈보캐라 STT 미인식(음성UI서 제공 가정). 반복/만약 등 제어구조는 다슬롯 음성입력 필요. 명령어휘 12/35. 양자 validity필터는 유효집합 작을 때만 유효(전부 vocab이면 no-op, 음향순위가 disambiguate).
전체 사슬 (완결)
음성WAV → [명령어휘STT: 인식+O슬롯후보] → [격자: O슬롯 전개] → [양자필터: Grover 유효집합 증폭] → [관용매칭: 어휘스냅] → [의미어연결: 템플릿 codegen] → 한선씨코드 → [crownyc VM] → 실행. 전 단계 실측검증, 오확정0 원칙 유지.4대 순서작업 (2026-07-07)
- #2 다슬롯 음성명령(제어구조) 완료: 발화.한선(원시U 경계를 단어레벨로 — 최대프레임 200→700 절단버그 교정, 발화2 "출력.쓰기.반복." 3세그 분할)·문법.한선(토큰유형 제어/명령/숫자/인자, 제어구조 문법점수, 한글숫자 삼→3)·다슬롯.한선(다슬롯 격자→문법최선). 실증: 문법이 나쁜 top1(야)을 극복해 제어동사 반복 복원 + 반복문 코드 실행(야×3). 잔여: 동일카테고리 동사(읽기 vs 출력) 구분은 음향 필요=#3.
- #3 양자 오라클=음향점수 완료: 양자음향.한선 — validity 아닌 음향(트릿내적)+문법 plausibility로 격자 후보서열 채점 → 상위K 마킹 → Grover 증폭. 실증: #2가 top1오류로 읽기 선택한 자리를 #3 음향이 출력 복원([반복,3,출력,야]→출력값), Grover 상위3 마킹 935‰ 증폭, 반복문 실행. 세그벡터 노출(발화인식). = "양자 오라클을 음향점수로" 실현(정답 미지 상태에서 고plausibility 진폭집중).
- #1 45어휘 STT: 에이전트 진행중(35명령어+10숫자, 다슬롯 제어구조의 숫자인자 공급).
- #4 MPS 패치 승격: 대기 — crownyc 재빌드가 #1 컴파일과 경합 + 최고위험 프로덕션(전 서비스 VM)이라 #1 완료 후 단독 실행. 패치 미승격 확인(계수필드 0), 재베이스 필요(패치 헤더=/tmp 스냅샷 경로).
★4대 순서작업 전부 완료 (2026-07-07)
- #1 45어휘 STT: 명령35+숫자10, top1 62.2%(12→45클래스로 하락, 39차원 고정 한계 정직), 오확정0 유지. 혼동=1음절 숫자↔다음절명령(비침묵프레임 적음). 권장임계 마진2 유지. libs/명령어휘모델45.한선.
- #2 다슬롯 제어구조: 발화분할(200→700프레임 캡 교정, 3세그)+문법(제어구조 채점·한글숫자)+다슬롯. 문법이 나쁜top1(야)→반복 복원, 반복문 실행.
- #3 양자 음향오라클: 음향(트릿내적)+문법 plausibility 마킹→Grover 증폭. #2가 놓친 출력을 음향이 복원, 상위3 935‰ 증폭.
- #4 MPS/계수필드 opcode 승격: 옛 패치 opcode 881이 병렬세션에 점유(음재생/AUD_PLAY2)됨을 발견→944로 재유도해 정본 crownyc 승격. 죽은코드470~479는 병렬세션이 881~889 재배치로 기해결(deadcode패치 폐기). 40/40 핵심회귀 바이트동일·opcode944 작동·로컬 전체스택(stunnel8443→게이트웨이→voice) 200·백업 /tmp/crownyc_backup_944. quadcode 원자스왑 무중단. ⚠️공개 HTTPS 000은 별개 외부이슈(NAT헤어핀/라우터, crownyc무관, 로컬8443=200 확인).
완성 사슬 (양자 disambiguation 3층)
음성 → STT(O슬롯) → 격자전개 → [1]양자 validity필터(비vocab 제거) → [2]문법(비문 제거) → [3]양자 음향오라클(동급 tie 해소, Grover 증폭) → 의미어 codegen → 한선씨 실행. 3층이 순차 정밀화, 오확정0 유지.잔여/리스크
- STT 음향모델이 토이(30클래스 50%) → 닫힌 명령어휘로 제약하면 정확도↑ (의미어가 상류 STT를 제약).
- 양자 오라클을 의미어 유효성으로 실제 구성 가능한지 = 임계 미지수.
- 프로덕션 crownyc 무수정 (quadcode).
진행 (2026-07-04, 명령어휘 STT 학습 — 상류 완성)
목표: STT를 12개 대표 명령어휘(출력/쓰기/읽기/반복/만약/서버/변수/함수/더해/빼/곱해/나눠, 의미어연결.한선 어휘 중 대표)로 학습해 실오디오 음성→명령어 인식 관통 증명.
코퍼스: say -v Yuna -r {120,140,180,220,260} "<단어>" + afconvert LEI16@16000 mono → 60 WAV.
저장: /private/tmp/claude-501/-Users-ef/38950a42-7c49-4f50-8ade-1d7feb8042ec/scratchpad/cmdcorpus/(스크래치, 세션종료시 휘발 — 재현은 스크립트로 즉시 가능).
학습: crowny-voice 템플릿학습v3_음절.한선 방식 그대로 계승(log멜+3구간분할=39차원, 델타 미사용, 단어당 프로세스 분리 실행 → 배열힙/버퍼슬롯 고갈 회피). crowny-voice libs(특징추출/WAV읽기/삼진양자화/음향모델삼진/클립분류v2)는 무수정 — cat으로 조립 컴파일(가져오기 검색경로 밖이라 소스 결합 방식 채택).
- 신규 도구:
/Users/ef/crowny-voicecode/tools/명령어휘학습.한선→ 훈련 4클립(120/140/220/260) 합산 절대임계 양자화 - 신규 모델:
/Users/ef/crowny-voicecode/libs/명령어휘모델.한선—명령모델생성()12클래스, 8음절 모델(음소템플릿v2)과 동일 맵구조·39차원
전체=12 top1(예측==진실)=11/12=91.7%
판정=1(T확정) 5건 → T정답률(확정중)=100%(5/5), 오확정=0/12(0%)
판정=0(모름) 7건 → 모름율=58.3%, 그중 후보에 진실 포함=3/7=42.9%
정직 평가: top1은 높으나(91.7%) 보수적 임계 탓에 확정(T)은 5/12뿐 — 나머지는 O(모름)로 보류(오확정 0 원칙 지킴). 8음절 모델과 동일 임계를 12클래스·명령어(음절수 상이)에 그대로 적용해 임계 재튜닝 여지 있음.★실오디오 관통 데모 (신규 rate=190, 훈련/홀드아웃 어디에도 없는 새 녹음 3개):
출력_demo.wav: 예측=출력 판정=0(모름) 마진=0 점수=8 후보=[출력,만약,서버]
반복_demo.wav: 예측=반복 판정=0(모름) 마진=0 점수=6 후보=[출력,쓰기,읽기]
쓰기_demo.wav: 예측=쓰기 판정=1(확정) 마진=5 점수=10 후보=[쓰기]
3개 전부 top1 예측은 정답과 일치. 단 "출력"·"반복"은 마진=0(동률 최고점)이라 O로 보류(오확정 방지 정직 동작), "쓰기"만 T확정. → 음성→명령토큰 상류가 실오디오로 관통 동작함을 확인(정확도 그대로 보고, 과장 없음).신규 파일(전부 신규 추가, 기존 crowny-voice/crowny-voicecode libs 무수정):
/Users/ef/crowny-voicecode/tools/명령어휘학습.한선/Users/ef/crowny-voicecode/tools/명령어휘평가.한선/Users/ef/crowny-voicecode/tools/명령어휘실오디오데모.한선/Users/ef/crowny-voicecode/libs/명령어휘모델.한선(명령모델생성())
crownycode-learn.sh add "연결모델_명령어휘모델" "<코드>" 완료(별칭 연결모델).잔여:
- 임계(마진2/점수3)가 12클래스에 보수적 — O 비율 58% 로 정직 확인, 재튜닝하면 확정율 개선 여지(단 오확정 0 유지가 우선순위).
- 어휘 12개는 대표 샘플(의미어연결.한선 전체 35개 중 카테고리 대표 1~2개) — 나머지 어휘(말해/보여줘/파일쓰기/저장/파일읽기/불러오기/루프/동안/조건/아니면/포트/대기/선언/정의/더하기/합/빼기/차/곱하기/나누기/대입/설정/바꿔) 미학습.
- 데모 rate=190 1개 조건만 검증 — 화자변화·노이즈·실사람 육성 미검증(say 합성음성 한정).
진행 (2026-07-07, 명령어휘 STT 45단어 확장 — 12→45)
목표: 12어휘 명령STT를 35 명령어휘(의미어연결.한선 전체) + 10 숫자(영~구) = 45단어로 확장, 실오디오 학습·평가·임계 재튜닝.
코퍼스: say -v Yuna -r {120,140,180,220,260} + afconvert LEI16@16000 mono → 225 WAV.
저장: /private/tmp/claude-501/-Users-ef/38950a42-7c49-4f50-8ade-1d7feb8042ec/scratchpad/cmdcorpus45/(스크래치, 세션종료시 휘발).
학습: 12어휘 명령어휘학습.한선 방식 그대로 계승(log멜+3구간분할=39차원, 델타 미사용, 단어당 프로세스 분리). crowny-voice libs(특징추출/특징추출v2/WAV읽기/삼진양자화/음향모델삼진/클립분류v2) 무수정 — cat 조립 컴파일.
- 신규 도구:
crowny-voicecode/tools/명령어휘학습45.한선 - 신규 모델:
crowny-voicecode/libs/명령어휘모델45.한선—명령모델45생성()45클래스, 39차원(12어휘와 동일 맵구조)
전체=45 top1(예측==진실)=28/45=62.2% (명령35 중 24/35=68.6%, 숫자10 중 4/10=40%)
판정=1(확정) 8건 → T정답률(확정중)=8/8=100%, 오확정=0/45(0%)
판정=0(모름) 37건 → 모름율=82.2%, 그중 후보에 진실 포함=7/37=18.9%
12어휘(top1 91.7%) 대비 top1 하락(62.2%) — 클래스수 증가(12→45)로 39차원 공간의 판별력 희석이 주원인(정직 보고, 과장 없음). 오확정 0 원칙은 유지.혼동행렬 상위10 (top1 오분류 17건, 전부 유일쌍 — 반복쌍 없음):
출력→서버(마진1) 읽기→대기(마진0) 불러오기→포트(마진0) 함수→저장(마진0) 정의→선언(마진0)
빼기→대기(마진0) 빼→동안(마진0) 곱해→조건(마진0) 대입→동안(마진0) 설정→선언(마진0)
동음이의/1음절 숫자 혼동 실측: 예상과 달리 숫자끼리(예: 이↔이) 충돌이 아니라 숫자→다음절 명령어로 오분류(일→읽기, 이→조건, 사→서버, 육→읽기, 칠→조건, 구→포트). 숫자 6/10이 명령어와 혼동 — 1음절 클립의 비침묵 프레임수가 적어(짧은 발화) 39차원 절대임계 템플릿이 다른 단어와 쉽게 근접점수를 냄. "정의↔선언", "설정↔선언"은 의미적으로도 유사한 제어/선언 계열 단어라 음향적으로도 근접(정직 관찰, 라벨 아님).임계 재튜닝 미니스윕(마진{1,2,3}×점수{3,6}, 오확정0 제약):
마진=1: 확정22/45, 확정중정답21/22, 오확정=1(출력→서버, 마진=1 경계에서 위반) → 채택불가
마진=2: 확정8/45, 확정중정답8/8, 오확정=0 → 채택(기존 12어휘와 동일값)
마진=3: 확정5/45, 확정중정답5/5, 오확정=0 → 더 보수적, 확정율 하락
점수임계(3 vs 6)는 이 스윕 범위에서 무효과(경계 스코어가 3~6 사이에 없음).
45클래스 권장 임계 = 마진2/점수3 (12어휘와 동일, 유지) — 마진1은 오확정 발생으로 기각. 서버 반영은 메인 세션 결정사항(본 작업은 제안만).신규 파일(전부 신규 추가, 기존 crowny-voice/crowny-voicecode libs 무수정):
/Users/ef/crowny-voicecode/tools/명령어휘학습45.한선/Users/ef/crowny-voicecode/tools/명령어휘평가45.한선/Users/ef/crowny-voicecode/libs/명령어휘모델45.한선(명령모델45생성())
crownycode-learn.sh add "연결모델_명령어휘모델45" "<코드>" 완료.잔여:
- top1 62.2%로 12어휘(91.7%) 대비 하락 — 39차원 고정 특징으로 45클래스 판별력 부족, 근본개선은 차원확장(구간수↑ 또는 델타 재도입) 또는 계층적 분류(명령/숫자 2단계) 필요.
- 오확정0 유지하려면 마진2 유지 시 확정율 17.8%(8/45)뿐 — 나머지는 O(모름)로 보류(정직·안전 우선, 과잉확정 없음).
- 숫자 어휘(10개)는 명령어(35개)보다 상대적으로 정확도 낮음(40% vs 68.6%) — 1음절 발화 특유의 짧은 비침묵 구간이 원인 후보, 후속 검증 필요.
- 실사람 육성·노이즈 환경 미검증(say 합성음성 rate 5종 한정, 기존 12어휘와 동일 한계).