← 목록
기타 2026-06-28 15KB 읽기 15분

의미어코드 코드북 설계 스펙 v1

생성: 2026-06-28 · 입력: 5각 연구 + 3건 적대검증 통합 · 상태: 설계 동결 후보(P0 착수 가능)

본 스펙은 적대검증을 통과한 명제만 단정(✅확정)하고, 통과하지 못한 것은 조건부(🟡)·미검증(⬜)·철회(❌)로 라벨링한다. 라벨 없는 단정은 금지.


1. 확정 설계 결정 (검증 통과 라벨링)

#설계 명제라벨검증 근거
D1의미어 주소를 트릿 경계(9트릿)에 정렬한다. 9트릿 = 27트릿 큐브의 1/3, 두 개로 큐브 1슬롯 완충.✅확정3건 검증 모두 "트릿 정렬 관습은 타당"으로 합치. 단 근거는 하드웨어 정렬+합성성이지 "20k가 3⁹과 맞아서"가 아님
D2응용어는 단일 10트릿 주소 금지, 9트릿 base + 합성연산자 시퀀스(가변 9+6~18트릿)로 표현.✅확정합성주소가 의미구조 보존·거리계산·역재구성·큐브정합에서 우월(검증 독립 성립). 10트릿(59,049)은 6만에 −951 부족
D3명제를 "닫힌 전체 합성" → "개방 코어 + 잔여 어휘화 예외표"로 약화. 비분해 의미는 base조합 + 예외델타(stored gloss) 2층.✅확정어휘부 41~50%가 비합성 MWE(Sag 2002: WordNet 1.7의 41%; Jackendoff/Erman&Warren ~50%). 닫힌 100% 합성은 붕괴
D4검증 코어(불변) = Concepticon 3.4.0 (4,034). 나머지는 "잠정층"으로 신뢰등급 분리.✅확정범언어 실측 교차검증된 집합은 4,034개뿐. 나머지 ~16k는 영어 WordNet/OMW 편향 후보
D5M1(개념분해→표면어 생성)은 투명 파생에 한해 결정론 성립. M2(자연어↔코드 무손실 가역 왕복)는 코어 내부에서만 보장, 비분해어는 예외표 경유.✅확정M2는 한국어 색채형용사에서 반증됨. LLM이 α(잔여의미)를 채우면 결정론 깨짐 → α를 코어 밖 예외표에 명시 등록해 경계 보존
D6base 인벤토리 목표 = 9트릿 캡 19,683 미만(하드 상한). 현재 "~20,000"은 −317 오버플로 → 캡 아래로 설계.✅확정20,000 > 3⁹=19,683. "~20k"를 글자대로 받으면 9트릿도 부족
C1base 규모 = 8,000~16,000 (검증 코어 5k와 능동어휘 20~35k 사이).🟡조건부검증된 범언어 core는 ~5k(log₃≈7.7→3⁸=6,561). 20k는 파생어 혼입 의심. 제외 기준 재적용 후 실측 필요
C2PHYLUM(27)×CLASS(27)×SPECIES(27) 계층 분해 주소.🟡조건부구조는 타당(트릿 정렬). 단 27 도메인 분류는 미검증 가설 — 언어학 검수 필요
U1잠정층 ~16k의 5개 어족 동시 어휘화.⬜미검증CLICS3가 언어별 의미공간 분절선 상이함을 실증(체계적 lexical gap)
U2능동어휘 ≈ 3⁹~3¹⁰ 정합.⬜미검증Nation 2001 word-family는 굴절·파생 포함 수치, 설계는 파생 제외 → 범주 오류 가능
X1"한국어사전 ≈ 6만 = 3¹⁰"❌철회사실관계 오류. 표준국어대사전 표제어 = 422,862~509,076(stdict 통계), 우리말샘 110만+. 6만은 능동어휘층이지 사전 아님. 사전 전체는 log₃≈11.97~12.66 → 12~13트릿
X2"3⁹≈19k / 3¹⁰≈60k 수치정합이 설계적으로 유의미"❌철회numerology(Texas sharpshooter). soft 타깃 사후 끼워맞춤, 정보량≈0. 연구 산술오류 적발: log₃(60,000)=10.0145이지 9.984 아님(9.984=58,020). 60,000 > 3¹⁰. 비율도 60000/19000=3.16≠3
X3"조사는 전부 의미 없는 문법 접착제"❌철회(부분)보조사 도/만/까지/조차/마저는 척도초점 의미 운반 → base 후보 승격. 순수 격조사(이/가/을/를)만 연산자
핵심 한 줄: 20k 닫힌 base는 교육성인 능동어휘의 결정론적 코어 피벗으로는 성립(트릿정렬·합성성 근거), 사전 전체(50만)의 가역 합성이라는 강한 형태로는 붕괴. 수치정합은 정당화 근거에서 폐기하고 공학 근거(큐브 27=3³ 정렬 + 합성주소)로만 채택.


2. 의미어 코드북 정의

2-1. 규모 (확정 캡 + 조건부 목표)

검증 코어(불변)   : 4,034  (Concepticon 3.4.0)        → 신뢰등급 A
1차 확장(잠정)    : ~10,000 (+GWA Base 5k, +PWN SemCor) → 신뢰등급 B
2차 확장(잠정)    : ~16,000 (+OMW 10언어 교집합)         → 신뢰등급 C
하드 상한         : 19,683 = 3⁹ (9트릿 캡, 절대 초과 금지)
사전 응용층(별도) : 50만~110만 → 12~13트릿 영역, base 아님(합성경로로만)

데이터가 실제로 가리키는 보수적 출발점은 3⁸=6,561(8트릿), 검증코어 5k 기준 여유 ~24%. P0는 8트릿에서 시작하고 확장 시 9트릿으로 승격(D6 캡 준수).

2-2. 소싱 (라이선스 청정 파이프라인)

Concepticon 4k (CC BY 4.0, 범언어 검증완료)
  + GWA Base Concepts 5k (CC BY)
  → CILI ILI 중복병합 → ~8k
  + PWN SemCor tag_cnt≥5, instance_hypernym(고유명사) 제외 → ~14k
  + Open Multilingual WordNet 10언어 교집합 → ~16k
  − 파생가능 합성어(별도 슬롯 불필요)
  − 5개 어족 미검증(→ "영어편향 후보"로 격리, 신뢰등급 C/D)
  = ≤19,683 (3⁹ 하드캡) → 트릿주소 배정
BabelNet/KorLex는 연구전용(비상업) → 보조 검증만, 코드북 직접 편입 금지.

제외 필터: 고유명사(instance_hypernym, eponym 보통명사화는 보통명사 분기로 흡수) · 순수 격조사 · 파생합성어 · 5어족 미검증.

2-3. 삼진주소 (트릿 정렬, 수치정합 근거 폐기)

표기: 트릿 T(+1)/O(0)/A(−1), 9트릿 t₉t₈t₇|t₆t₅t₄|t₃t₂t₁(MST→LST), 값 A=Σtᵢ·3^(i−1) ∈ [−9841,+9841].

PHYLUM  P=(t₉t₈t₇)  27 온톨로지 도메인, P_val∈[−13,+13]
CLASS   C=(t₆t₅t₄)  도메인 내 27 범주
SPECIES S=(t₃t₂t₁)  범주 내 27 개념
전체값  A = 729·P + 27·C + S

🟡조건부 COLOR 도메인 워크드 예시 (P=+5=TAA, 언어학 검수 전):

의미어P·C·SA값9트릿
빨강5·+1·+133685TAA\|OOT\|TTT
시안(보색)5·−1·+133631TAA\|OOA\|TTT
흰색5·0·+133658TAA\|OOO\|TTT
검정5·0·−133632TAA\|OOO\|AAA
불그스름한5·+1·+13673TAA\|OOT\|OOT
검증(빨강): (+1)·6561+(−1)·2187+(−1)·729+27+9+3+1 = 3685 ✓ 의미관계 주소반영: 빨강↔시안(보색)=C 부호반전 |Δ|=54=2×27 · 흰↔검(명도반의)=S 반전 |Δ|=26.

주의: 위 27 도메인 분류(존재/양/성질…)는 C2 조건부. 채택 전 언어학 검수 필수. 트릿 정렬 구조만 ✅확정.

2-4. 자질 스키마 (코드북 레코드)

각 base 의미어 1 레코드(예외델타 포함, D3/D5):

{
  id        : 9트릿 SemCode (정수 A값)
  gloss_en  : 영어 레이블
  gloss_ko  : 한국어 레이블 (응용 아님, 코어 레이블)
  phylum/class/species : 27분류 인덱스
  ant       : 반의어 id (ANTONYM 도출용)
  part_of   : 상위 전체 id (PART-OF용)
  trust     : A(검증코어)/B/C/D(영어편향후보)  ← 신뢰등급 분리
  coverage  : 어휘화 확인 어족 수 (5+ 목표, 미달=격리)
  src       : Concepticon|GWA|PWN|OMW
  exc_delta : 비분해 잔여의미 stored gloss (없으면 null) ← α 명시등록
}


3. 합성/분해 연산자 집합 (최소충분 8+1)

BNF:

EXPR ::= ISA(c)                  -- c: base 의미어 SemCode
       | BETWEEN(c₁,c₂,t)        -- t∈[0,100] 정수 (c₁=0, c₂=100), 균형3진 정수만
       | DEGREE(EXPR,d)          -- d∈[0,100] 강도, S_val 스케일
       | NEGATE(EXPR)            -- 반의/반대방향 (S/C/P/전체 반전 선택)
       | PART-OF(c)              -- 부분관계
       | COMBINE(EXPR+)          -- 교집합 결합(AND)
       | SIMILAR(c,d)            -- 근사 멤버십(IS-A 없이)
       | ASPECT(EXPR,asp)        -- asp∈{완료,진행,반복,순간}
       | OPAQUE(lexeme)          -- ❗분해불가 폴백(관용어·은유) → exc_delta 강제
도출(primitive 불필요): ANTONYM(x)=ISA(x.ant) · INTENSIFY=DEGREE(·,>50) · DIMINISH=DEGREE(·,<50).

OPAQUE는 필수 안전장치(D3/D5): 41~50% 비합성 어휘를 여기로 빼고 exc_delta에 gloss 저장. OPAQUE 비율 = 코어 결정론 한계의 정량 지표(P3에서 측정).

"불그스름한" 데모 형식 (두 주소화 = 캐시 관계)

단일주소(캐시) : SC-3673                          (TAA|OOT|OOT, 직접 등록)
합성경로       : DEGREE(ISA(SC-3685_빨강), 8)     -- S: +13×0.08≈+1 → 3673
대체 합성      : BETWEEN(빨강, 검정, 20)          -- C유지 S약화, ≈3673
핵심 파생어는 단일주소 등록(빠른 캐시), 희귀·신조어는 합성경로(무한). 두 결과 동일 → 단일주소는 합성경로의 캐시.


4. 복합인과관계로직 형식 + E2E

코어는 닫힌 의미어공간에서 결정론 인과 추론. 규칙 = 의미어 조건 → 의미어 결과 + 4상 확신도. (셀코어 룰엔진 정합)

형식:

RULE r:
  WHEN  COMBINE(ISA(c₁), ISA(c₂), STATE(s)…)      -- 전제 = 의미어 집합
  THEN  ISA(c_out) with STATE(s_out)              -- 결과 = 의미어
  PHASE 티(+1 자동참) | 옴(0 검증필요) | 타(−1 거짓) | 음(이관)
  src   인과근거 출처

E2E 예시: "유리잔이 떨어지면 깨진다"

자연어 입력 : "유리잔이 떨어졌다"
[LLM 인코더] → 의미어코드:
  ISA(유리=재질/MATERIAL, 자질 brittle=깨지기쉬움)
  + ACTION(떨어지다=낙하/MOTION+중력)
  + (조사 "이" = 격조사 → 연산자, 의미어 아님 / D-X3)

[크라우니 코어 — 결정론 규칙]:
  RULE 충격파괴:
    WHEN COMBINE(MATERIAL.brittle, MOTION.낙하, IMPACT)
    THEN STATE(깨짐=파손) PHASE 티(+1)
  → 발화: brittle ∧ 낙하 → IMPACT → STATE(깨짐)
  출력 의미어코드: STATE(SC_깨짐) + CAUSE(낙하→충격)

[LLM 디코더] → "유리잔이 깨졌다"  (round-trip 의미보존 ✅, 코어 내부 M2)
경계 주의(D5): "유리잔"=고유물체 아님(보통명사 OK). 만약 "엄마가 아끼던 유리잔"처럼 정서가(情) 결합 시 → 정(情)은 비분해 → OPAQUE+exc_delta로 빠지고 디코더 α 위임 = 결정론 경계 밖으로 명시 격리.


5. 파이프라인 마이그레이션 (P0~P3)

자연어 →[LLM 인코더]→ 의미어코드 →[크라우니 규칙코어]→ 의미어코드 →[LLM 디코더]→ 자연어

P0 — 검증코어 + 첫 데모 (착수 가능)

  • Concepticon 4,034 다운로드(CC BY 4.0) → 8트릿(3⁸=6,561, 여유 24%) 주소 배정. 데이터가 가리키는 보수적 출발.
  • 첫 데모 = COLOR 도메인 12색 코드북 직렬화 + round-trip identity 측정.
  • 산출: 의미어코드북.한선 (코드북 직렬화), 색채왕복.한선 (인코드→코어→디코드).
  • 성공 기준: 12색 무손실 왕복 100%.
P1 — 9트릿 확장 + 합성연산자
  • GWA 5k + PWN SemCor → ~10k, 9트릿 승격(캡 19,683). CILI 중복병합.
  • 8개 합성연산자 구현. 데모: 불그스름한 = DEGREE(ISA(빨강),8) → SC-3673 캐시 일치.
  • 성공 기준: 색채 파생어 50개 합성경로↔단일주소 일치율 측정.
P2 — 인과 규칙엔진 + 예외표
  • 셀코어 룰엔진 위에 의미어 인과규칙 (섹션4 형식). exc_delta 예외표 도입.
  • 데모: "유리잔이 떨어지면 깨진다" E2E. OPAQUE 비율 측정.
  • 성공 기준: 결정론 규칙 100건, 동일입력 100% 재현.
P3 — LLM 인코더/디코더 브리지 + 정량평가
  • 인코더/디코더 LLM 연결. round-trip identity rate + α-leak rate(디코더가 코어 밖에서 채운 의미 비율) 측정.
  • 성공 기준: 능동어휘 문장 round-trip identity ≥ 목표치 설정, α-leak 정량 보고.

6. 핵심 리스크 · 열린 질문

리스크(검증으로 확정된 위험)

  1. 비합성 어휘 41~50%(Sag 2002/Jackendoff): OPAQUE+exc_delta가 늘수록 "닫힌 100% 결정론" 명제 약화. → P3 OPAQUE 비율을 핵심 KPI로.
  2. 보편성 미검증: 검증된 건 4,034뿐. 나머지 ~16k 영어편향. CLICS3 lexical gap(나무/숲, 손/팔 colexify) → 단일 고정경계가 모든 언어와 1:1 어휘화한다는 명제 반증. → coverage 점수 게이트, 신뢰등급 분리.
  3. numerology 재발 방지: 9트릿 채택을 "수치 맞음"으로 재정당화 금지. 큐브 정렬+합성성만 근거.
  4. 오버플로: 인벤토리 19,683 초과 시 즉시 합성경로로 강등(단일주소 캐시 탈락).
열린 질문
  • Q1: 27 PHYLUM 도메인 분류(C2)는 언어학적으로 타당한가? — Concepticon ontological category와 정렬 검수 필요.
  • Q2: 보조사(도/만/까지/조차)의 base 의미어 승격 코드 배정 위치? (X3 보정)
  • Q3: 사전 응용층(50만, 12~13트릿)은 코드북에서 어떻게 참조? — base 아님, 합성경로 인덱스만.
  • Q4: α-leak 허용 임계치? — 결정론 경계의 정량 정의 필요(P3에서 결정).

부록: 한선씨 구현 VM 함정 주석 (코드북 직렬화 시 필수)

함정영향회피
나눗셈=균형3진 자연반올림(\r\≤\b\/2)DEGREE 스케일·바이트 산술 부정확정수 스케일은 곱셈 우선, 코어 산술은 C 래퍼([[ccp 사례]])
포함(s,sub)=매치 인덱스(없으면 −1), 0이 거짓처럼 동작gloss 검색 만약()이 안 탐빌트인 포함하나(참1/거짓−1, opcode750) 사용
컴파일 stderr가 toau에 섞임crownyc가 로그를 바이트코드로 실행→hanghanseonc_high x.한선 > out.toau (2>&1 금지)
VM 셀 슬롯 = 숫자키 0~9만SemCode를 문자열키로 못 넣음정수 A값을 슬롯 인덱스/맵으로
ARRAY_CAP=4095, STR_MAX_LEN=16384 단일읽기19,683 코드북 한 배열 불가샤딩(PHYLUM별 27분할) 또는 버퍼파일읽기(opcode874)
룰=리터럴 전용동적 의미어 규칙 한계플래그+후처리, 룰엔진실행/룰평가 API(셀코어_평가 없음)
한글 1자 출력 ≈ 9 cubes대량 gloss 출력 비용코드(정수) 위주 직렬화, gloss는 lazy

근거 출처 (보존)

표준국어대사전 통계 422,862~509,076 https://stdict.korean.go.kr/statistic/dicStat.do · 위키 https://ko.wikipedia.org/wiki/표준국어대사전 · 우리말샘 110만 https://namu.wiki/w/우리말샘 · Concepticon 3.4.0 (4,034) https://concepticon.clld.org/ · GWA Base Concepts (~5,000) http://globalwordnet.org/resources/gwa-base-concepts/ · WordNet https://wordnet.princeton.edu/ · MWE 41% (Sag et al. 2002) https://www.aclweb.org/aclwiki/Multiword_Expressions · MWE ~50% (Jackendoff) https://en.wikipedia.org/wiki/Multiword_expression · CLICS3 https://arxiv.org/html/2503.11377v1 · CILI https://aclanthology.org/2016.gwc-1.9/ · NSM 65 https://en.wikipedia.org/wiki/Natural_semantic_metalanguage · ConceptNet 5.5 https://arxiv.org/pdf/1612.03975 · BabelNet https://babelnet.org/statistics · KorLex http://korlex.pusan.ac.kr · UNL UW https://www.unlarchive.org/wiki/ · Longman DV https://www.pu-kumamoto.ac.jp/~rlavin/resources/wordlists/LDV.html · Swadesh https://en.wikipedia.org/wiki/Swadesh_list

산술 정정 기록: 연구 본문의 log₃(60,000)=9.984는 오류, 정확값 10.0145(60,000>3¹⁰=59,049, 오버플로). 비율 60000/19000=3.16(≠3). 독립확률 0.077²는 두 수 비종속이므로 무효. 이 정정이 X2(수치정합) 철회의 근거.