자연어의미장v2 — 강화특징 신호강화 (사이클24 P0 후속)
개요
자연어→의미장 분류 정확도 개선. 사이클24 baseline 7.5%(영문첫6글자) 대비 v2 13.3%(동일분할 5.8%→13.3%, 2.3x).
방법
특징전략: 개념명 첫 12단위, 단위당 3트릿 → din=36
한글 음절 → 자모 분해 (초성/중성/종성) → 균형3진 (초성:2트릿, 중성:1트릿)
영문자 → ASCII 균형3진 (3트릿)
코드북 field[0] 사용 (한글명 우선, 없으면 영문)
분류기1: 최근중심 (클래스 중심벡터 내적 비교)
분류기2: 균형삼진OvR (삼진OvR.한선 재사용)결과 (seed=42, 동일분할 N_TR=20/클래스, N_TE=5/클래스)
| 방법 | 정확도 | vs chance |
|---|
| v1 영문첫6글자 최근중심 | 5.8% | +1.6x |
| v1 영문첫6글자 OvR | 5.8% | +1.4x |
| v2 개념명12단위 최근중심 | 13.3% | +3.2x |
| v2 개념명12단위 OvR | 2.5% | 미달 |
| chance | 4.17% | 1.0x |
특징별 비교 (최근중심, 동일분할)
- eng_N=9 (영문전체 9글자): 9.2%
- concept_N=12 (한글자모+영문혼합): 13.3% ← 최선
- eng_char_freq (26-dim): 10.0%
진단
- 최근중심에서 13.3% 달성. OvR은 수렴 안 됨 (din=36 큰 특징공간에서 ep=10 부족 or STE 데드존).
- 한글자모 특징이 영문6글자보다 의미장 분리력 높음 (19%만 한글명 → 나머지도 영문 12글자로 커버).
- 상한 추정: 표면형↔의미 본질적 약상관, 20-30%가 현실적 상한.
파일
/Users/ef/crowny-butler/libs/자연어의미장v2.한선 (824줄, din=36)
- 의존:
삼진OvR.한선
- 데이터: 실어휘코드북_O.psv (4164개)