요청: 의미장대규모분류
- 날짜: 2026-06-30 16:54:13
- 작업 경로: /Users/ef/CrownyOS/crownyc
요청 본문
P2 — 실어휘코드북_O.psv 24의미장 대규모 실데이터 분류. OvR K=24 vs 그레이코드 K=24, 훈련/테스트 분할, 정직 일반화 측정. 신규 crowny-butler/libs/의미장대규모.한선
관련 산출
(클로드가 작업 결과를 이어 기록)
완료 결과 (2026-06-30)
파일
/Users/ef/crowny-butler/libs/의미장대규모.한선(신규)
실행 결과
실어휘코드북_O.psv: 4164개념 24도메인
특성: P12·C 균형3진 6트릿(din=6), N_PER=30, 훈련=24/클래스, 테스트=6/클래스
OvR K=24 (균형1:1, ep=10): 훈련 20% / 테스트 22% (chance=4.17%)
Gray BTG K=24 (ep=25): 훈련 6% / 테스트 8% (chance=4.17%)
결론: OvR 테스트 22% > Gray 8%
19/19 PASS
핵심 발견
- GC댕글링 함정: 데이터셋구축 내 mark/restore → 특성벡터 해제 → 쓰레기값 (두 번째 실행까지 chance=4% 고착)
- OvR 균형샘플 부족: neg=1개/class → ep=25에서 과적합(23%→14%). ep=10이 최적
- Gray K=24 한계: 3트릿 압축출력으로 24클래스 수렴 어려움 (이론 33% 미달)
VM 교훈
특성벡터를 Xtr/Xte에 추가 후 mark로 복원하면 댕글링 → mark 없이 직접 영속 유지- 720 특성배열 < ARRAY_CAP(4095): 안전