← 목록
기타 2026-06-30 1KB 읽기 1분

요청: 의미장대규모분류

  • 날짜: 2026-06-30 16:54:13
  • 작업 경로: /Users/ef/CrownyOS/crownyc

요청 본문

P2 — 실어휘코드북_O.psv 24의미장 대규모 실데이터 분류. OvR K=24 vs 그레이코드 K=24, 훈련/테스트 분할, 정직 일반화 측정. 신규 crowny-butler/libs/의미장대규모.한선

관련 산출

(클로드가 작업 결과를 이어 기록)

완료 결과 (2026-06-30)

파일

  • /Users/ef/crowny-butler/libs/의미장대규모.한선 (신규)

실행 결과

실어휘코드북_O.psv: 4164개념 24도메인
특성: P12·C 균형3진 6트릿(din=6), N_PER=30, 훈련=24/클래스, 테스트=6/클래스

OvR K=24 (균형1:1, ep=10): 훈련 20% / 테스트 22%  (chance=4.17%)
Gray BTG K=24 (ep=25):     훈련  6% / 테스트  8%  (chance=4.17%)
결론: OvR 테스트 22% > Gray 8%
19/19 PASS

핵심 발견

  1. GC댕글링 함정: 데이터셋구축 내 mark/restore → 특성벡터 해제 → 쓰레기값 (두 번째 실행까지 chance=4% 고착)
  2. OvR 균형샘플 부족: neg=1개/class → ep=25에서 과적합(23%→14%). ep=10이 최적
  3. Gray K=24 한계: 3트릿 압축출력으로 24클래스 수렴 어려움 (이론 33% 미달)

VM 교훈

  • 특성벡터를 Xtr/Xte에 추가 후 mark로 복원하면 댕글링 → mark 없이 직접 영속 유지
  • 720 특성배열 < ARRAY_CAP(4095): 안전