# Quality Assurance and Manual Review ## 1. 목표 Phase 3의 성공 기준은 parser가 돌아가는 것만이 아니라, **신뢰할 수 있는 구조화 레코드와 피처**를 만드는 것입니다. ## 2. 품질 프레임워크 품질은 아래 4층으로 관리합니다. 1. **Schema quality** - JSON validation 통과율 - required field completeness 2. **Extraction quality** - 핵심 필드 정확도 - evidence 일치율 3. **Dataset quality** - null rate - distribution drift - leakage 없음 4. **Operational quality** - 파이프라인 성공률 - retry rate - manual review backlog ## 3. Gold set 운영 ### 목적 - parser 품질의 기준점 유지 - prompt/model 변경 시 회귀 검출 ### 구성 원칙 - event_type별 대표 샘플 포함 - high quality / low quality / ambiguous 케이스 혼합 - earnings / contract / regulatory / misc 분산 - issuer 규모와 섹터 다양성 확보 ### 최소 컬럼 - raw document reference - human canonical labels - evidence spans - notes - gold_version ## 4. review queue 우선순위 ### P0 - schema invalid - event_type unknown - direction 충돌 - filing timestamp 이상 ### P1 - guidance ambiguous - one-off likely - confidence 낮음 ### P2 - evidence 부족 - minor categorical mismatch ## 5. 수동 검수 workflow 1. review item 생성 2. reviewer가 원문/증거/span 확인 3. canonical 수정 4. reviewer note 작성 5. disposition 저장 6. gold set 후보이면 승격 필수 기록: - reviewer_id - review_started_at - review_completed_at - field_overrides - root_cause - resolution_type ## 6. Root cause taxonomy 필수 분류: - rule_parser_bug - llm_misclassification - prompt_ambiguity - source_document_noise - taxonomy_gap - timestamp_error - xbrl_mapping_error - feature_builder_bug ## 7. 주간 품질 리포트 최소 포함 항목: - parser success rate - schema validation pass rate - average confidence - review queue inflow/outflow - top root causes - null rate by feature family - label availability rate - drift summary ## 8. 배포 게이트 아래 중 하나라도 충족 못 하면 parser/feature 변경 배포 금지: - gold set accuracy 하락 - schema invalid 증가 - review backlog 폭증 - 핵심 feature null rate 급증 - leakage 점검 실패 ## 9. 테스트 외 수동 점검 매 릴리스 전 20~50개 샘플 수동 점검 권장: - 실적 release - 가이던스 상향/하향 - one-off 착시 케이스 - ambiguous press release - 6-K 외국 발행사 케이스