You cannot select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.

115 lines
4.1 KiB
Markdown

# Phase 3 개발문서 패키지
이 문서는 **Phase 0의 전략/리스크/데이터 정책**, **Phase 1의 저장소 구조/DB/서비스 계약**, **Phase 2의 ingestion 계약**을 바탕으로,
AI 코딩 에이전트가 **문서 파서, feature builder, 라벨 생성, 품질검증 파이프라인**을 구현할 수 있도록 만든 **Phase 3 상세 개발문서**입니다.
## 목표
Phase 3의 목표는 아래 8가지를 실제 코드 수준으로 구현하는 것입니다.
1. **공시/첨부문서를 표준 이벤트 레코드로 변환하는 parser 계층**을 구현한다.
2. **규칙 기반 추출과 LLM 보강 추출의 역할 분담**을 고정한다.
3. **이벤트/문서/가격/레짐/attention 피처 생성 규칙**을 고정한다.
4. **1D/3D/5D forward outcome 라벨 생성 규칙**을 고정한다.
5. **수동 검수(review queue)와 품질 보증(QA) 절차**를 만든다.
6. **학습용/리서치용 데이터셋 스냅샷 생성 규칙**을 만든다.
7. **LLM 호출을 캐시/버전관리/재현 가능하게** 만든다.
8. **Phase 4 백테스터가 바로 사용할 수 있는 canonical feature dataset**을 제공한다.
## 포함 문서
- `parser_and_feature_architecture.md`
- Phase 3 전체 아키텍처
- parse → normalize → enrich → feature → label 흐름
- 서비스 경계와 데이터 계약
- `document_parser_design.md`
- 문서 파서 상세 설계
- 규칙 기반/LLM 기반 역할 분리
- 필드별 추출 규칙
- fallback / retry / confidence 정책
- `feature_catalog.md`
- 이벤트/문서/가격/레짐/attention feature 정의
- 계산식
- null 처리
- 누수(leakage) 금지 규칙
- `labeling_and_dataset_spec.md`
- 라벨 생성 규칙
- reaction day / entry day 정의
- 1D/3D/5D labels, MFE/MAE
- 학습/검증용 스냅샷 생성 규칙
- `prompt_and_llm_policy.md`
- LLM 프롬프트 정책
- JSON schema 사용 방식
- 모델 버전/프롬프트 버전/캐시 키
- 비용 통제와 fallback 원칙
- `quality_assurance_and_review.md`
- 수동 검수 흐름
- disagreement triage
- parser 품질 지표
- gold set 운영 방식
- `implementation_plan.md`
- AI 코딩 에이전트용 구현 순서
- 작업 분할
- 완료 조건
- 금지사항
- `testing_checklist.md`
- 단위 테스트
- 통합 테스트
- replay 테스트
- 품질/운영 전 체크리스트
- `review_queue_contract.md`
- review queue 스키마
- 상태 전이
- 검수 UI/CLI 요구사항
- `feature_record.schema.json`
- canonical feature record JSON Schema
- `review_record.schema.json`
- 수동 검수 레코드 JSON Schema
## Phase 3 범위
Phase 3에서는 아래까지만 구현합니다.
- 문서 파서
- LLM 호출 래퍼와 캐시
- 파서 출력 정규화
- feature builder
- labeling job
- review queue
- gold set 평가
- canonical dataset export
## Phase 3에서 일부러 하지 않는 것
- 모델 학습 자동화의 full pipeline
- 전략 점수식 최종 확정
- portfolio optimizer
- live 주문 엔진
- 대시보드 고도화
- attention source 신규 수집기 구현
## 권장 실행 순서
1. `parser_and_feature_architecture.md` 읽기
2. `document_parser_design.md` 읽기
3. `prompt_and_llm_policy.md` 읽기
4. `feature_catalog.md` 기반으로 feature builder 구현
5. `labeling_and_dataset_spec.md` 기반으로 labeler 구현
6. `review_queue_contract.md` 기반으로 review workflow 구현
7. `implementation_plan.md` 순서대로 구현
8. `testing_checklist.md`로 검증
9. `quality_assurance_and_review.md`로 품질 점검
## 완료 기준
Phase 3 종료 시 아래가 가능해야 합니다.
- SEC 이벤트 문서 하나를 canonical parser output으로 변환할 수 있다.
- parser output이 schema-valid JSON을 반환한다.
- 규칙 기반 추출과 LLM 보강 추출이 provenance와 confidence를 남긴다.
- feature builder가 event/document/market/regime/attention 피처를 한 레코드로 결합한다.
- 1D/3D/5D label과 MFE/MAE를 계산할 수 있다.
- 수동 검수 대상이 review queue에 자동 등록된다.
- gold set에 대해 parser 품질 리포트를 생성할 수 있다.
- canonical dataset을 Parquet/JSONL로 export할 수 있다.