You cannot select more than 25 topics Topics must start with a letter or number, can include dashes ('-') and can be up to 35 characters long.

4.1 KiB

Phase 3 개발문서 패키지

이 문서는 Phase 0의 전략/리스크/데이터 정책, Phase 1의 저장소 구조/DB/서비스 계약, Phase 2의 ingestion 계약을 바탕으로, AI 코딩 에이전트가 문서 파서, feature builder, 라벨 생성, 품질검증 파이프라인을 구현할 수 있도록 만든 Phase 3 상세 개발문서입니다.

목표

Phase 3의 목표는 아래 8가지를 실제 코드 수준으로 구현하는 것입니다.

  1. 공시/첨부문서를 표준 이벤트 레코드로 변환하는 parser 계층을 구현한다.
  2. 규칙 기반 추출과 LLM 보강 추출의 역할 분담을 고정한다.
  3. 이벤트/문서/가격/레짐/attention 피처 생성 규칙을 고정한다.
  4. 1D/3D/5D forward outcome 라벨 생성 규칙을 고정한다.
  5. 수동 검수(review queue)와 품질 보증(QA) 절차를 만든다.
  6. 학습용/리서치용 데이터셋 스냅샷 생성 규칙을 만든다.
  7. LLM 호출을 캐시/버전관리/재현 가능하게 만든다.
  8. Phase 4 백테스터가 바로 사용할 수 있는 canonical feature dataset을 제공한다.

포함 문서

  • parser_and_feature_architecture.md
    • Phase 3 전체 아키텍처
    • parse → normalize → enrich → feature → label 흐름
    • 서비스 경계와 데이터 계약
  • document_parser_design.md
    • 문서 파서 상세 설계
    • 규칙 기반/LLM 기반 역할 분리
    • 필드별 추출 규칙
    • fallback / retry / confidence 정책
  • feature_catalog.md
    • 이벤트/문서/가격/레짐/attention feature 정의
    • 계산식
    • null 처리
    • 누수(leakage) 금지 규칙
  • labeling_and_dataset_spec.md
    • 라벨 생성 규칙
    • reaction day / entry day 정의
    • 1D/3D/5D labels, MFE/MAE
    • 학습/검증용 스냅샷 생성 규칙
  • prompt_and_llm_policy.md
    • LLM 프롬프트 정책
    • JSON schema 사용 방식
    • 모델 버전/프롬프트 버전/캐시 키
    • 비용 통제와 fallback 원칙
  • quality_assurance_and_review.md
    • 수동 검수 흐름
    • disagreement triage
    • parser 품질 지표
    • gold set 운영 방식
  • implementation_plan.md
    • AI 코딩 에이전트용 구현 순서
    • 작업 분할
    • 완료 조건
    • 금지사항
  • testing_checklist.md
    • 단위 테스트
    • 통합 테스트
    • replay 테스트
    • 품질/운영 전 체크리스트
  • review_queue_contract.md
    • review queue 스키마
    • 상태 전이
    • 검수 UI/CLI 요구사항
  • feature_record.schema.json
    • canonical feature record JSON Schema
  • review_record.schema.json
    • 수동 검수 레코드 JSON Schema

Phase 3 범위

Phase 3에서는 아래까지만 구현합니다.

  • 문서 파서
  • LLM 호출 래퍼와 캐시
  • 파서 출력 정규화
  • feature builder
  • labeling job
  • review queue
  • gold set 평가
  • canonical dataset export

Phase 3에서 일부러 하지 않는 것

  • 모델 학습 자동화의 full pipeline
  • 전략 점수식 최종 확정
  • portfolio optimizer
  • live 주문 엔진
  • 대시보드 고도화
  • attention source 신규 수집기 구현

권장 실행 순서

  1. parser_and_feature_architecture.md 읽기
  2. document_parser_design.md 읽기
  3. prompt_and_llm_policy.md 읽기
  4. feature_catalog.md 기반으로 feature builder 구현
  5. labeling_and_dataset_spec.md 기반으로 labeler 구현
  6. review_queue_contract.md 기반으로 review workflow 구현
  7. implementation_plan.md 순서대로 구현
  8. testing_checklist.md로 검증
  9. quality_assurance_and_review.md로 품질 점검

완료 기준

Phase 3 종료 시 아래가 가능해야 합니다.

  • SEC 이벤트 문서 하나를 canonical parser output으로 변환할 수 있다.
  • parser output이 schema-valid JSON을 반환한다.
  • 규칙 기반 추출과 LLM 보강 추출이 provenance와 confidence를 남긴다.
  • feature builder가 event/document/market/regime/attention 피처를 한 레코드로 결합한다.
  • 1D/3D/5D label과 MFE/MAE를 계산할 수 있다.
  • 수동 검수 대상이 review queue에 자동 등록된다.
  • gold set에 대해 parser 품질 리포트를 생성할 수 있다.
  • canonical dataset을 Parquet/JSONL로 export할 수 있다.