[Agent Eval 4] TC 중심 설계를 돌아본 Hybrid Evaluation Architecture
고정 TC의 재현성은 유지하면서 trace feedback, executable environment와 simulator를 비용 대비 효과에 맞게 결합하는 설계 회고.
고정 TC의 재현성은 유지하면서 trace feedback, executable environment와 simulator를 비용 대비 효과에 맞게 결합하는 설계 회고.
Anthropic의 개념 모델, Inspect AI, Harbor와 τ-bench를 비교해 agent evaluation harness가 표준화하는 실행 경계와 남겨 두는 제품 책임을 정리한다.
고정 replay test case와 interactive simulator를 재현성, 현실성, oracle, 비용과 비결정성 관점에서 비교한다.
OpenTelemetry와 Langfuse 계열 trace를 검색·선별·정제해 재현 가능한 평가 데이터로 승격하는 파이프라인.
Checkpoint, resume identity, 실행 budget과 provenance를 이용해 대규모 평가를 운영 가능한 작업으로 만드는 방법.
복수 정답 path와 structured action을 채점하는 방법, alternative 재호출·중복 제거·전역 argument 무시 정책이 만드는 오판 가능성.
검증된 test case를 runtime request와 expected path로 분리하는 방법, pinned history가 제공하는 재현성과 실제 trajectory를 만들지 못하는 한계.
Trace를 평가 계약으로 구조화하고 CI와 runtime이 같은 validator를 공유하도록 설계하는 방법.
부분적으로 관측되는 기기 상태, 다단계 사용자 개입과 실제 세계의 비가역 동작을 평가하는 방법, 기존 평가기가 풀어낸 문제와 아직 남은 구조적 과제.
Anthropic의 Demystifying evals for AI agents를 바탕으로 task, trial, grader, harness와 반복 가능한 평가 운영법을 한국어로 풀어쓴 요약·해설.
Trace에서 평가 자산을 만드는 흐름, TC와 simulator의 관계, tool output을 생성하는 environment boundary와 hybrid 평가 구조를 다시 검토한 시리즈.