Evaluation Harness
2개의 글
전체 태그-
[번역·요약] Anthropic이 정리한 AI 에이전트 평가의 기본 구조
Anthropic의 Demystifying evals for AI agents를 바탕으로 task, trial, grader, harness와 반복 가능한 평가 운영법을 한국어로 풀어쓴 요약·해설.
-
[Agent Eval 3] Evaluation Harness는 무엇을 표준화하는가
Anthropic의 개념 모델, Inspect AI, Harbor와 τ-bench를 비교해 agent evaluation harness가 표준화하는 실행 경계와 남겨 두는 제품 책임을 정리한다.