Agent
10개의 글
전체 태그-
[Agent Eval 1] 관측에서 평가 자산으로: Trace-to-Eval Data Flywheel
OpenTelemetry와 Langfuse 계열 trace를 검색·선별·정제해 재현 가능한 평가 데이터로 승격하는 파이프라인.
-
[Agent Eval 2] TC 기반 vs Simulator 기반 평가는 무엇이 다른가
고정 replay test case와 interactive simulator를 재현성, 현실성, oracle, 비용과 비결정성 관점에서 비교한다.
-
[Agent] 재현 가능한 LLM 에이전트 평가 파이프라인 설계
Trace에서 평가 자산을 만드는 흐름, TC와 simulator의 관계, tool output을 생성하는 environment boundary와 hybrid 평가 구조를 다시 검토한 시리즈.
-
[Agent Eval 구현 노트 2] Multi-step replay의 경계와 teacher forcing
검증된 test case를 runtime request와 expected path로 분리하는 방법, pinned history가 제공하는 재현성과 실제 trajectory를 만들지 못하는 한계.
-
[Agent Eval 4] TC 중심 설계를 돌아본 Hybrid Evaluation Architecture
고정 TC의 재현성은 유지하면서 trace feedback, executable environment와 simulator를 비용 대비 효과에 맞게 결합하는 설계 회고.
-
[Agent Eval 구현 노트 1] 평가 계약과 검증 경계
Trace를 평가 계약으로 구조화하고 CI와 runtime이 같은 validator를 공유하도록 설계하는 방법.
-
[Agent Eval 구현 노트 4] 장시간 평가의 복구와 provenance
Checkpoint, resume identity, 실행 budget과 provenance를 이용해 대규모 평가를 운영 가능한 작업으로 만드는 방법.
-
[번역·요약] Anthropic이 정리한 AI 에이전트 평가의 기본 구조
Anthropic의 Demystifying evals for AI agents를 바탕으로 task, trial, grader, harness와 반복 가능한 평가 운영법을 한국어로 풀어쓴 요약·해설.
-
[Agent Eval 구현 노트 3] 경로 채점의 함정과 discovery continuation
복수 정답 path와 structured action을 채점하는 방법, alternative 재호출·중복 제거·전역 argument 무시 정책이 만드는 오판 가능성.
-
[Agent Eval 3] Evaluation Harness는 무엇을 표준화하는가
Anthropic의 개념 모델, Inspect AI, Harbor와 τ-bench를 비교해 agent evaluation harness가 표준화하는 실행 경계와 남겨 두는 제품 책임을 정리한다.