[프로젝트] OpenClaw 컴포넌트 적용기: Skill·Tool·Hook·Session
서버형 Bixby 에이전트 PoC에서 OpenClaw의 Skill, custom Tool, Plugin Hook, Session과 Automation을 어떻게 조합했고 어떤 한계를 확인했는지 정리합니다.
새로 작성한 글부터 시간순으로 정리했습니다. 분야별로 찾으려면 Posts by Category에서 시작하세요.
서버형 Bixby 에이전트 PoC에서 OpenClaw의 Skill, custom Tool, Plugin Hook, Session과 Automation을 어떻게 조합했고 어떤 한계를 확인했는지 정리합니다.
OpenClaw를 단순한 챗봇이 아니라 Gateway, session, agent loop와 확장 경계로 나누어 읽고, Tool·Skill·Plugin의 역할 차이를 정리합니다.
고정 TC의 재현성은 유지하면서 trace feedback, executable environment와 simulator를 비용 대비 효과에 맞게 결합하는 설계 회고.
Anthropic의 개념 모델, Inspect AI, Harbor와 τ-bench를 비교해 agent evaluation harness가 표준화하는 실행 경계와 남겨 두는 제품 책임을 정리한다.
고정 replay test case와 interactive simulator를 재현성, 현실성, oracle, 비용과 비결정성 관점에서 비교한다.
OpenTelemetry와 Langfuse 계열 trace를 검색·선별·정제해 재현 가능한 평가 데이터로 승격하는 파이프라인.
Checkpoint, resume identity, 실행 budget과 provenance를 이용해 대규모 평가를 운영 가능한 작업으로 만드는 방법.
복수 정답 path와 structured action을 채점하는 방법, alternative 재호출·중복 제거·전역 argument 무시 정책이 만드는 오판 가능성.
검증된 test case를 runtime request와 expected path로 분리하는 방법, pinned history가 제공하는 재현성과 실제 trajectory를 만들지 못하는 한계.
Trace를 평가 계약으로 구조화하고 CI와 runtime이 같은 validator를 공유하도록 설계하는 방법.
부분적으로 관측되는 기기 상태, 다단계 사용자 개입과 실제 세계의 비가역 동작을 평가하는 방법, 기존 평가기가 풀어낸 문제와 아직 남은 구조적 과제.
Anthropic의 Demystifying evals for AI agents를 바탕으로 task, trial, grader, harness와 반복 가능한 평가 운영법을 한국어로 풀어쓴 요약·해설.
Trace에서 평가 자산을 만드는 흐름, TC와 simulator의 관계, tool output을 생성하는 environment boundary와 hybrid 평가 구조를 다시 검토한 시리즈.
0.6의 코드 인터프리터·델타 채널부터 0.7의 토큰 다이어트와 breaking change까지, deepagents 최신 변경사항을 정리한다.
파이썬으로 redis를 구현해보자.
이미지 생성 분야의 핵심 논문 중 하나인 Denoising Diffusion Probabilistic Models을 리뷰한다.
VAE, diffusion에 적용되는 variational inference(bayes)에 대해 정리한다.
리트코드 2024번 문제 풀이.
수학, 통계, 머신러닝, 딥러닝 기술 면접을 위한 문제와 답변 해보기. 본 포스팅은 개념에 대해 깊이 있게 이해한다기 보다는 폭넓게 아는 것에 중점을 둠.
Pickle로 머신러닝 모델 직렬화 및 배포하기
리트코드 1404번 문제 풀이.
리트코드 1208번 문제 풀이.
수학, 통계, 머신러닝, 딥러닝 기술 면접을 위한 문제와 답변 해보기. 본 포스팅은 개념에 대해 깊이 있게 이해한다기 보다는 폭넓게 아는 것에 중점을 둠.
리트코드 131번 문제 풀이.
자연어 분야의 핵심 논문 중 하나인 Attention Is All You Need을 리뷰한다. 어텐션 알고리즘과 모델 아키택처를 그림과 코드를 통해 이해하고, 병렬성 관점에서 살펴본다.
자연어 분야의 핵심 논문 중 하나인 Attention Is All You Need을 리뷰한다. 어텐션 알고리즘과 모델 아키택처를 그림과 코드를 통해 이해하고, 병렬성 관점에서 살펴본다.
자연어 분야의 핵심 논문 중 하나인 Attention Is All You Need을 리뷰한다. 어텐션 알고리즘과 모델 아키택처를 그림과 코드를 통해 이해하고, 병렬성 관점에서 살펴본다.
AI 학습용 데이터를 진단·개선하는 ‘데이터 클리닉’ 과제. GAN 기반 매니폴드 매칭 생성 모델에 Average Hausdorff loss를 고안해 붙였다.
잘려 있는 검색 스니펫에서 답을 찾는 한국어 QA 모델. 학습 데이터의 90%가 unanswerable인 불균형을 증강으로 보완해 test 점수를 36.0에서 41.9로 올렸다.
흔들리고 잘린 실사용자 쇼핑 사진을 레이블 없이 학습에 쓴다. RandAugment와 변형 MixMatch로 top-1 정확도를 56.42에서 69.62로 올렸다.
본 포스팅은 샘플 포스트입니다.