하네스 엔지니어링 딥다이브 — 에이전트의 완료를 시스템이 증명하게 하라
Lukas Niessen의 글 Harness Engineering Deep Dive: Where The Term Came From, And How To Actually Build One은 하네스 엔지니어링을 유행어가 아니라 하나의 설계 규율로 다룬다. 모델 호출과 도구 연결만으로는 실제 작업을 오래 수행하는 에이전트를 만들 수 없다. 실행 환경이 상태를 보존하고, 실패를 감지하고, 권한을 제한하고, 완료를 증명해야 한다. Harness 핵심 정리 기본 공식: 에이전트는 모델과 하네스의 결합이다. 모델은 교체되는 외부 자원이고, 하네스는 팀이 소유하며 개선할 수 있는 코드다. 경계선: 모델의 출력을 그대로 반환하는 래퍼와, 모델의 결정을 실행해 세계를 바꾸고 결과를 다시 관찰하는 하네스를 구분해야 한다. 핵심 구현: 원시 로그를 신호로 바꾸는 센서, 대화와 분리된 영속 원장, 기계가 판정하는 종료 조건, 제한된 도구 표면이 필요하다. 운영 제어: 토큰·시간·호출 횟수 예산과 정체 감지를 함께 둬야 무한 루프와 비용 폭증을 막을 수 있다. 아키텍처 관점: 모델 성능은 모델 단독이 아니라 모델과 하네스의 조합으로 측정해야 하며, 장기 자산은 외부 하네스에 쌓인다. 1. 모델은 빌리고 하네스는 소유한다 에이전트를 설명하는 가장 간단한 공식은 다음과 같다. ...