LangChain CEO Harrison Chase가 AI 에이전트의 지속적 학습(Continual Learning)에 대해 제시한 프레임워크를 합니다. 에이전트의 “학습"은 모델 가중치 업데이트만을 의미하지 않으며, 3가지 서로 다른 계층에서 발생할 수 있다는 것이 핵심 주장입니다.
원문: Continual Learning for AI Agents
핵심 주장
AI 에이전트의 “학습"은 모델 가중치 업데이트만이 아니라, 3가지 계층에서 각각 독립적으로 발생 할 수 있다.
에이전트 시스템의 3계층 구조
| 계층 | 설명 | 예시 (Claude Code) |
|---|---|---|
| 모델 계층 | 모델 가중치 자체 | Claude Sonnet |
| 하네스 계층 | 에이전트를 구동하는 코드·지시문·도구 | Claude Code 자체 |
| 컨텍스트 계층 | 하네스 외부의 설정 가능한 지시문·스킬 | CLAUDE.md, /skills |
각 계층별 학습 방법
모델 계층 학습 — SFT, RL, GRPO 등 전통적 학습 기법 사용. 단, 재앙적 망각(catastrophic forgetting) 문제가 핵심 과제 (새 데이터 학습 시 기존 지식이 저하됨).
하네스 계층 학습 — 에이전트 실행 로그(trace)를 수집한 뒤, 코딩 에이전트가 이를 분석하여 하네스 코드 자체를 개선 하는 방식. 오프라인으로 수행.
컨텍스트 계층 학습 — 가장 유연한 계층.
- 에이전트 수준 vs 테넌트(사용자/조직) 수준 학습 가능
- 오프라인 (예: OpenClaw의 “dreaming”) vs 온라인 (작업 중 실시간 메모리 업데이트) 방식
- 사용자 명시적 프롬프트 또는 하네스 지시문 기반 자동 업데이트
실제 구현 사례
- Claude Code :
CLAUDE.md파일과 skills로 컨텍스트 계층 학습 - OpenClaw :
SOUL.md+ clawhub skills - Hex의 Context Studio , Decagon의 Duet , Sierra의 Explorer 등 프로덕션 적용 사례
핵심 인프라: Traces (추적)
모든 학습 흐름의 기반은 에이전트의 전체 실행 경로(trace) . 이를 수집·분석하는 플랫폼으로 LangSmith를 제시.
결론
에이전트 성능 개선은 모델 재학습에만 의존하지 않아도 된다. 하네스 최적화 + 사용자/조직별 컨텍스트 학습 을 조합하면 프로덕션 환경에서 지속적 개선이 가능하며, 이 다층적 학습 프레임워크가 에이전트 시스템의 핵심 경쟁력이 될 것이라는 주장입니다.