에이전트 하네스의 해부학 — Anthropic, OpenAI, LangChain이 실제로 구축하는 것

Akshay Pachaar가 Anthropic, OpenAI, Perplexity, LangChain이 실제로 구축하고 있는 에이전트 하네스를 심층 분석합니다. 오케스트레이션 루프, 도구, 메모리, 컨텍스트 관리 등 stateless LLM을 capable agent로 변환하는 모든 것을 다룹니다. 원문: The Anatomy of an Agent Harness 핵심 주장 챗봇을 만들어 ReAct 루프에 도구 몇 개를 연결하면 데모에서는 작동한다. 프로덕션을 시도하면 무너진다 — 모델이 3단계 전에 한 일을 잊고, 도구 호출이 조용히 실패하고, 컨텍스트 윈도우가 쓰레기로 채워진다. 문제는 모델이 아니다. 모델을 둘러싼 모든 것이다. ...

April 11, 2026 · 6 min

에이전틱 소프트웨어 엔지니어링 — 에이전트 구축은 쉽지만 프로덕션 운영은 분산 시스템 문제다

Ashpreet Bedi(Agno 창업자)가 에이전트 구축과 프로덕션 운영 사이의 격차를 지적하며, 에이전틱 소프트웨어를 분산 시스템으로 다뤄야 한다는 체계적 프레임워크를 제시합니다. 원문: Systems Engineering: Building Agentic Software That Works / Agentic Software Engineering 핵심 주장 “에이전트 구축은 쉽지만, 프로덕션 환경에서 안정적으로 운영하는 것은 어렵다” 사용자 식별, 상태 유지, 동시 요청 처리, 환불 같은 민감한 작업, 실패한 도구 호출 처리가 필요한 순간, 그것은 더 이상 “LLM + 도구의 루프"가 아닌 분산 시스템 이 된다. 에이전틱 소프트웨어 배포의 3단계 단계 설명 핵심 Build(구축) 모델, 도구, 지식베이스, 메모리, 저장소, 보호 장치 정의 AI 엔지니어링 중심. 대부분의 프레임워크가 지원하는 영역 Serve(서빙) API로서 제공. 사용자별 범위 지정, 세션 관리, 수평 확장 대부분의 에이전트 제품이 여기서 정체됨 — 인프라 부족 Connect(연결) 사용자가 있는 곳과 통합 (Slack, Discord, MCP 등) “노트북의 에이전트는 실험, 사용자가 있는 곳의 에이전트가 제품” 에이전틱 소프트웨어의 6가지 기둥 1. Durability(내구성) 에이전트가 15단계 중 12단계에서 충돌하면, 재시작 시 부작용이 중복되거나 중요 컨텍스트가 손실된다. 일시 중지, 재개, 체크포인트, 우아한 복구가 필요하며, 내구성은 완전 재시작이 아닌 재개로 실패를 전환 한다. ...

April 11, 2026 · 3 min

LLM 에이전트를 위한 강화학습 환경 분류법 — 모델이 아닌 환경이 에이전트의 행동을 결정한다

모델 아키텍처와 사후 학습(post-training)에만 집중하는 현재 AI 개발 패러다임을 비판하며, “에이전트가 무엇을 배울 수 있는지 결정하는 것은 강화학습 환경"이라고 주장합니다. 환경 설계가 시스템 성능의 절반을 차지한다는 것이 핵심입니다. 원문: RL Environments for LLM Agents 핵심 주장 단일 턴 Q&A로만 학습한 모델은 50단계 엔터프라이즈 워크플로우에서 실패하고, 보상 함수가 형편없으면 모델이 문제를 풀기보다 지표를 조작하도록 학습된다. 모델이 아닌 환경이 에이전트의 행동을 형성 한다. 정준 루프(Canonical Loop): E = {T, H, V, S, C} RL 환경을 다섯 가지 요소로 정의한다: ...

April 11, 2026 · 5 min

코딩 에이전트의 핵심 구성요소 — 모델이 아닌 하네스가 성능을 결정한다

Sebastian Raschka가 Claude Code, Codex 같은 코딩 도구들이 기존 채팅 인터페이스보다 강력한 이유는 더 나은 모델 때문이 아니라, 모델을 둘러싼 “에이전트 하네스(harness)“의 설계 때문이라고 분석합니다. 같은 모델이라도 다른 하네스에 넣으면 완전히 다른 성능을 보일 수 있습니다. 원문: Components of a Coding Agent 핵심 주장 “many real-world applications, the surrounding system, such as tool use, context management, and memory, plays as much of a role as the model itself” 최신 LLM들(GPT-5.4, Opus 4.6 등)의 기본 성능이 유사해진 지금, 하네스의 품질이 최종 성능의 차별화 요소 가 된다. ...

April 11, 2026 · 3 min

Marc Andreessen의 AI 혁명론: 80년의 밤샘 성공과 소프트웨어 아키텍처의 재발명

Latent Space 팟캐스트에 출연한 Marc Andreessen(a16z 공동창업자)이 현재 AI 붐을 1943년 신경망 이론부터 축적된 80년의 기초 연구가 결실을 맺는 역사적 전환점으로 진단하며, 소프트웨어 아키텍처의 근본적 변화를 논합니다. 원문: Marc Andreessen - Latent Space Podcast 핵심 프레임: “80년의 밤샘 성공 (80 Year Overnight Success)” 현재 AI 붐은 단순한 기술 사이클이 아니라, 1943년 신경망 이론부터 축적된 80년의 기초 연구가 결실을 맺는 순간 이라는 진단. 1. 이번이 진짜 다른 이유 — 4가지 돌파구 과거 AI는 붐-폭락(AI 겨울)을 반복했지만, 이번에는 4가지 기능이 동시에 작동 중: ...

April 11, 2026 · 3 min

AI 에이전트의 지속적 학습: 모델·하네스·컨텍스트 3계층 학습 프레임워크

LangChain CEO Harrison Chase가 AI 에이전트의 지속적 학습(Continual Learning)에 대해 제시한 프레임워크를 합니다. 에이전트의 “학습"은 모델 가중치 업데이트만을 의미하지 않으며, 3가지 서로 다른 계층에서 발생할 수 있다는 것이 핵심 주장입니다. 원문: Continual Learning for AI Agents 핵심 주장 AI 에이전트의 “학습"은 모델 가중치 업데이트만이 아니라, 3가지 계층에서 각각 독립적으로 발생 할 수 있다. 에이전트 시스템의 3계층 구조 계층 설명 예시 (Claude Code) 모델 계층 모델 가중치 자체 Claude Sonnet 하네스 계층 에이전트를 구동하는 코드·지시문·도구 Claude Code 자체 컨텍스트 계층 하네스 외부의 설정 가능한 지시문·스킬 CLAUDE.md, /skills 각 계층별 학습 방법 모델 계층 학습 — SFT, RL, GRPO 등 전통적 학습 기법 사용. 단, 재앙적 망각(catastrophic forgetting) 문제가 핵심 과제 (새 데이터 학습 시 기존 지식이 저하됨). ...

April 11, 2026 · 2 min

AI의 능력 향상은 비용 하락이 아닌 작업 범위 확대로 나타났다

AI 모델의 **능력(capability)**이 크게 향상된 것은 주로 **추론 비용(inference cost)**이 인간 노동 대비 더 저렴해졌기 때문이 아니라, 모델이 **더 길고 복잡한 작업(longer/harder tasks)**을 처리할 수 있게 되었기 때문이라는 점을 강조합니다. 능력 향상(예: METR의 frontier time horizons 기준으로 몇 달마다 배로 증가)은 관찰되지만, 이는 “같은 작업을 더 싸게 하는” 형태가 아닙니다. 오히려 추론 비용이 상승하는 경향을 보이는데, 이는 모델이 더 긴/어려운 작업을 수행하기 때문에 발생하는 자연스러운 현상입니다. (더 많은 compute/token을 소모) 현재 frontier 모델들은 50% 신뢰도(reliability) horizon에서 인간 비용의 약 3% 수준으로 작업을 수행하며, 이 비용 비율(인간 대비)은 능력 향상에도 크게 변하지 않고 있다는 데이터가 제시됩니다. 핵심 포인트 ...

March 31, 2026 · 1 min

AI 에이전트의 미래는 이미 와 있지만, 아직 균등하게 퍼지지는 않았다

AI 에이전트의 미래는 이미 와 있지만, 아직 균등하게 퍼지지 않았다 (William Gibson 인용). 테크 업계에서는 코딩 에이전트가 폭발적으로 성장 중. 긴 작업을 처리하고, 제품 전체를 에이전트로 만드는 사례가 속출. 모델 성능이 급격히 좋아지면서 코딩 분야가 가장 먼저 변하고 있음. 일반 지식 노동자 (비테크 기업 포함)에게는 아직 초기 단계. AI는 질문 답변·정보 검색 정도의 ‘도우미’ 역할에 그치고, 대규모 자동화·실제 업무 생산은 미미함. 그러나 현재 모델만으로도 화이트칼라 업무의 상당 부분을 바꿀 수 있고, 앞으로 2년 내 각 분야 전문가를 능가할 가능성이 매우 높음. 가장 큰 장벽 = Context Gap (맥락 부족) 에이전트가 제대로 일하려면 조직의 ‘집단 지식’이 AI에게 읽기 쉬운 형태로 제공되어야 하는데, 대부분 기업은 다음과 같은 문제로 어려움을 겪음: ...

March 31, 2026 · 2 min

분산된 지능에서 검증 가능한 책임으로: Vint Cerf의 인터넷 아키텍처 제안

이 글은 2026년 3월 18일경 BLOG@CACM에 게시된 것으로, 저자는 Mallik Tatipamula , David Attermann , 그리고 인터넷의 아버지로 불리는 Vinton G. Cerf (Vint Cerf)입니다. 핵심 논지 AI와 지능이 빠르게 분산화(distributed)되고 있는 현재 상황에서, 신뢰(trust) 와 책임(responsibility) 는 여전히 중앙화된 전통적 모델(특정 조직·인간 감독)에 의존하고 있어 심각한 불일치가 발생하고 있다. → 지능 분산 속도 » 신뢰/책임 메커니즘 발전 속도 따라서 “검증 가능한 책임(verifiable responsibility)” 또는 “검증 가능한 분산 신뢰(verifiable distributed trust)” 를 인터넷 아키텍처 수준에서 근본적으로 설계해야 한다는 주장을 펼칩니다. ...

March 21, 2026 · 2 min