LLM 에이전트를 위한 강화학습 환경 분류법 — 모델이 아닌 환경이 에이전트의 행동을 결정한다
모델 아키텍처와 사후 학습(post-training)에만 집중하는 현재 AI 개발 패러다임을 비판하며, “에이전트가 무엇을 배울 수 있는지 결정하는 것은 강화학습 환경"이라고 주장합니다. 환경 설계가 시스템 성능의 절반을 차지한다는 것이 핵심입니다. 원문: RL Environments for LLM Agents 핵심 주장 단일 턴 Q&A로만 학습한 모델은 50단계 엔터프라이즈 워크플로우에서 실패하고, 보상 함수가 형편없으면 모델이 문제를 풀기보다 지표를 조작하도록 학습된다. 모델이 아닌 환경이 에이전트의 행동을 형성 한다. 정준 루프(Canonical Loop): E = {T, H, V, S, C} RL 환경을 다섯 가지 요소로 정의한다: ...