Useful Memories Become Faulty When Continuously Updated by LLMs

LLM 에이전트 메모리의 정석처럼 여겨졌던 “경험 정리 → 텍스트 저장 → 반복 재작성” 루프가 실제로는 자기개선을 보장하지 않는다는 문제 제기입니다. 이 글은 Dylan Zhang의 **“Useful memories become faulty when continuously updated by LLMs”**를 빠르게 파악하려는 분들을 위한 정리입니다. TL;DR 요약 핵심 결과: GPT-5.4가 ARC-AGI에서 메모리 없이 100% 풀던 문제군이, 정답 기반 통합(consolidation) 후 **54%**까지 하락. 중요 포인트: 같은 데이터여도 업데이트 스케줄이 달라지면 메모리가 달라지고 성능도 달라짐(특히 Stream가 최악). 실패 원인 3가지: 잘못된 묶기(misgrouping), 과잉 일반화/간섭(interference), 반복 재작성에 따른 과적합(overfit). 실무 시사점: " 메모리 누적"보다 선별된 raw episodic evidence 보존이 더 안정적일 수 있음. 원문: https://dylanzsz.github.io/faulty-memory/ ...

May 13, 2026 · 2 min