AI 에이전트 기억 관리의 질문이 바뀌고 있습니다. 예전에는 기억을 얼마나 많이 쌓느냐를 물었다면, 오늘 논문들은 무엇을 남기고, 언제 줄이고, 같은 자료를 쓸수록 어떻게 나아지느냐를 묻습니다. 쌓는 일에서 고르는 일로 무게가 옮겨 간 것입니다.
지난 편과 이어 보겠습니다. 1화는 반복 업무의 절차와 지난 경험을 기억해 다시 쓰면 에이전트가 안정적이라는 이야기였습니다. 오늘은 그 기억이 무한정 쌓일 수 없다는 문제에서 출발합니다. 쌓인 기억 중 무엇이 쓸모 있고 언제 정리해야 하는지를 다룹니다.
먼저 줄이지 않는 쪽의 사례가 있습니다. VISTA는 모델이 환경을 눈으로 직접 보게 하고, 지난 관찰을 원래 모습 그대로 잃지 않고 보관하는 시각 기억을 둡니다. 모델은 필요할 때 그 관찰을 직접 꺼내 보며 입력을 다시 구성합니다. 연구진에 따르면 ARC-AGI-3에서 Claude Opus 5.0의 상대적 인간 행동 효율 점수가 40.68에서 100.00으로 올랐습니다. 공개 게임 25개를 모두 끝냈고, 처음 해 보는 사람보다 행동 수는 57.4% 적었습니다. 요약으로 깎지 않고 원본을 남긴 뒤 필요할 때 꺼내 쓰게 한 설계가 힘을 냈다는 이야기입니다.
반대편에는 줄이는 시점 자체를 배우게 하자는 연구가 있습니다. AutoCompact는 코드 저장소 단위의 긴 작업을 하는 코딩 에이전트를 다룹니다. 작업이 진행되면 앞서 살핀 내용은 낡기 마련이어서, 연구진은 문맥 관리를 넘침을 피하는 일이 아니라 판단의 문제로 봅니다. 언제 압축할지, 어떤 작업 상태를 보존할지, 압축한 뒤 어떻게 이어 갈지를 에이전트 정책의 일부로 훈련시킵니다. 훈련 자료는 다음 순서로 만듭니다.
요컨대 압축을 에이전트가 직접 하고, 그 압축이 맞았는지 따로 검토해 고쳐 가며 가르치는 방식입니다.
그렇다면 남길 기억은 무엇으로 고르느냐는 물음이 남습니다. Causal Memory Policy는 여기서 허점을 짚습니다. 기억이 한 번도 불려 나오지 않으면 그 기억이 도움이 되는지 알 길이 없다는 것입니다. 기억 저장소만 만져서는 결과가 똑같이 나오기 때문입니다. 연구진은 검색 단계에 직접 개입해 문맥 자리 일부를 따로 떼어 두고, 알려진 확률로 뽑은 기억을 채워 넣어 효용을 추정합니다. 안 쓰인 기억은 버려도 되는지 알 수 없다는 점을 정면으로 다룬 연구입니다.
마지막으로 SourceLearn은 같은 자료를 반복해서 쓰는 상황을 봅니다. 기존 방식은 같은 출처를 다시 쓰는 일을 그저 반복 접근으로 취급했습니다. 연구진은 이를 그 출처에 대한 이해를 키울 기회로 보고, 지식이 어떻게 짜여 있고 해석되고 쓰이는지를 담은 출처 모델을 만들어 갈수록 다듬는 방법을 제안합니다.
네 연구는 방향이 다릅니다. 하나는 원본을 지키고, 하나는 압축 시점을 배우고, 하나는 남길 기억의 효용을 재고, 하나는 같은 자료로 이해를 키웁니다. 공통점은 기억을 저장 용량 문제가 아니라 선택의 문제로 본다는 것입니다.
그래서 실무자가 볼 대목은 세 가지입니다. 첫째, AI 에이전트 기억 관리를 내세운 도구가 무엇을 남기고 무엇을 줄이는지, 그 기준이 드러나 있는지 봐야 합니다. 둘째, 압축한 뒤에도 일이 이어지는지, 즉 요약이 성과로 검증되는지 봐야 합니다. 셋째, 같은 자료를 반복해 쓸 때 정말 나아지는지 봐야 합니다. 다만 오늘 사례는 모두 연구 환경의 결과입니다. 내 업무에서도 같은 효과가 나는지는 별개이니, 쓰는 도구가 기억을 어떻게 다루는지부터 확인해 보시기 바랍니다.



