새 모델로 갈아탄 뒤, 비서가 낯설어졌다면

새 모델이 나왔다는 소식에 곧바로 갈아탔더니, 몇 달 동안 쌓아 둔 AI 비서의 메모를 엉뚱하게 해석하기 시작한 경험이 있으실 것입니다. 거래처별 주의 사항, 지난 기획안의 결론, 고객 응대 원칙처럼 공들여 적어 둔 기록이 그대로 남아 있는데도 답이 어긋납니다. 파일은 한 줄도 지워지지 않았는데 비서는 기억을 잃은 것처럼 행동합니다.

1인 사업자에게 이 문제는 사소하지 않습니다. 비서의 메모가 곧 업무 기록이고, 그 기록을 다시 쌓는 데는 몇 달이 걸리기 때문입니다. 모델 교체는 몇 달마다 반복되는 일상이 되었는데, AI 에이전트 메모리 이전은 아무도 챙기지 않는 빈칸으로 남아 있습니다.

어떤 연구인가

Ankit Goyal과 Jaideep Ray가 쓴 이 논문은 그 빈칸을 통제 실험으로 따져 봅니다. 연구진이 던진 질문은 하나입니다. 같은 메모리 저장소를 그대로 두고 모델만 바꾸면, 에이전트는 무엇을 어떻게 잊는가 하는 것입니다.

연구진은 잊는 경로를 세 가지로 짚습니다. 새 모델이 옛 노트를 다르게 해석하는 것, 서로 다른 버전의 임베딩이 한 색인 안에 섞여 검색이 깨지는 것, 그리고 원본 근거가 없어 복구가 실패하는 것입니다.

실험은 같은 이력을 네 가지 방식으로 보관해 비교합니다. 원문을 그대로 두고 긴 컨텍스트로 읽는 방식(LC-RAW), 청크로 나눠 검색 증강 생성에 쓰는 방식(RAG), 모델이 자연어 노트로 압축하는 방식(NOTES), 고정된 스키마의 지식 그래프로 정규화하는 방식(KG-fixed)입니다. 재료는 48개의 합성 이력이며, 정답 코드를 무작위로 배정하고 정확히 맞혔는지만 채점했습니다. 모델은 매개변수 100억 미만의 공개 가중치 모델 두 가지를 썼습니다.

무엇을 발견했나

결과는 보관 방식에 따라 크게 갈렸습니다. 연구진이 이전 성적을 수치로 보고한 세 방식을 한눈에 놓고 보면 다음과 같습니다.

모델을 바꾼 뒤 세 가지 메모리의 성적고정 스키마 그래프정확도 변화 0.0004사실상 그대로 이전요약 노트+9.91 또는 -13.28포인트이전 방향 따라 요동청크 검색전부 재임베딩 +11.90포인트절반만 바꾸면 +4.96포인트

고정 스키마는 거의 흔들리지 않았고, 요약 노트는 모델에 단단히 묶여 있었으며, 검색 방식은 임베딩을 절반만 바꾸면 이득의 대부분을 잃었습니다.

연구진은 한 걸음 더 들어가 손실이 어디서 생기는지 분해했습니다. 요약 노트의 정확도 결손은 80%가 처음 노트를 만들 때 정보가 빠져나간 데서 비롯했습니다. 반대로 검색 방식의 결손은 81%가 검색 실패에서 나왔습니다. 두 방식이 잊는 이유가 서로 다르다는 뜻입니다.

복구 실험도 눈여겨볼 대목입니다. 요약 노트를 저장소만 가지고 고치려 하면 48건 모두 90% 회복 목표에 닿지 못했습니다. 그러나 원본 이력을 함께 보관해 두었을 때는, 한 이전 방향에서 48건 중 34건이 목표에 닿았습니다.

실무에 적용하면

첫 번째 행동은 원본을 지우지 않는 것입니다. 비서가 요약해 준 노트가 깔끔해 보여도, 그 노트를 만들어 낸 대화 기록과 문서 원본을 따로 보관해 두십시오. 모델을 바꾼 뒤 비서가 이상해지면 노트를 손보는 대신 원본에서 다시 만들어야 하고, 그때 원본이 없으면 손을 쓸 수 없습니다.

두 번째는 교체 전에 작게 시험하는 것입니다. 이 연구가 보여 준 대로 메모리 이식은 방향에 따라 결과가 다릅니다. 자주 묻는 질문 스무 개쯤을 골라 답을 적어 두고, 새 모델로 바꾼 뒤 같은 질문을 던져 보십시오. 어긋난 답이 몇 개인지가 갈아타도 되는지 알려 주는 신호입니다.

세 번째는 검색 기반 비서를 쓰신다면 임베딩을 절반만 바꾸지 않는 것입니다. 옛 색인과 새 색인을 한 곳에 섞어 두는 편법은 이득의 대부분을 잃습니다. 바꾸려면 전부 다시 만들거나, 새 색인이 준비될 때까지 옛 것을 그대로 쓰십시오.

마지막으로, 오래 남길 기억일수록 정해진 틀에 넣어 두는 편이 안전합니다. 거래처 이름, 조건, 날짜처럼 항목이 분명한 정보는 자유로운 문장보다 표나 고정된 양식으로 보관하면 모델이 바뀌어도 읽는 법이 흔들리지 않습니다.

주의할 점

이 연구는 합성한 이력 48개와 정확히 맞혔는지만 보는 채점 방식으로 진행됐습니다. 실제 사업 기록처럼 맥락이 얽힌 자료에서 같은 폭의 차이가 날지는 따로 확인이 필요합니다. 모델도 매개변수 100억 미만의 공개 모델 두 가지에 한정되어 있어, 더 큰 모델이나 상용 서비스에 그대로 옮겨 말하기는 어렵습니다.

복구 결과 역시 한 이전 방향에서 얻은 수치입니다. 반대 방향에서도 원본이 같은 힘을 발휘할지는 이 논문이 보고한 결과만으로는 알 수 없습니다. 그럼에도 원본을 남기고, 방향별로 시험하고, 임베딩 공간을 섞지 않는다는 세 가지 원칙은 기억을 옮길 때마다 규모와 상관없이 적용할 수 있는 실무 지침으로 읽힙니다.