AI 에이전트 자기 개선이 이제 낯선 말이 아닙니다. 에이전트가 일을 하며 겪은 것을 글로 된 기술이나 기억으로 정리하고, 다음 일을 할 때 꺼내 쓰고, 고쳐 씁니다. 그런데 최근 연구들은 한 걸음 물러서서 묻기 시작했습니다. 이렇게 좋아졌다는 성과가 처음 보는 일에도 통하는지, 에이전트가 스스로 매긴 점수에 속은 건 아닌지 따져 보는 것입니다.

지난 편에서는 에이전트가 매번 계획을 새로 세우지 않고 절차와 경험을 기억해 다시 쓰면 더 안정적이라는 흐름을 살폈습니다. 오늘은 그 흐름이 꺾입니다. 기억해 쓰는 것이 좋다는 데까지는 같지만, 스스로 쌓은 기억이 정말 쓸모 있는지를 누가 어떻게 확인하느냐가 새 질문이 됐습니다.

기술을 더 잘 쌓으려는 시도는 계속 나옵니다. Rep2Skill 연구진은 지금까지의 기술 개선이 실행 기록과 성공·실패 결과라는 글만 보고 이루어졌다는 데 주목했습니다. 그래서 에이전트 모델 안쪽의 내부 상태 흐름을 살펴, 성공한 실행에서 벗어나기 시작한 지점을 찾아내고 그 자리를 기술 수정에 쓰는 방식을 내놓았습니다. RefCon 연구진은 기억을 뽑아내는 과정에 계산을 더 들이는 쪽을 택했습니다. 한 번 뽑은 기억을 차례로 다듬고, 여러 후보를 나란히 견주는 방식입니다. 정답 데이터 없이도 ACE 방식에서 21.6%, ReMe 방식에서 16.6%의 상대적 향상을 얻었고, 다양성을 중시한 변형은 ReasoningBank 방식에서 35.5%를 올렸다고 합니다.

문제는 이 향상이 어디서 측정됐느냐입니다. 자기 진화 기술이 처음 보는 과제에도 통하는지를 다룬 한 연구는 이 질문을 정면으로 던졌습니다. 다섯 가지 자기 진화 방법과 한 번에 만든 기술 하나를 여섯 개 벤치마크에서 같은 모델, 같은 에이전트, 같은 훈련·시험 분할로 견줬습니다. 훈련 과제에서 좋아진 기술 21개가 시험 과제에서 어떻게 됐는지는 다음과 같습니다.

훈련 성과는 새 과제로 얼마나 옮겨졌나훈련에서 좋아진 기술 21개처음 보는 과제에 적용전부 유지 5개일부만 유지 13개전혀 유지 못함 3개

향상을 고스란히 지킨 기술은 넷 중 하나도 되지 않았습니다. 모든 곳에서 가장 나은 방법도 없었습니다. 연구진이 기술 내용을 직접 읽어 보니, 잘 옮겨지지 않은 기술은 훈련 과제의 세부 사항을 손보는 경우가 많았다고 합니다. 연습 문제에 맞춰 고친 요령이 새 문제에서는 힘을 잃는 셈입니다.

더 까다로운 문제는 에이전트가 스스로 채점할 때 생깁니다. False Frontiers 연구진은 문제를 내는 쪽과 푸는 쪽을 함께 키우는 검색 에이전트를 살폈습니다. 이렇게 닫힌 고리에서는 출제자와 풀이자가 같은 오류에 점점 동의하게 되고, 내부 점수는 오르는데 실제 정답률은 따라 오르지 않습니다. 연구진은 이를 공모형 속임수라고 불렀습니다. 원래 근거 자료와 대조해 보니 이 현상은 개선을 거듭할수록 심해졌고, 학습에 쓰인 임시 정답의 정확도는 제자리이거나 오히려 떨어졌습니다. 연구진은 같은 모델에 근거 자료를 주고 세 번, 주지 않고 세 번 물어 문제를 걸러내는 검증법을 제안했습니다. 다만 거짓 합의를 일부 줄였을 뿐 상당 부분이 남았다고 스스로 밝혔습니다.

그래서 무엇을 보고 있어야 하는가. AI 에이전트 자기 개선을 내세우는 도구나 연구를 볼 때, 향상 수치가 훈련에 쓴 과제에서 나왔는지 처음 보는 과제에서 나왔는지부터 확인하는 것이 좋습니다. 점수를 매긴 주체가 에이전트 자신인지, 바깥의 근거인지도 함께 살펴야 합니다. 직접 에이전트를 쓰는 실무자라면 쌓인 기술이나 기억을 가끔 열어 읽어 보는 것도 방법입니다. 특정 사례에만 맞는 세부 지시가 늘고 있다면, 그 향상은 새 일에서 줄어들 수 있다는 신호입니다.