어제는 되던 일이 오늘은 안 되는 이유
n8n이나 Claude로 반복 업무를 자동화해 두었는데, 어제는 잘 되던 작업이 오늘은 엉뚱하게 실패해서 결국 손으로 다시 확인한 적이 있으실 겁니다. 매일 아침 경쟁사 소식을 모아 요약해 두라고 시켰더니 어느 날은 깔끔하게 정리되고, 어느 날은 엉뚱한 페이지를 읽고 와서 다른 이야기를 늘어놓는 식입니다.
이런 일이 반복되면 결국 사람이 매번 결과를 열어 보게 됩니다. 자동화를 했는데 확인 업무가 하나 더 생긴 셈입니다. 1인 사업자에게는 시간을 아끼려고 만든 장치가 오히려 시간을 잡아먹는 일입니다.
이 문제를 정면으로 다룬 논문이 나왔습니다. Evelyn Duesterwald 연구진이 arXiv에 올린 이 논문은, AI 에이전트가 평균적으로는 정확하면서도 실제 운영에서는 믿기 어려운 현상에 이름을 붙이고, 그 격차를 줄이는 방법을 제안합니다.
어떤 연구인가
연구진이 던진 질문은 단순합니다. 에이전트가 한 번 시켜서 성공하는 비율과, 같은 일을 여러 번 시켜서 매번 성공하는 비율은 얼마나 다른가 하는 것입니다. 이들은 AppWorld라는 벤치마크에서 GPT-4.1 기반의 ReAct 에이전트에게 같은 과제를 다섯 번씩 반복시키고, 다섯 번 모두 성공하는 비율을 따로 쟀습니다. 평균 성공률과 이 '전부 성공' 비율의 차이를 연구진은 일관성 격차라고 부릅니다.
격차를 줄이는 방법으로 연구진은 스스로 진화하는 에이전트 틀을 제안합니다. 핵심은 두 부품입니다. 하나는 일관성 분석기로, 에이전트의 실행 궤적 가운데 실행할 때마다 결과가 뒤집히기 쉬운 단계가 어디이고 왜 그런지를 짚어냅니다. 다른 하나는 지침 생성기로, 그 진단을 구체적인 지침으로 바꿉니다. 이 지침은 에피소드 기억에 저장되었다가, 다음에 비슷한 과제를 만나면 에이전트의 실행에 주입됩니다. 흔들리는 단계가 지침이 되어 기억으로 남는 과정을 순서대로 놓으면 다음과 같습니다.
한 번 실패한 지점을 진단해 지침으로 남기고, 그 지침을 다음 실행이 물려받는 순환 구조입니다.
무엇을 발견했나
연구진이 먼저 확인한 것은 격차의 크기입니다. GPT-4.1 기반 ReAct 에이전트의 1회 실행 기준 평균 성공률은 77%였습니다. 그런데 같은 과제를 다섯 번 시켰을 때 다섯 번 모두 성공한 비율은 53%에 그쳤습니다. 두 수치의 차이인 24포인트가 일관성 격차입니다. 평균으로 보면 꽤 믿음직한 에이전트라도, 다섯 번 연달아 맡기면 절반 남짓만 끝까지 믿을 수 있다는 뜻입니다.
연구진은 이 격차가 이전에도 관찰되었지만 제대로 다뤄지지 않았다고 지적하며, 격차를 줄이는 것이 에이전트를 믿고 배치하기 위한 전제 조건이라고 주장합니다.
제안한 틀을 적용한 결과, 다섯 번 모두 성공하는 과제의 비율이 같은 과제에서는 16포인트, 비슷하지만 다른 과제로 일반화했을 때는 13포인트 올랐습니다. 격차를 완전히 없애지는 못했지만, 어느 단계가 왜 흔들리는지를 기억으로 남기는 것만으로 상당 부분을 메운 셈입니다.
실무에 적용하면
이 연구가 1인 사업자와 기획자에게 주는 가장 큰 교훈은 지표를 바꾸라는 것입니다. AI 에이전트 자동화 신뢰성을 잴 때 평균 성공률은 믿을 만한 기준이 못 됩니다. 같은 일을 다섯 번 시켜 다섯 번 다 되는지가 실무에서 맡길 수 있는 기준입니다.
새 자동화를 붙이기 전에 같은 입력으로 다섯 번 돌려 보십시오. 한 번 잘 되는 것을 보고 배포하면, 나중에 손으로 확인하는 비용을 치르게 됩니다. 다섯 번 중 한 번이라도 어긋나면 그 자동화는 아직 사람 감독이 필요한 단계입니다.
실패했을 때는 결과만 보지 말고 어느 단계에서 갈렸는지 적어 두십시오. 연구진의 일관성 분석기가 하는 일을 사람이 손으로 하는 셈입니다. 어떤 페이지를 잘못 읽었는지, 어떤 조건에서 다른 길로 갔는지가 보이면, 그것을 프롬프트나 워크플로우의 명시적 지침으로 바꿔 넣습니다. 논문이 말하는 에피소드 기억을 실무로 옮기면 이런 모습입니다. 흔들린 지점을 지침으로 남기는 습관이 쌓이면 에이전트 자동화의 신뢰성은 실행할수록 올라갑니다.
주의할 점
이 결과는 AppWorld라는 벤치마크 하나, ReAct라는 에이전트 방식 하나, GPT-4.1이라는 모델 하나에서 얻은 것입니다. 다른 모델이나 다른 종류의 업무에서도 같은 크기의 격차와 개선이 나타날지는 초록만으로 알 수 없습니다.
개선 폭도 제한적입니다. 24포인트 격차 가운데 같은 과제에서는 16포인트를 좁혔고, 비슷한 과제로 옮기면 13포인트로 줄어듭니다. 격차가 남아 있다는 뜻이며, 자동화를 완전히 무감독으로 두어도 된다는 근거는 아닙니다. 지침을 쌓는 데 드는 비용이나 실행 속도에 미치는 영향 역시 초록에는 나와 있지 않습니다.
그럼에도 이 논문이 던지는 질문은 분명합니다. 내 에이전트는 다섯 번 시켜 다섯 번 다 되는가 하는 것입니다. 그 질문을 배포 전에 던지는 것만으로도 손으로 다시 확인하는 아침은 줄어듭니다.



