2025년 5월 어느 날, 앤스로픽 CEO 다리오 아모데이가 AI 개발 속도를 늦춰야 한다는 취지의 발언을 공개 석상에 올렸습니다. 며칠 지나지 않아 도널드 트럼프 전 대통령과 마이크 존슨 하원의장이 이를 두고 "과잉 반응"이라 응수했고, 버락 오바마는 민주당을 향해 "AI에 관한 명확한 계획을 내놓으라"고 촉구했습니다. 속도 조절 논쟁은 연구소 내부 메모나 학술 컨퍼런스에 머물지 않고, 미국 정치 무대의 언어로 재편되기 시작했습니다.
같은 날 샌프란시스코에서는 전혀 다른 발표가 나왔습니다. 리처드 소처 전 세일즈포스 AI 수석이 창업한 스타트업 Recursive가 공식 론칭하며 기업 가치 50억 달러로 평가받았습니다. Recursive의 목표는 AI가 스스로를 개선하는 속도를 높이는 것, 즉 가속화입니다. 속도를 늦추자는 주장이 의회 회의실에서 오가는 시각에, 속도를 높이기 위한 자본이 실리콘밸리 회의실로 몰렸습니다.
한국의 1인 사업자나 소규모 팀 운영자에게 이 장면이 왜 중요한지는 잠시 후에 짚겠습니다. 먼저 이 시기에 동시에 올라온 두 번째 신호를 살펴봐야 합니다.
AI 정치화는 빠르게 진행됐고, 기업들은 그 사이에서 문서를 냈습니다
아모데이의 발언이 정치 무대로 넘어가는 데 걸린 시간은 일주일이 채 되지 않았습니다. 속도 조절 논쟁은 앤스로픽 내부에서 이미 균열 조짐이 있었지만, 워싱턴에서 재연되면서 성격이 달라졌습니다. 안전 연구자들의 기술적 우려가 정당 간 입장 차이로 포장되기 시작한 것입니다.
마이크로소프트는 이 시점에 37쪽짜리 AI 행동강령을 공개했습니다. 문서의 분량 자체가 하나의 신호입니다. "AI를 책임감 있게 사용하겠다"는 한 줄 선언이 아니라, 내부 임직원과 파트너사가 따라야 할 구체적 기준을 문서화했습니다. 정치 논쟁이 뜨거워지는 시점에 기업이 자체 기준을 먼저 명문화하는 방식은, 규제가 외부에서 오기 전에 내부 규범을 세우는 선제적 대응으로 읽힙니다.
Recursive의 50억 달러 론칭은 정반대 방향을 가리키는 데이터입니다. 벤처 투자자들은 속도 조절 논쟁이 한창인 시점에도 가속화 스타트업에 배팅했습니다. 이 두 사건이 같은 날 일어났다는 것은, 현재 AI 산업이 규제와 가속화라는 두 방향으로 동시에 움직이고 있음을 보여 줍니다. 어느 쪽이 옳은지는 아직 아무도 확정하지 못했습니다.
에이전트가 "맞다"고 해도, 맞는 건지 확인할 방법이 흔들리고 있습니다
정치 논쟁과 별개로, 이 시기 연구계에서 다른 방향의 우려가 동시에 제기됐습니다. 에이전트 평가 자체의 신뢰성 문제입니다.
아마존이 연구 에이전트 관련 분석을 발표하면서 벤치마크 과적합 문제를 다뤘습니다. 에이전트가 실제로 잘 작동하는 것이 아니라, 평가 기준에 맞춰 점수를 잘 받는 방식으로 학습되었을 수 있다는 이야기입니다. 이와 별도로, LLM이 다른 LLM의 출력을 평가하는 'LLM 판사(judge)' 방식이 얼마나 신뢰할 수 있는지를 따진 연구도 공개됐습니다. LLM 판사들끼리 합의했다고 해서 그것이 정답을 보장하지는 않는다는 결론이었습니다.
여기에 더해 논문 한 편이 주목받았습니다. 「Look Before You Leap」이라는 제목의 이 연구는 에이전트가 오류 메시지 없이 조용히 틀리는 상황을 분석했습니다. 에이전트가 멈추거나 경고를 내보내지 않고 그냥 틀린 방향으로 계속 진행한다는 것입니다. 에러가 눈에 보이지 않으면 사람이 개입할 타이밍도 사라집니다.
보안 영역에서도 비슷한 사건이 불거졌습니다. OpenAI의 봇이 RubyGems의 보안 취약점을 이미 알고 있었다는 사실이 커뮤니티에서 공개됐습니다. AI가 취약점을 탐지했지만 그 정보가 제대로 처리되지 않았던 셈입니다.
이 네 가지 사건은 서로 다른 맥락에서 나왔지만, 가리키는 방향은 겹칩니다. AI 에이전트가 출력한 결과를 검증하는 방법 자체가 아직 충분히 검증되지 않았다는 것입니다. 평가 도구가 흔들리면, 결과물에 대한 신뢰 근거도 함께 흔들립니다.
이 지점에서 커리어 설계와 조직 관리에 관한 오래된 관찰 하나가 떠오릅니다. 어떤 직무든 리더급 자리에 오르면 반드시 마주치는 문제가 있는데, 숫자를 어떻게 읽느냐의 문제입니다. 특히 같은 숫자를 두고 여러 해석이 가능할 때, 어떤 기준으로 판단하느냐가 갈립니다. AI 에이전트의 출력도 같은 구조입니다. 에이전트가 내놓은 숫자나 판단을 어떤 기준으로 검토할 것인지, 그 기준 자체를 조직 안에 갖춰두는 것이 앞으로 점점 더 중요해집니다.
속도 논쟁보다 먼저 점검할 것은 검증 계층입니다
한국의 1인 사업자나 소규모 팀이 이 흐름에서 당장 꺼내야 할 질문은 "AI 속도 조절에 어느 편을 드느냐"가 아닙니다. 그 질문은 정책 입안자들이 다툴 영역입니다.
현장에서 더 직접적인 질문은 이것입니다. "우리 팀이 AI 에이전트의 출력을 신뢰하는 근거는 무엇인가?"
이 질문에 답하려면 세 가지를 따져봐야 합니다.
출력 검증 방식이 있는가. AI가 리서치 결과를 내놓거나, 콘텐츠 초안을 작성하거나, 고객 응대 문구를 생성할 때 그것을 누가 어떤 기준으로 검토하는지를 확인해야 합니다. "한 번 읽어보고 괜찮으면 올린다"는 방식은 에이전트의 조용한 오류를 걸러내기 어렵습니다. 특히 에이전트가 틀렸을 때 오류 신호를 주지 않는다는 점이 이번 연구에서 강조됐습니다. 검토 기준을 문서로 만들지 않으면, 사람이 바뀌거나 피로도가 높아졌을 때 검증이 무너집니다.
평가 지표가 실제 성과와 연결되는가. AI 도구를 도입한 뒤 "응답 속도가 빨라졌다" "초안 생성 시간이 줄었다"는 지표를 쓰는 경우가 많습니다. 그런데 그 지표가 실제 고객 만족이나 계약 성사율과 연결되는지는 별도로 확인이 필요합니다. 벤치마크 점수가 높다고 실제 업무 성과가 높은 것은 아니라는 아마존의 분석은 기업 연구소뿐 아니라 소규모 팀에서도 같은 방식으로 적용됩니다.
독립 검증 계층이 있는가. AI 판사가 AI 출력을 평가하는 구조, 즉 AI끼리 서로를 검토하는 방식은 이번 연구에서 신뢰성에 의문이 제기됐습니다. 소규모 팀에서 AI 도구를 여러 개 쌓을 때도 같은 문제가 생깁니다. 챗GPT 초안을 클로드가 검토하고 그 결과를 다시 AI 요약 도구로 정리하는 방식은 루프가 닫혀 있어서, 모두 같은 방향으로 틀렸을 때 아무도 걸러내지 못합니다. 루프 바깥에 사람이 있는 검토 단계를 한 곳 이상 두는 것이 현재로선 현실적인 방어입니다.
지금 시도해볼 수 있는 구체적인 방식은 간단합니다. AI 에이전트가 한 달간 처리한 작업 중 샘플 10건을 골라서 처음부터 다시 검토해 보는 것입니다. 에이전트가 틀리거나 누락했는데 그냥 넘어간 사례가 몇 건인지를 직접 세어보면, 검증 계층이 얼마나 필요한지 감이 생깁니다.
마이크로소프트가 37쪽 분량의 내부 기준을 만든 이유도 같은 맥락에서 읽힙니다. 외부 규제가 정해지기 전에 내부에서 먼저 기준을 만드는 것, 그 기준을 문서로 남기는 것이 나중에 책임 소재를 따질 때 방어선이 됩니다. 대기업의 이야기지만, 구조는 1인 사업자에게도 같습니다. AI 도구를 쓰다가 고객에게 잘못된 정보가 전달됐을 때, "AI가 그렇게 냈습니다"는 해명이 되지 않습니다.
워싱턴의 정치 논쟁이 어느 방향으로 기울든, 실무자에게 남는 과제는 단순합니다. AI가 낸 결과를 누가, 어떤 기준으로, 어떤 주기로 검토하는지를 팀 안에서 명확히 해두는 것입니다. 그 기준이 없는 상태에서 도구를 늘리면, 속도는 빨라지지만 오류가 쌓이는 속도도 함께 빨라집니다.



