2025년 5월, OpenAI는 밀레니엄 수학 난제 중 하나인 나비에-스토크스 방정식 관련 풀이를 공개했습니다. 수학계가 100년 넘게 매달린 문제였습니다. 발표 직후 수학 커뮤니티의 반응은 축하가 아니었습니다. MIT 수학과 교수 한 명은 소셜미디어에 짧게 남겼습니다. "검증 가능한 증명이 없으면 발표가 아니라 주장입니다." Fields 메달리스트들이 모인 포럼에서도 분위기는 비슷했습니다. 풀이 과정이 공개되지 않았고, 동료 검토 절차를 거치지 않았으며, 재현에 필요한 코드도 없었습니다. 학계가 냉담했던 이유는 결과의 진위가 아니라 방식의 불투명함 때문이었습니다.
같은 주에 나온 다른 소식은 다른 방향을 가리켰습니다. 인도 오디오 콘텐츠 플랫폼 포켓FM은 AI 도입 이후 제작비를 80분의 1 수준으로 낮추면서 매출은 두 배로 끌어올렸다고 밝혔습니다. 숫자만 보면 극적이지만, 수치의 맥락이 흥미롭습니다. 이 회사가 AI를 쓴 방식은 콘텐츠 '창작'이 아니라 오디오 드라마 대본 초안 생성과 성우 대화 후처리였습니다. 사람이 기획하고 편집하고 큐레이션했습니다. 비용 감소의 실체는 반복 작업의 위임이었습니다.
두 사건을 나란히 놓으면 지금 AI 산업이 어디쯤 서 있는지 조금 다르게 보입니다.
성능 발표와 신뢰 기반이 따로 움직이는 이유
14종 LLM을 대상으로 진행한 에이전트 신뢰성 실험 논문이 5월에 arXiv에 올라왔습니다. 실험 설계는 단순했습니다. 에이전트에게 도구(tool)를 사용해 문제를 풀게 하되, 도구가 오류를 반환하거나 잘못된 결과를 돌려주는 상황을 삽입했습니다. 에이전트 대부분은 도구 결과를 의심하지 않고 그대로 다음 단계로 넘어갔습니다. 정답인지 확인하는 절차 없이 오류를 기정사실로 처리했습니다. 논문은 이 현상을 "도구 과신(tool over-trust)"이라고 불렀습니다.
이 실험 결과를 OpenAI 수학 풀이 발표와 붙여보면 하나의 패턴이 보입니다. 성능 곡선은 가파르게 오르는데, 검증 체계는 그 속도를 따라가지 못합니다. OpenAI가 수학 풀이를 발표하면서 동료 검토 없이 먼저 홍보채널에 올린 것, 에이전트가 잘못된 도구 결과를 신뢰하는 것은 현상의 층위는 다르지만 같은 구조적 약점에서 출발합니다. 출력이 나왔다는 것과 출력이 맞다는 것을 구분하는 절차가 없거나, 있어도 생략된다는 점입니다.
학계가 냉담했던 이유는 여기 있습니다. 수학계는 수백 년에 걸쳐 "주장은 검증 가능한 형태로 공개해야 한다"는 규범을 쌓아왔습니다. 어떤 연구자가 증명했다고 말해도, 다른 수학자가 같은 과정을 따라가며 오류를 찾을 수 있어야 합니다. OpenAI의 발표는 그 규범과 맞지 않았습니다. 결과물만 있고 과정이 없으면, 수학계 언어로는 증명이 아닙니다.
비즈니스 세계에서 이 간극은 다른 형태로 나타납니다. AI 에이전트가 민원을 대리 신청하거나, 계약서 초안을 작성하거나, 고객 응대를 처리하는 상황에서 출력이 나왔다는 것과 출력이 맞다는 것을 누가 어떻게 확인하는지가 점점 중요해집니다. 에이전트가 공공 민원을 대량으로 처리하기 시작하자 일부 지방정부 행정 시스템이 처리 용량을 초과하는 일이 생겼습니다. 성능이 올라갔기 때문에 발생한 문제였습니다. 규제보다 배포가 먼저 임계점에 닿은 사례입니다.
유니버설뮤직이 AI 스타트업과의 소송 대신 라이선스 계약을 선택했다는 소식도 이 맥락에서 읽힙니다. 싸워서 이기는 것보다 조건을 협상하는 쪽이 빠르다고 판단했을 것입니다. 법정 싸움의 결론이 나오려면 수년이 걸리고, 그사이 시장은 다른 방향으로 움직입니다. 소송을 접고 계약을 선택한 것은 AI와 콘텐츠 산업 사이의 긴장이 해소됐다는 신호가 아니라, 양측 모두 불확실성을 줄이는 쪽을 택했다는 신호입니다.
1인 사업자가 읽어야 할 것은 성능 수치가 아닙니다
포켓FM 사례로 돌아옵니다. 이 회사가 얻은 80분의 1 비용 절감은 화려하지만, 그 방식을 들여다보면 AI 도입에서 흔히 기대하는 것과 다른 경로를 걷고 있습니다. AI가 창작물을 통째로 만들어낸 게 아니라, 반복 작업의 위임과 사람의 큐레이션이 결합된 결과입니다. 어떤 부분을 위임할지 판단하는 역량이 없으면 비용 절감이 아니라 품질 하락으로 끝납니다.
커리어와 사업 설계를 같은 시선으로 바라보는 관점이 있습니다. 직장이든 사업이든, 버티는 것과 성장하는 것은 다른 방향을 가리킵니다. AI 도구를 쓰면서 버티는 쪽을 선택하면 비용만 줄고, 성장하는 쪽을 선택하면 뭘 위임하고 뭘 남길지를 계속 갱신해야 합니다. 포켓FM이 한 것도 그 갱신이었습니다.
1인 사업자나 소규모 팀을 이끄는 디렉터 입장에서 지금 시점에 점검할 사항을 구체적으로 정리해 보겠습니다.
출력 확인 절차를 만들어두셨나요. AI가 계약서 조항을 썼을 때, 제안서 수치를 정리했을 때, 고객 응대 문구를 초안 냈을 때, 그 결과물을 어떤 방식으로 검토하는지를 명시해두지 않으면 에이전트의 도구 과신 실험 결과가 당신의 업무에서도 재현됩니다. 단순히 "한 번 읽어본다"는 수준이 아니라 어떤 항목을 어떤 기준으로 점검하는지를 문서로 남기는 것이 출발입니다.
위임 가능한 작업과 판단이 필요한 작업을 분류해두셨나요. 포켓FM이 대본 초안 생성을 AI에 넘기고 큐레이션은 사람이 유지한 것처럼, 어느 지점에서 사람의 판단이 들어가야 하는지를 사전에 정해두지 않으면 검토 없이 결과물이 나갑니다. 지금 당장 작업 목록을 꺼내 반복·규칙 기반·자료 취합 성격의 업무와 판단·조율·관계 성격의 업무를 구분해보시길 권합니다.
발표와 검증을 분리하고 있나요. OpenAI의 수학 발표가 학계의 냉담을 자초한 것은 검증 과정 없이 결과만 내보냈기 때문이었습니다. 고객이나 파트너에게 AI를 활용했다는 사실을 드러낼 때, 어떤 검증 과정을 거쳤는지를 함께 보여줄 수 있는지를 생각해보십시오. 신뢰는 성능 수치에서 오지 않습니다. 과정을 보여줄 수 있을 때 생깁니다.
DeepSeek v4.1 Flash가 비용 바닥을 또 한 번 낮췄다는 소식이 같은 날 나왔습니다. 모델 단가는 계속 내려갑니다. 그런데 모델 단가가 내려간다고 해서 배포 판단의 기준이 자동으로 생기지는 않습니다. 어떤 모델을 쓸지보다 그 모델의 출력을 어떤 절차로 사용할지가 지금 실무에서 더 빠르게 빈자리가 되고 있습니다.
성능 발표와 신뢰 구축은 속도가 다릅니다. 발표는 하루면 되지만 신뢰는 검증 절차가 반복되면서 쌓입니다. 포켓FM이 비용을 줄이면서 매출을 늘린 것은 AI의 성능 때문이 아니라, 어떤 부분에 AI를 쓰고 어떤 부분에 사람을 남길지를 정했기 때문에 가능했습니다. OpenAI가 수학계의 냉담을 자초한 것은 성능이 부족해서가 아니라 검증 가능한 형태로 공개하지 않았기 때문이었습니다. 지금 도구가 빠르게 좋아지는 것은 사실입니다. 그 도구를 어떤 절차 위에 올려놓을지는 여전히 사람의 몫입니다.




