2026년 9월 11일, 필즈상을 받은 수학자 테리 타오(Terence Tao)가 블로그에 글을 올렸습니다. 여러 AI 모델의 수학적 추론을 직접 검토한 뒤 발견한 것을 "심각한 불일치(severe misalignment)"라 불렀고, 《이코노미스트》가 같은 날 이 주제를 표지로 다뤘습니다.
타오의 지적이 눈에 띄는 것은 AI가 틀렸다는 사실 자체가 아닙니다. AI가 틀린다는 것은 이미 알려져 있습니다. 주목할 부분은 틀리는 구조입니다. AI가 각 단계에서 수학적으로 타당한 표현을 사용하면서도, 단계 사이의 논리 연결이 어느 자리에서 무너집니다. 전체 경로가 그럴듯해 보이지만, 이미 어느 지점에서 틀렸습니다.
이 오류 구조가 수학 연구에서만 나타나는 것인지, 실무에서 AI에 맡기는 계산—세금, 수수료, 비율, 재고 가치—에도 같은 방식으로 작동하는지가 처음 생긴 질문이었습니다.
AI가 수학 추론에서 틀리는 방식
AI 언어 모델이 수학 문제를 다루는 방식은 계산기가 계산하는 방식과 다릅니다. 언어 모델은 수학적 표현이 어떻게 쓰이는가를 대량의 텍스트에서 학습했습니다. 그 결과 수학적 추론처럼 보이는 텍스트를 생성하는 데 능하지만, 그 텍스트가 실제 수학적으로 성립하는지는 별개의 문제입니다.
타오가 지적한 불일치는 여기서 나옵니다. AI는 수학적 논증처럼 보이는 글을 씁니다. 각 문장이 수학적 표기와 규칙을 준수합니다. 그런데 문장과 문장 사이의 논리 연결—A에서 B가 따라온다는 주장—이 실제로 성립하지 않는 경우가 있습니다. 이것은 수식의 오타나 산술 실수와 다릅니다. 추론 경로 자체가 틀렸지만, 그 틀림이 각 단계의 표면에 드러나지 않습니다.
수학 연구에서 이것은 심각한 문제입니다. 증명이 유효하려면 모든 단계 사이의 논리적 연결이 성립해야 합니다. 어느 하나가 무너지면 증명 전체가 무너집니다. AI가 생성한 경로에서 연결이 보이지 않는 자리에서 끊어진다면, 전문가가 전 과정을 재검증하기 전까지 그 오류는 발견되지 않습니다.
실무 계산에서 같은 구조가 나타나는 곳
처음에는 이 오류가 고도로 전문화된 수학 문제에서만 나타난다고 봤습니다. 증명이나 편미분 방정식처럼 복잡한 작업에서나 일어나고, 실무 계산은 그보다 훨씬 단순하니 별개 문제라는 판단이었습니다.
그 판단이 틀렸습니다.
실무 계산에서 같은 구조가 나타나는 가장 흔한 형태는 비율이 여러 번 순서대로 적용되는 계산입니다. 여러 비율이 순서대로 작용할 때, 각 비율을 적용하는 기준값이 달라지고 결과가 달라집니다.
예를 들어 플랫폼 판매 수수료 15%와 부가세 10%를 모두 감안한 실수령액을 계산하는 경우입니다. 자연어로 질문하면 AI는 수수료와 세금을 각각 계산해주지만, 세금의 기준값이 수수료를 차감하기 전의 금액인지 차감 후인지가 의도와 다를 수 있습니다. 개별 비율 계산은 각각 맞습니다. 그러나 기준값과 적용 순서가 달라지면 최종값이 달라집니다. 그 차이가 몇 퍼센트 이내라면, 직관으로는 잡기 어렵습니다.
재고자산을 선입선출법으로 평가하거나, 할부 이자 계산에서 원금이 줄어드는 구조를 반영하거나, 여러 세율이 구간별로 적용되는 누진세를 계산할 때도 같은 구조가 나타납니다. 각 계산 단계는 틀리지 않습니다. 단계 사이의 연결—어떤 값을 기준으로 다음 단계가 이어지는가—이 달라집니다. 타오가 지적한 오류 구조가 여기 있습니다.
오류가 드러나지 않는 조건
타오의 글에서 더 주목할 부분은 오류 그 자체가 아닙니다. 오류가 언제 발견되지 않는가입니다.
AI가 생성한 추론을 검토하는 사람이 그 분야의 전문 지식이 없다면, 경로의 타당성을 판단하기 어렵습니다. 각 단계가 타당해 보이고 최종 결과도 기대 범위 안에 있으면, 오류를 의심할 동기가 생기지 않습니다.
실무 계산에서 이것은 더 구체적인 조건으로 좁혀집니다. 그 계산을 손으로 해본 적이 있는가.
손으로 해본 계산은 결과의 대략적인 범위를 몸으로 압니다. 비슷한 조건에서 얼마 정도가 나와야 하는지 감각이 있습니다. AI가 그 범위에서 크게 벗어난 값을 주면 즉시 의심합니다. 처음 하는 계산은 그 감각 자체가 없습니다. 결과가 어느 범위에서 나와야 하는지 모르는 상태에서는, AI가 틀린 값을 줘도 그럴듯해 보입니다.
처음으로 사업자 소득세를 계산하거나, 처음으로 원가율과 마진율의 관계를 파악하거나, 처음으로 외화 환산 손익을 정리할 때—AI가 계산 과정을 친절하게 설명해줘도, 그 과정이 맞는지 알기 위해서는 설명을 이해하기 전에 이미 그 계산을 알고 있어야 합니다. AI가 설명해주는 과정을 따라가며 이해했다는 느낌은, 검증이 아닙니다.
실무에서 쓸 수 있는 필터
처음 질문—AI 수학 오류가 실무 계산에도 같은 방식으로 나타나는가—에 대한 대답은 "그렇다"이지만, 실제로 유용한 것은 더 좁은 답입니다.
모든 AI 계산 결과를 의심하면 AI를 쓰는 의미가 없습니다. 신뢰 범위를 계산 유형이 아닌 사용자의 선행 경험으로 나누는 것이 현실적입니다.
선행 경험이 없는 계산 유형에서는, AI에게 맡기기 전에 한 번은 손으로 해보는 것이 실질적으로 유일한 검증 수단입니다. AI가 결과를 먼저 보여준 뒤 설명하는 순서로는, 결과에 맞게 설명을 수용하게 됩니다. 직접 계산한 결과가 먼저 있어야 AI 결과와 대조할 기준이 생깁니다.
처음 하는 계산 유형을 AI에게 먼저 물어보고 결과를 학습하는 방식은, 순서가 반대입니다. 그 순서에서 AI는 기준이 되고, 사람은 그 기준이 맞다고 전제하며 따라갑니다. 검증 기준이 없는 상태에서 이루어진 AI 계산 확인은, 확인처럼 보이지만 작동하지 않습니다.




