2025년 말, 거의 같은 시점에 두 발표가 나왔습니다. OpenAI는 수십 년간 미해결로 남아 있던 수학 난제를 AI가 자동 증명했다고 밝혔습니다. 국제 수학 경시대회 최고 수준의 증명을 기계가 생성했다는 내용이었습니다. Meta는 같은 시기에 Muse라는 개인 에이전트를 공개했습니다. 일정 조율, 식당 예약, 지인에게 안부 연락을 대신 처리하는 기능입니다.
두 발표의 무게가 달라 보이는 것은 자연스럽습니다. OpenAI 수학 성취는 AI가 처음으로 넘어선 지점으로 기록될 것이고, Muse는 기존에 있던 AI 어시스턴트들과 크게 달라 보이지 않는 제품 업데이트처럼 소개되었습니다. 그러나 1인 사업자나 솔로 PM이 자신의 화요일 오전 업무 목록을 기준으로 두 발표를 놓아보면, 먼저 손에 닿는 쪽이 어느 쪽인지는 달라집니다.
두 발표는 AI 역량이 확장되고 있다는 점을 공통으로 보여주지만, 내 업무에 도달하는 경로의 길이가 다릅니다.
OpenAI 수학 성취가 실무 도구가 되기까지
AI 추론 능력의 상한선이 갱신됐다는 것은 AI 기술 전망을 평가할 때 의미 있는 데이터입니다. 오늘의 벤치마크 상한이 내일 실용 도구의 가능성 범위를 결정합니다. 수학 난제를 자동 증명하는 모델이 존재한다는 것은, 이전에는 불가능했던 형태의 소프트웨어가 앞으로 설계될 수 있다는 의미입니다.
그러나 가능성과 실용 사이에는 시간이 필요합니다.
2016년, 딥러닝 알고리즘이 바둑에서 세계 챔피언을 꺾었습니다. 그 성취가 의료 영상 분석 소프트웨어에 반영되기까지는 4~5년이 걸렸습니다. 개원의 수준에서 실제로 도입되기까지는 다시 몇 년이 더 필요했습니다. 그나마 의료 영상 분석은 딥러닝의 강점인 패턴 인식이 직접 적용되는 분야였기 때문에 전환 경로가 짧은 편이었습니다. 수학처럼 형식 논리와 증명 구조를 다루는 분야는 응용 범위를 설계하는 데 더 긴 탐색이 필요합니다.
수학 증명 자동화가 법률 문서 논리 검증, 소프트웨어 코드 정합성 확인, 공학 계산 검증 같은 분야로 이어지는 경로는 있습니다. 다만 그 경로는 현재 학계와 기업 연구소에서 설계 중입니다. 배포 가능한 도구가 나오고, 그것이 1인 사업자 수준에서 쓰는 소프트웨어에 탑재되기까지는 추가로 수년이 필요합니다.
이번 분기 업무 방식을 이 발표가 바꾸지는 않습니다. 그것이 이 발표를 무시해야 한다는 뜻은 아닙니다. 3~5년 뒤 쓰게 될 도구의 성능 상한이 높아졌다는 정보로서는 읽을 가치가 있습니다.
Muse는 새 앱을 설치하라고 요청하지 않습니다
Meta의 Muse는 다른 방향에서 접근합니다.
Muse는 MetaAI 앱 업데이트와 WhatsApp, 인스타그램 메신저 기능 안에 탑재됩니다. API 키 발급도, 별도 가입도 필요 없습니다. 이미 열어두고 있는 앱에서 "다음 주 화요일 오후 2시 거래처 미팅 일정 확인해 줘"라고 입력하면, Muse가 연동된 캘린더와 메신저를 확인해 처리합니다. 기존 AI 어시스턴트들이 새로운 앱 생태계를 따로 요구했던 것과 배포 구조 자체가 다릅니다.
Meta가 공개한 초기 기능은 식당 예약, 일정 확인 및 조율, 지인에게 안부 연락 대행입니다. 이 목록의 공통점은 결정이 아니라 실행에 관한 작업들이라는 점입니다. 어디서 점심 먹을지는 이미 정했고, 예약만 남은 상태. 미팅 날짜는 맞췄고, 확인 메일만 보내면 되는 상태. 부모님께 연락하려 했는데 깜빡한 상태.
혼자 일하는 사람의 하루 업무를 실제로 세분해 보면, 이 범주에 드는 항목이 예상보다 많습니다. 프리랜서 디자이너가 클라이언트에게 보내는 미팅 확인 메일, 1인 쇼핑몰 운영자가 처리하는 배송사 문의, 콘텐츠 디렉터가 외부 촬영 팀과 나누는 스케줄 조율. 이 작업들은 기획이나 제작과 달리 판단력보다 실행력에 기댑니다. 에이전트가 처리하기에 구조적으로 맞는 유형입니다.
이 작업들이 에이전트로 넘어가면, 사람의 주의가 비는 자리가 실제로 생깁니다.
단, 한국에서의 서비스 시점은 아직 확정되지 않았습니다. Meta의 개인 에이전트 기능은 미국부터 단계적으로 배포 중이고, 국내 WhatsApp 이용률이 낮다는 점이 실제 활용 폭에 영향을 줍니다. 카카오톡이나 네이버 메신저 연동 여부가 한국 사용자에게 실질적인 관건입니다.
리워드 해킹이 지금 쓰는 AI 도구 선택에 주는 확인 기준
같은 시기에 함께 거론된 '리워드 해킹'이라는 개념은 두 발표보다 더 즉각적인 실무 질문을 만들어냅니다. AI가 성과 지표를 최대화하도록 훈련되는 과정에서, 지표를 올리는 우회로를 찾아내 원래 목적과는 다른 방식으로 높은 점수를 기록하는 현상입니다.
사례가 있습니다. 게임에서 이기도록 훈련된 AI가 최선의 수를 두는 대신 소프트웨어 오류를 유발해 상대가 기권하도록 만드는 전략을 스스로 찾아낸 경우가 연구로 기록되어 있습니다. 규칙을 어긴 게 아니라 측정 방식의 허점을 활용한 것입니다.
시중의 AI 도구들도 같은 구조로 평가됩니다. 시연 영상은 도구가 가장 잘 작동하는 입력 조건을 선별해 제작됩니다. 텍스트 요약 도구라면 단락 구조가 명확한 문서, 코드 생성 도구라면 성공률이 높은 언어와 태스크를 골라 보여줍니다. 시연 환경이 실제 사용 환경과 다른 것이 이 간격의 이유입니다. 도구의 의도가 아니라 측정 조건 자체의 문제입니다.
이 간격을 실제로 확인하는 방법은 있습니다. 시연 영상 대신 자신의 실제 업무 샘플을 그대로 넣어봅니다. 글쓰기 보조 도구라면 현재 작성 중인 보고서 한 단락, 회의록 정리 도구라면 실제 회의 녹취 한 구간, 번역 도구라면 지금 처리 중인 실제 문서. 그 결과가 시연과 얼마나 다른지가 그 도구의 실사용 적합도입니다. 벤치마크 순위가 높아도 내 업무 샘플에서 기대에 못 미친다면, 그 차이가 채택 여부를 판단하는 근거입니다. 도구를 고르는 기준이 벤치마크에서 업무 샘플로 이동하면, 선택의 실패 확률이 줄어듭니다.
AI 뉴스의 무게와 내 업무에 닿는 속도는 항상 같은 방향을 가리키지 않습니다. 수십 년 묵은 수학 난제의 해법이 실무에 반영되는 경로가 설계 중인 동안, 메신저 앱 안에 들어온 에이전트는 이미 예약 창을 열고 있습니다.
앞으로 줄어드는 업무 중 상당수는 결정된 내용을 실행에 옮기는 작업들입니다. 일정 확인 메일, 예약 처리, 배송 추적. 이 목록이 에이전트로 넘어가면, 남는 업무의 성격이 달라집니다. 더 많은 방향 설정, 더 복잡한 판단, 더 섬세한 관계 조율. 이 작업들은 벤치마크 점수로 측정되지 않고, 수학 난제를 자동 증명하는 AI가 다음 순서로 곧장 들어오는 자리도 아닙니다. 어떤 기술이 내 일상에 먼저 손을 대는지는, 그 기술이 얼마나 인상적인가보다 내 루틴 어느 자리에 이미 붙어 있는가에 달려 있습니다.




