2025년 5월 어느 화요일, 젠슨 황 Nvidia CEO는 백악관 회의실에서 미국 정부 관계자들을 향해 한 문장을 내놓았습니다. AI 개발 속도를 인위적으로 늦추는 것은 불가능하다는 취지였습니다. 같은 날, 업계 관계자 수십 명이 서명한 AEF-1 문서가 공개됐습니다. AI 시스템을 어떻게 평가하고 검증할지를 공동으로 정의하겠다는 표준안이었습니다. 두 사건은 아무런 연관 없이 발생한 것처럼 보이지만, 실무자 입장에서 나란히 놓고 보면 꽤 불편한 그림이 만들어집니다. 한쪽은 더 빠르게 달리겠다고 말하고, 다른 쪽은 그 달리는 것을 어떻게 측정할지 아직 합의가 안 됐다고 말하고 있으니까요.
Salesforce와 Nvidia가 프런티어 랩을 흔드는 방식
Salesforce와 Nvidia가 공동 개발한 추론 모델 Koa는 범용 AI 모델과 다른 방향을 택했습니다. 특정 산업 도메인, 특히 CRM과 영업 데이터 처리에 특화된 추론 성능을 설계 단계부터 최우선 목표로 삼았습니다. OpenAI나 Anthropic처럼 모든 영역에서 쓸 수 있는 모델을 만들기보다, 특정 파이프라인에서 경쟁자보다 압도적으로 빠르고 정확하게 작동하는 쪽을 선택한 것입니다.
이 방향이 주목받는 이유는 성능 수치 때문만이 아닙니다. 수직 특화 모델이 범용 프런티어 모델보다 기업 구매 결정에서 유리하다는 것이 여러 파일럿 도입 사례에서 확인되기 시작했기 때문입니다. 기업은 '가장 똑똑한 AI'보다 '우리 워크플로에 맞는 AI'를 원한다는 오래된 명제가 이제 실제 예산 집행 데이터로 뒷받침되고 있습니다.
같은 시기, OpenAI·Google·Anthropic 세 곳이 각각 자사 모델을 활용해 다음 세대 모델 개발을 지원하고 있다는 사실을 공식적으로 인정했습니다. 자기 개선 루프, 즉 RSI(재귀적 자기 개선)가 더 이상 미래 가설이 아니라 현재 진행 중인 개발 방법론이라는 뜻입니다. 여기에 RSI를 단일 형식 프레임워크로 정의하는 학술 논문까지 같은 주에 발표됐습니다. 가속의 방향은 이미 정해졌고, 속도는 늦춰질 것 같지 않습니다.
'모델이 모델을 평가한다'는 구조가 흔들리는 지점
문제는 여기서 시작됩니다. 모델이 모델 개발을 돕고, 모델이 모델을 평가하는 구조가 자리를 잡으면, 그 평가 결과를 외부에서 어떻게 신뢰할 수 있느냐는 질문이 따라옵니다.
LLM을 심판으로 쓰는 평가 방식의 신뢰성에 관한 논문이 이 시기에 등장한 것은 그냥 타이밍이 겹친 게 아닙니다. 평가자가 인간이 아니라 AI일 때 발생하는 편향, 즉 자신이 만든 스타일의 답변을 더 높게 평가하는 경향, 길고 유창한 문장을 정확한 답변보다 선호하는 경향 등이 실험적으로 기록되기 시작했습니다. 같은 날 에이전트 일관성을 측정하는 툴도 공개됐는데, 이 도구가 겨냥한 것도 비슷한 지점입니다. AI 에이전트가 동일한 조건에서 동일한 방식으로 작동하는지를 사람이 직접 측정할 수 있는 외부 레이어가 필요하다는 인식입니다.
AEF-1은 그 흐름의 집합체입니다. 특정 기업이나 연구소 한 곳이 만든 기준이 아니라, 여러 이해관계자가 공동 서명하는 방식으로 설계됐습니다. AI 평가 방법론이 독점되지 않도록 하겠다는 의지 표현입니다. 이것이 왜 중요하냐면, 평가 기준을 누가 가지느냐에 따라 어떤 모델이 '좋은 모델'로 분류되는지가 달라지기 때문입니다. 지금까지 AI 평가 벤치마크는 대부분 프런티어 랩 스스로 설계하거나, 랩과 긴밀한 관계를 맺은 연구자들이 만들어왔습니다. AEF-1은 그 구조에 이의를 제기하는 문서입니다.
커리어 설계를 다룬 한 실무서는 이런 관점을 제시합니다. 도구나 기술의 표면을 따라가는 것과, 그 도구가 어떤 기준으로 평가받는지를 파악하는 것은 전혀 다른 역량이라고. 지금 AI 생태계에서 벌어지는 일도 그 구분과 맞닿아 있습니다. 어떤 모델을 쓰느냐보다, 어떤 기준으로 그 모델의 성과를 측정하느냐가 더 중요한 질문이 되기 시작했습니다.
평가 인프라가 독립 시장이 되는 흐름에서 1인 사업자가 볼 것
이 모든 흐름이 1인 사업자나 소규모 팀에게 당장 어떤 영향을 미치느냐고 물으면, 직접적인 연결 고리는 아직 느슨합니다. AEF-1을 내일 당장 읽어야 한다거나, 수직 특화 모델 개발에 뛰어들어야 한다는 이야기가 아닙니다.
그러나 시장 구조가 바뀌는 방향은 읽어둘 가치가 있습니다. AI 평가 인프라가 독립적인 비즈니스 영역으로 떠오르고 있다는 신호는, 지금까지와 다른 종류의 수요가 생기고 있다는 뜻이기도 합니다. 구체적으로 보면 다음과 같은 움직임이 보입니다.
첫째, 'AI가 만든 결과물을 사람이 검증하는' 서비스에 대한 수요가 늘어납니다. 기업 고객들이 AI 산출물의 신뢰성을 외부에서 확인받고 싶어하는 경우가 많아졌습니다. 법무 검토, 의료 기록 요약, 재무 보고서 초안 등에서 'AI가 생성했지만 사람이 확인했다'는 레이어가 유료 서비스로 팔리기 시작했습니다.
둘째, 특정 산업에 맞는 평가 기준을 설계하는 컨설팅 수요가 생깁니다. Koa처럼 수직 특화 모델이 늘어날수록, 그 모델이 실제로 해당 도메인에서 얼마나 잘 작동하는지를 측정하는 방법론에 대한 질문도 늘어납니다. HR 담당자가 AI 면접 툴을 도입할 때, 마케터가 AI 카피 생성 도구를 도입할 때, 각 상황에 맞는 검증 체크리스트를 갖추고 있는 사람이 드물기 때문입니다.
셋째, 에이전트 일관성 측정이라는 개념 자체가 새로운 운영 역할을 만들어낼 수 있습니다. AI 에이전트를 도입한 팀에서 '이 에이전트가 어제와 오늘 다르게 행동했는데 왜 그런지'를 추적하는 사람이 필요해집니다. 지금은 기술 팀이 담당하지만, 이 역할이 전문화되면 비기술 배경을 가진 운영 전문가도 진입할 수 있는 영역이 됩니다.
1인 사업자나 소규모 팀이 지금 당장 점검해볼 것이 있다면 이런 질문들입니다. 나는 AI 도구를 쓸 때 무엇을 기준으로 그 결과를 검토하고 있는가. 내가 만든 AI 활용 결과물에 클라이언트가 신뢰를 갖는 이유가 '내가 검토했기 때문'인가, '도구를 썼기 때문'인가. 평가와 검증을 서비스로 팔 수 있는 포지션이 내 분야에 있는가.
AI 가속과 AI 거버넌스가 동시에 달리기 시작한 이 시점에서, 빠른 쪽을 따라가는 것과 측정 가능한 쪽에 자리를 잡는 것 중 어느 쪽이 1인 사업자에게 더 오래 유효한 포지션인지는, 각자의 클라이언트와 업무 방식에 따라 다르게 읽힐 것입니다. 다만 오늘의 두 흐름이 결국 같은 질문으로 모인다는 점은 분명합니다. AI가 만들어낸 것을, 우리는 어떻게 믿을 것인가.




