AI 에이전트 벤치마크의 무게중심이 AI가 도구에 대해 아는지를 묻는 쪽에서, 실제로 실행되는 명령을 만들고 업무를 끝까지 해내는지를 재는 쪽으로 옮겨 가고 있습니다. 지난 3화에서 AI 결과 검증이 점수 하나에서 주장별 근거 확인으로 옮겨 간다고 짚었습니다. 오늘은 같은 흐름이 도구 사용 능력 평가에서 나타납니다. 점수가 높다는 사실보다 그 점수가 무엇을 보고 매겨졌는지가 따져지고 있습니다.
지식이 아니라 실행을 잰다
KaliBench 연구진은 기존 평가가 지식을 묻는 시험이거나 과제 전체를 맡기는 시험이어서, 명령어를 정확히 만드는 능력은 직접 재지 못한다고 지적합니다. 보안 업무는 명령줄 도구를 쓰는데, 옵션 값이 잘못 묶이거나 인자 순서가 바뀌는 사소한 실수 하나로 실행이 무효가 되기 때문입니다. 그래서 연구진은 자연어 요청을 명령줄로 옮기는 문제 8,504쌍을 1,642개 도구, 23개 능력 차원, 5개 보안 단계에 걸쳐 모았습니다. 같은 뜻의 옵션을 같은 것으로 보는 정규화와 별칭 인식 채점을 쓴 점도 특징입니다. 그럴듯한 문장이 아니라 실행될 명령인지를 보겠다는 설계입니다.
Argo-Bench도 같은 방향입니다. 연구진은 기존 text-to-SQL 평가가 질의 생성만 보고, 정답지에 오류도 잦다고 지적합니다. 그래서 뉴욕 배달 플랫폼을 가정해 2024년 주문 8,100만 건, 235개 테이블, 75억 행 규모의 창고를 만들고 데이터 과학·분석 과제 210개를 냈습니다. 표 하나에서 끝나는 문제가 아니라 수십 개 표를 가로질러 분석하고 결과에 따라 행동하는 일을 재는 것입니다. HumanoidToolBench는 이것을 로봇으로 넓혔습니다. 18개 과제에서 일곱 정책을 시뮬레이션으로, 세 정책을 실제 로봇으로 평가했더니, 알맞은 도구를 고르는 일과 과제를 완수하는 일 사이에 큰 격차가 있었다고 합니다. 고르는 것과 해내는 것은 다른 능력이라는 뜻입니다.
겉보기 점수에 속지 않는 법
실행을 재는 쪽으로 옮겨 가야 하는 이유는 «Keyword Harnesses Fail Open»이 가장 분명하게 보여 줍니다. 키워드가 들어 있는지만 보는 평가는 하지도 않은 도구 사용에 점수를 줄 수 있습니다. 연구진은 구조가 같은 스페인어 보안 모델 두 개를 비교했습니다. 6억 6천만 매개변수 모델과 11억 매개변수 모델은 느슨한 도구 사용 점수가 0.660과 0.650으로 거의 같았습니다. 그러나 훈련 예시를 그대로 재현하게 하자 결과가 갈렸습니다. 작은 모델은 6개 예시 모두에서 유효한 도구 호출을 냈고, 큰 모델은 6개 중 하나도 내지 못했습니다. 이어서 첫 글자 확률을 살피니, 큰 모델은 도구 호출을 여는 특수 토큰의 확률이 만분의 일에서 십만분의 일 수준이었습니다. 연구진은 웹 중심 훈련 단계가 이 토큰의 확률을 지운 것으로 해석합니다.
진단은 이런 순서로 좁혀집니다.
점수가 같아도 실제 호출 능력은 정반대일 수 있고, 값싼 점검 몇 단계만으로 그 차이를 드러낼 수 있다는 이야기입니다.
그래서 무엇을 봐야 하는가
AI 에이전트 벤치마크 점수를 볼 때는 숫자보다 채점 방식을 먼저 보시기 바랍니다. 키워드가 맞는지를 보는지, 명령이 실제로 실행되는지를 보는지, 도구를 고르는 데서 끝나는지 작업을 끝내는지에 따라 같은 점수도 뜻이 다릅니다. 업무에 AI 도구를 들이실 때도 소개 자료의 평균 점수보다, 우리 일과 비슷한 실행 과제를 몇 건 직접 돌려 끝까지 해내는지 확인하는 편이 안전합니다. 앞으로는 실행 기반 채점을 쓰는 평가가 늘어나는지, 그리고 점수가 높은 모델이 이런 점검에서도 버티는지를 지켜보면 됩니다.



