2026년 8월, 엔비디아 연구팀이 공개한 에이전트 실험 결과는 AI 성능 투자에서 무엇을 먼저 봐야 하는지를 다시 짚게 합니다. 연구팀은 여러 언어모델을 동일한 과제에 투입해 성과를 비교했는데, 더 강력한 기반 모델이 항상 더 나은 결과를 내지는 않았습니다. 기반 모델의 역량이 상대적으로 낮더라도, 과제 수행 방식을 세밀하게 조정한 에이전트가 강한 모델을 그대로 연결한 에이전트보다 안정적으로 목표한 결과를 냈습니다.
연구팀은 성과를 가르는 요인으로 모델을 감싸는 주변 설계를 지목했습니다. 어떤 도구를 어떤 순서로 쓸지, 과제를 어떻게 나눌지, 중간 결과를 어떤 형식으로 다음 단계에 넘길지를 통제하는 설계 — 연구자들이 '하네스(harness)'라고 부른 것입니다.
하네스가 포함하는 것
하네스라는 단어는 낯설지만, 내용은 익숙합니다. AI 도구를 실무에 쓰는 사람이라면 다음 중 하나 이상은 이미 다루고 있습니다.
프롬프트 구조. 과제를 어떤 형식으로 모델에 전달하는지, 배경 정보를 어떤 순서로 제시하는지가 여기에 해당합니다. 같은 요청을 한 문장으로 보낼 때와 단계별로 나눠 보낼 때 결과가 달라진다면, 그 차이는 프롬프트 구조가 만드는 것입니다.
작업 분해 방식. 복잡한 과제를 모델에 한 번에 처리하게 할지, 여러 단계로 나눠 각 단계에서 결과를 확인하며 진행할지의 선택입니다. 에이전트가 긴 과제 도중 방향을 잃는 현상은 대부분 이 분해 방식에서 옵니다.
파인튜닝. 특정 유형의 과제에 더 일관되게 반응하도록 모델의 행동 패턴을 조정하는 과정입니다. 엔비디아 실험에서 파인튜닝은 모델을 전반적으로 강하게 만들기보다, 주어진 과제 유형에서 어떤 도구를 어떤 순서로 쓸지를 예측 가능하게 좁히는 방향으로 작동했습니다.
이 세 가지는 모델 바깥에 있습니다. 어떤 언어모델을 기반으로 쓰는지와 무관하게 조정할 수 있는 층위입니다. 구독 등급을 바꾸지 않아도 손댈 수 있는 것들이기도 합니다.
약한 모델이 강한 모델을 앞선 조건
실험에서 성능이 낮은 모델이 더 강한 모델보다 나은 결과를 낸 사례를 보면 공통 패턴이 있습니다. 과제 유형에 맞게 파인튜닝이 적용됐고, 작업 단계가 명확하게 분해돼 있었으며, 중간 결과가 다음 단계에 일관된 형식으로 전달됐습니다. 에이전트가 경로를 이탈했을 때 재시도할 수 있는 구조도 포함돼 있었습니다.
반대로 강한 모델이 기대보다 낮은 성과를 낸 경우에는 이 구조가 없었습니다. 모델이 과제를 어떤 방식으로 다룰지 사전에 좁혀주는 설계 없이 그대로 연결된 것입니다.
모델이 건물의 층수라면, 하네스는 배관과 전기 배선에 가깝습니다. 층수가 높다고 물이 잘 나오거나 전기가 안정적으로 들어오지는 않습니다. 50층 건물에서도 배관 설계가 허술하면 수압이 고르지 않고, 3층짜리 건물이라도 배선이 잘 돼 있으면 전기 공급이 안정적입니다. 층수를 올리기 전에 배관부터 정비하는 편이 자원을 효율적으로 쓰는 순서입니다.
모델 교체 전에 해볼 수 있는 확인
실무에서 이 질문을 검증하는 방법은 간단합니다. 현재 상위 모델에 넣고 있는 입력 — 프롬프트, 작업 지시, 배경 정보 — 을 그대로 한 등급 낮은 모델에 넣어봅니다.
결과 차이가 크지 않으면, 그 작업은 모델 등급보다 입력 구조에 더 의존하고 있는 편입니다. 프롬프트나 작업 분해 방식을 다듬는 것이 모델을 바꾸는 것보다 먼저입니다.
결과 차이가 분명하게 나면 — 하위 모델이 중요한 맥락을 놓치거나 출력 형식이 크게 달라지면 — 그 작업은 실제로 모델 역량에 민감합니다. 이때는 업그레이드가 타당합니다.
이 실험을 해보면 작업 유형마다 결과가 다르게 나옵니다. 어떤 작업은 저렴한 모델로도 충분하고, 어떤 작업은 실제로 더 강한 모델이 필요합니다. 그 경계를 모른 채 모든 작업에 같은 등급의 모델을 쓰면, 불필요하게 비싼 쪽에 쓰거나 충분하지 않은 모델에 무리한 기대를 거는 두 방향의 낭비가 동시에 생깁니다.
AI 출력이 회마다 달라진다면 입력 구조를 먼저 봅니다
AI 도구를 쓰면서 가장 불만족스러운 상황 중 하나는 같은 요청에 매번 다른 형식의 결과가 나올 때입니다. 어떤 날은 요약 단락으로, 어떤 날은 항목 목록으로, 어떤 날은 단순한 한 줄 답으로 돌아옵니다. 모델을 바꿔도 이 분산이 개선되지 않는다면, 입력 구조를 먼저 점검하는 것이 빠릅니다.
원하는 출력 형식이 프롬프트에 명시돼 있는지, 모델에 넘기는 정보 순서가 매번 일관한지, 어떤 기준으로 결과를 판단할지가 작업 지시에 포함돼 있는지입니다. 이 항목들이 일관되게 갖춰지면 같은 모델에서도 결과의 변동이 좁아집니다.
비용은 모델 등급이 결정하지만, 성과는 그 모델을 어떻게 운용하는지가 앞에서 결정합니다. 운용 구조가 정비되지 않은 상태에서 등급을 올리면, 더 비싼 도구로 같은 방식의 작업을 하게 됩니다.



