순정 조합이면 안전하다는 믿음

Claude Code, Codex, 서드파티 에이전트 중 무엇을 구독할지 고민하다가 '어차피 그 회사 모델엔 그 회사 도구가 최적화돼 있겠지' 하고 순정 조합을 고르신 분이 많습니다. 개발자를 따로 두기 어려운 1인 사업자나 기획자라면 더 그렇습니다. 도구를 하나하나 써 볼 시간이 없으니 브랜드가 같은 쪽을 고르고 넘어갑니다.

AI 코딩 도구는 모델 하나로 움직이지 않습니다. 모델 위에 도구 호출, 프롬프트, 작업 순서를 정하는 제어 흐름이 얹혀야 채팅 모델이 코드를 고치는 에이전트가 됩니다. 이 부분을 하니스라고 부릅니다. 순정 조합이 낫다는 믿음은 하니스가 자기 회사 모델에 맞게 손질됐으니 더 많은 과제를 풀 것이라는 가정입니다. 이 가정을 실측한 논문이 있습니다.

어떤 연구인가

Mohsen Arjmandi의 이 논문은 모델을 고정한 채 하니스만 바꾸면 성적이 얼마나 달라지는지를 묻습니다. 같은 80개 과제를 claude-opus-4-8에서는 순정 하니스인 claude-agent-sdk와 중립 하니스인 deepagents로 각각 돌렸고, gpt-5.5에서는 openai-codex SDK와 deepagents로 돌렸습니다.

과제는 공개 벤치마크가 아니라 연구진이 비공개로 관리하는 256개 문제 묶음에서 뽑았습니다. 기존 코드 저장소를 다루는 과제와 모델 학습 시점 이후에 출제된 콘테스트 과제가 섞여 있습니다. 모델이 정답을 미리 외웠을 가능성을 줄이려는 설계입니다. 계획한 800회 실행 중 792회가 격리된 채점기로 평가됐습니다.

무엇을 발견했나

평균으로 보면 어느 하니스도 앞서지 못했습니다. Opus 4.8에서 순정 하니스의 해결률은 48.8%, 중립 하니스는 50.0%로 순정 쪽이 1.25%p 뒤졌지만 95% 신뢰구간이 -10.0에서 +7.5까지 걸쳐 있어 차이라고 부르기 어렵습니다. GPT-5.5는 순정 55.6%, 중립 54.4%로 순정이 1.25%p 앞섰지만 역시 신뢰구간이 0을 품습니다.

평균이 비슷해도 속은 달랐습니다. Opus 4.8의 결과를 과제 유형별로 가르자 정반대 방향이 나왔습니다.

Opus 4.8에서 하니스 차이가 갈린 자리Opus 4.8 고정하니스만 교체저장소 과제 61개순정이 9.0%p 뒤짐콘테스트 과제 19개순정이 23.7%p 앞섬평균 -1.25%p둘을 합치면

저장소 과제에서는 중립 하니스가, 콘테스트 과제에서는 순정 하니스가 우세했고 두 방향이 상쇄돼 평균이 0 근처로 내려앉은 셈입니다. 라벨을 무작위로 섞어 본 검정에서 p값은 0.003이었습니다.

비용은 다른 방향이었습니다. 실행마다 남은 사용량을 고정된 정가로 다시 계산하니 중립 하니스는 해결한 과제 하나당 Opus 4.8에서 1.3~1.6배, GPT-5.5에서 1.2배 비쌌습니다. 정확도와 완료도 따로 놀았습니다. 시간 제한에 걸려 취소된 81회 중 22회는 이미 통과하는 패치를 만들어 둔 상태였습니다.

실무에 적용하면

AI 코딩 도구 비교를 브랜드로 시작하면 이 연구가 보여준 갈림을 놓칩니다. 먼저 내 작업이 어느 쪽인지 적어 보십시오. 돌아가는 쇼핑몰이나 예약 시스템 코드를 손보는 일이 많다면 저장소 과제에 가깝고, Opus 4.8에서는 그 유형에서 순정 조합이 뒤졌습니다. 새 알고리즘 문제를 처음부터 푸는 일이 잦다면 콘테스트 과제 쪽이고, 같은 모델에서 순정 조합이 크게 앞섰습니다. 사후에 나눈 결과라 확정된 규칙은 아니지만, 내 과제 유형부터 묻는 순서는 그대로 가져갈 만합니다.

청구서도 같이 봅니다. 해결률이 같아도 풀린 과제 하나에 들어간 돈이 1.2배에서 1.6배까지 벌어졌습니다. 월 구독료만 견주지 말고 같은 과제를 두 도구로 한 번씩 돌린 뒤 실제 사용량 기록으로 건당 비용을 계산해 보는 편이 정확합니다.

시간 제한 설정도 봅니다. 정답을 만들고도 마감에 걸려 취소된 실행이 있었으니, 제한을 넉넉히 잡거나 중간 결과를 남기는 옵션이 있는지 살펴보십시오.

주의할 점

연구진이 밝힌 한계가 있습니다. 저장소 과제와 콘테스트 과제로 나눈 분할은 데이터를 본 뒤에 정한 것이라 설계된 재검증이 필요합니다. 비용 수치는 관측된 사용량에 기댄 추정이고, Anthropic 계정에서는 58회 실행이 사용량 기록을 남기지 않았습니다. 그 몫을 어느 쪽에 배분하느냐에 따라 Opus 비용 비율은 0.7배에서 2.3배까지 움직여 청구 순위는 결론이 나지 않았습니다. 이번 판은 2026년 8월 원고의 비용 수치가 자체 계측 결함 위에 있었음을 바로잡은 개정판이며, 실행기와 채점기, 재분석 코드와 집계 결과는 공개됐지만 과제 자체는 비공개입니다. 코딩 도구를 견줄 때 이 수치를 그대로 옮기기보다 내 과제를 두 하니스에 돌려 보는 절차 쪽을 가져가는 편이 안전합니다.