AI 결과 검증의 기준이 점수 하나에서, 주장마다 근거와 출처를 붙여 확인하는 방식으로 옮겨 가고 있습니다. 2화에서 에이전트가 자체 점수에 속을 수 있다고 짚었는데, 오늘 논문들은 그렇다면 점수 대신 무엇을 봐야 하는지에 답합니다. 근거가 붙은 주장, 출처가 남는 데이터, 내용이 아니라 형식에 끌리는 평가를 가려내는 일입니다.

먼저 에이전트를 고쳤을 때 그 변화를 어떻게 판단하느냐의 문제입니다. 한 연구는 컨트롤러나 검증기 같은 부품 하나를 바꾸고 나서 전체 과제 점수로 판단하는 관행을 문제 삼습니다. 점수 하나로는 개선이 애초에 가능했는지, 어느 부품이 가치를 잃었는지, 에이전트 스스로 하는 점검이 무엇을 보증하는지 알 수 없다는 것입니다. 연구진이 내놓은 «Verify Claims, Not Scores»는 에이전트에 점수를 매기는 대신 증거에 점수를 매깁니다.

감사에서 결론마다 남기는 것결론 하나뒷받침하는 근거판정 네 가지 중 하나성립하는 경계

판정은 지지됨, 지지되지 않음, 미해결, 평가하지 않음 중 하나입니다. 결론마다 이 세 가지가 함께 기록된다는 점이 요점입니다. 이를 위해 연구진은 명시된 행동 범위 안에서 달성 가능한 개선 폭을 재는 기준 정책 같은 도구를 씁니다. 부품을 하나씩 완벽한 것으로 바꿔 보는 방식도 씁니다. 그러면 낮은 값이 환경 탓인지 평가 설계 탓인지 추적할 수 있습니다.

같은 방향이 법률 쪽에도 보입니다. 규제 준수 점검 시스템 ARCCS는 규제 문서를 더 쪼갤 수 없는 요구사항 단위로 나누고, 점검 대상 문서를 각 요구사항에 대조합니다. 판정은 검색해 온 증거, 신뢰도 점수, 사람이 읽을 수 있는 근거 설명과 함께 내놓습니다. 연구진에 따르면 GDPR 정책 문서 평가에서 LLM 기반 심사자들이 이 시스템의 판정과 근거를 법적으로 타당하다고 보았습니다. 합격·불합격 한 줄이 아니라 요구사항마다 근거를 묻는 구조입니다.

출처가 남는 데이터 쪽에서는 PACE가 있습니다. 도구를 쓰는 에이전트는 생성한 글이 실제 부작용으로 이어지기 때문에, 오염된 도구 설명이나 검색된 페이지, 기억, 재사용 기술이 다음 호출을 조종할 수 있습니다. 연구진은 들여보내기 전에 검사하는 것만으로는 부족하다고 봅니다. 안전한 변형과 새는 변형이 같은 검사 증거를 만들 수 있기 때문입니다. 그래서 PACE는 도구 호출이 실행되기 직전에, 영향이 흘러온 경로와 요청에서 나온 권한을 대조합니다. 1화에서 다룬 기억과 기술 재사용이 늘수록 이 마지막 관문이 중요해집니다.

마지막은 평가자 쪽입니다. 프랑스어 LLM 아레나 Compar:IA의 투표 137,293건을 분석한 연구는, 사람의 선호가 답의 내용뿐 아니라 보이는 모양도 반영할 수 있다고 봅니다. 분석에는 116개 모델이 관여한 137,113건의 대결이 쓰였습니다. 굵은 글씨 사용은 승리 오즈가 11.0% 높아지는 연관으로 나타났고, 연구진은 이것을 여러 설정에서 가장 덜 변한 연관 두 가지 중 하나로 꼽았습니다. 다만 길이와 굵은 글씨, 목록이 함께 나타나는 경향이 있어 각각의 기여를 따로 떼기는 어렵다고 합니다. 형식이 순위에 섞여 들어갈 수 있다는 경고로 읽는 것이 정확합니다.

정리하면 점수 하나 대신 근거, 출처, 형식이라는 세 곳을 확인하게 된 셈입니다.

그래서 AI 도구를 쓰는 실무자가 볼 것은 세 가지입니다. 첫째, 결과 옆에 어떤 근거가 붙어 있고 어디까지 성립하는지 적혀 있는지 봅니다. 둘째, 에이전트가 외부 정보나 저장된 기억을 쓸 때 실행 직전에 확인하는 단계가 있는지 봅니다. 셋째, 순위나 후기가 내용이 아니라 보기 좋은 서식에 끌린 것은 아닌지 의심해 봅니다. 아직은 연구 단계의 방법들이지만, 제품을 고를 때 던질 질문으로는 지금도 쓸 만합니다.