Jungseob's Note
포스트

만족했다는 평가가 성공을 뜻하지 않는다 — GAUGE의 에이전트 평가 감사

GAUGE는 사용자 시뮬레이터와 LLM 평가자가 만든 배포 심사 점수를 실제 과제 결과와 대조한다. 만족도와 성공의 차이, 비슷한 후보 사이의 순위 오류, 정상 종료 신호의 한계를 구분한다.

만족했다는 평가가 성공을 뜻하지 않는다 — GAUGE의 에이전트 평가 감사

TL;DR

  • 사람이 만족했다고 평가한 대화 40건 중 23건은 실제 과제에 실패했다. 실패율 57.5%는 해당 표본 전체의 실패율 57.3%와 거의 같았다. 이 실험에서는 좋은 대화 경험이 업무 성공을 가려내는 신호가 되지 못했다.
  • LLM 평가자가 전혀 쓸모없다는 결과는 아니다. 과제와 도구 호출을 보는 심사자는 전체 후보의 성공률 순위를 상관계수 0.94로 재현했다. 다만 성공률이 비슷한 후보 쌍에서는 낮은 성공률의 후보를 선택한 비율이 31%였다.
  • 평가모델을 강하게 만들거나 여러 심사자를 평균내는 것만으로 근접 후보의 문제가 해결되지는 않았다. 판단을 보류하면 선택한 후보 쌍의 오류는 줄지만 비교 가능한 범위도 줄어든다. 높은 전체 순위 상관과 개별 배포 결정의 신뢰도는 다른 지표다.
  • 정상 종료 여부는 중간에 잘리는 실행을 저렴하게 감지한다. 그러나 전체 실패의 96.5%는 정상 종료한 뒤에도 과제를 틀린 경우였다. 종료 신호를 실제 성공 판정으로 대체해서는 안 된다.
  • 저자들은 먼저 검증 가능한 결과로 평가 체계를 감사하고 확인된 범위 안에서만 저렴한 심사를 쓰자고 제안한다. 모델·시뮬레이터·후보 집합이 바뀌면 다시 감사해야 한다. 이 결과는 합성 벤치마크와 제한된 사람 평가에서 나온 것으로 실제 고객 환경의 검증까지 끝난 것은 아니다.

완료했다고 말했지만 주문은 바뀌지 않았다

논문의 소매 고객지원 사례에서 사용자는 처리 대기 중인 주문들의 상품 옵션을 바꿔 달라고 요청한다. 에이전트는 변경이 끝났다고 답하고 사용자는 만족하며 대화를 마친다. LLM 심사자와 만족도 대리평가자는 모두 7점 만점을 줬지만 실제로는 대기 주문 하나가 변경되지 않아 과제 보상은 0이었다. 대화가 매끄럽고 대부분의 도구 호출이 맞아도 최종 상태가 요구사항과 다르면 업무는 실패한다.[1]

Amazon 소속 Umesh Bodhwani, Thanh Tran, Kai Wei의 GAUGE는 이런 평가상의 간극을 감사하는 오프라인 프로토콜이다. 중심 실험은 τ²-bench의 소매·항공 업무에서 6개 제공사의 모델과 샘플링 온도를 조합한 25개 실행 설정으로 비교한 3,691건의 대화다. 여기에 한 모델의 설정을 의도적으로 나쁘게 만든 720건, 사람 3명이 평가한 층화 표본 150건, 별도 수학 튜터링 벤치마크의 사람 평가를 더한다. 이 표본들은 역할이 다르므로 모든 비율이 같은 대화 집합에서 나온 것처럼 합쳐 읽어서는 안 된다.[1]

순위를 맞히는 능력과 성공을 측정하는 능력은 다르다

연구가 감사하는 배포 심사는 사용자 역할의 LLM이 후보 에이전트와 대화하고 다른 LLM이 대화를 채점한 뒤 높은 점수의 후보를 선택하는 구조다. 여기에는 적어도 두 가지 질문이 있다. 평가 점수가 좋은 후보부터 나쁜 후보까지 순서를 맞히는가가 순위 타당성이고 평가가 본래 재려던 속성을 실제로 측정하는가가 구성 타당성이다. 사람의 만족도와 평가모델의 점수가 잘 맞더라도 만족도 자체가 성공과 다르면 업무 성공을 인증한 셈은 아니다.[1]

연구는 평가자가 보는 정보와 역할도 분리한다. 정책을 아는 배포 심사자(gate)는 과제 목표와 도구 호출을 포함한 대화 전체를 보고 정책 준수와 해결 여부를 우선 평가한다. 만족도 대리평가자(proxy)는 도구 호출과 과제 정보를 제거한 고객에게 보이는 대화만 읽으며 사람 평가단 역시 실제 처리 결과를 맞히기보다 서비스를 받은 느낌을 평가하도록 지시받았다. 따라서 이 연구는 사람보다 AI가 낫거나 못하다는 단순 비교가 아니라 무엇을 보게 하고 무엇을 평가하게 했는지에 관한 실험이다.[1]

만족도는 같은 표본의 기본 실패율을 낮추지 못했다

사람 평가단의 150건 중 만족도가 7점 척도에서 5점 이상인 대화는 40건이고 그중 23건이 실패했다. 이 57.5%를 전체 표본의 실패율 57.3%와 비교하면, 만족한 대화만 고른다고 실패 가능성이 줄어들지 않았음을 알 수 있다. 만족도와 과제 성공의 Spearman 상관계수도 −0.147이었고 성공을 구별하는 AUC는 0.44였다. 존중받는 느낌과 명확성, 체감 도움, 재이용 의사로 바꿔도 같은 표본에서 성공과 뚜렷한 양의 관련성이 나타나지 않았다.[1]

하지만 과제와 도구 호출을 보는 gate는 다른 양상을 보인다. 자연스러운 과제 구성의 전체 실험에서 gate가 높은 점수로 받아들인 대화의 실패율은 20.0%였고 해당 집합의 기본 실패율은 40.2%였다. 성공 구별 AUC도 0.73으로 만족도 신호보다 높았다. 여기의 20.0%를 사람 평가단의 57.5%와 직접 비교해 AI가 사람보다 우수하다고 결론 내리면 안 된다. 서로 다른 표본과 관찰 정보의 차이를 유지하면서 결과와 관련된 증거를 보는 평가가 실제 신호를 가진다는 점을 읽어야 한다.[1]

전체 순위가 좋아도 비슷한 후보 사이에서는 자주 뒤집힌다

25개 설정을 함께 비교하면 주된 심사자 Opus-4.8의 점수와 검증 가능한 보상의 순위 상관은 0.94였다. 다른 심사자들도 전체 후보의 넓은 성능 차이를 대체로 재현했고 사용자 시뮬레이터를 다른 제공사의 모델로 바꿔도 주된 순위 상관은 0.93으로 유지됐다. 이는 한 제공사의 말투를 선호해서만 좋은 순위를 얻은 결과는 아니라는 근거다. 크게 망가진 후보와 잘 작동하는 후보를 구별하는 데에는 저렴한 LLM 심사가 유용했다.[1]

문제는 실제 배포에서 자주 비교하는 근접 후보들이다. 검증 보상 차이가 0.1 미만인 87쌍에서 주된 심사자는 27쌍, 약 31%에서 보상이 더 낮은 후보를 선택했다. 차이가 큰 211쌍에서는 같은 비율이 0.9%였으며 정확히 동률인 쌍은 비교에서 제외했다. 근접 후보의 31%에는 모델 단위 재표집으로 계산한 95% 신뢰구간 11.6~50.0%가 붙으므로 특정 제품의 고정 오류율로 받아들여서는 안 된다. 핵심은 전체 순위의 좋은 상관이 비슷한 두 후보 중 누구를 배포할지 결정하는 정확성을 보장하지 않는다는 점이다.[1]

더 강한 심사자와 점수 평균도 만능 해결책은 아니다

연구의 강한 심사자들은 직접 과제를 수행해도 상위 에이전트들과 비슷한 수준이었지만 근접한 상위 후보의 순위를 뚜렷하게 가려내지는 못했다. 심사자의 능력이 부족해서만 생기는 문제로 보기 어렵다는 뜻이다. 같은 모델 계열을 선호하는 편향도 따로 측정됐다. Opus-4.8이 Claude 계열에 주는 상대적인 점수 상승은 다른 제공사 심사자와의 차이를 다시 비교했을 때 7점 척도에서 0.75점이었다. 전체 순위는 유지되더라도 절대 점수로 합격선을 정하면 이런 편향이 결정에 영향을 줄 수 있다.[1]

네 심사자의 평균을 내도 근접 후보에서의 불일치는 27/87로 그대로 남았다. 오류가 서로 독립적이지 않으면 심사자를 늘리는 것만으로 상쇄되기 어렵다. 효과가 있었던 방법은 점수 차이가 표본 잡음 안에 들어오는 비교에서 판단을 보류하는 것이었다. 실제로 순위를 정한 쌍의 오류는 14.8%로 줄었지만 기준에 따라 근접 쌍의 31~49%만 판단했다. 확실한 일부만 선택해 오류를 줄였다는 대가를 함께 봐야 한다. 더 많은 비교를 정확히 해결한 결과와는 다르다.[1]

정상 종료 신호는 과제 성공의 대리 지표가 아니다

저자들은 추가 LLM 호출 없이 기존 실행 기록에서 대화가 완료됐는지만 읽는 completion bit를 제안한다. 정상 설정과 토큰·단계 제한 등으로 실행을 중간에 끊는 설정을 함께 비교한 12개 설정의 대조 실험에서는 이 신호와 실제 보상의 상관이 0.87로, 유료 gate의 0.80에 뒤지지 않았다. 여기서 무료라는 표현은 이미 생성한 실행 기록에서 신호를 뽑는 추가 비용을 가리킨다. 에이전트 대화를 생성하는 전체 평가 과정이 무료라는 뜻은 아니다.[1]

이 결과를 일반적인 성공 검사로 확대하면 안 된다. 전체 후보 실험의 실패 1,485건 중 96.5%는 대화가 정상 종료했지만 의미상 과제를 틀린 경우였고 중간 절단은 3.5%에 불과했다. 따라서 종료 신호는 절단 실패를 잡아도 전체 실패 중 극히 일부만 포착한다. 논문의 주문 변경 누락처럼 완료를 선언한 뒤 틀린 최종 상태를 남기는 실패에는 도구의 결과와 실제 상태를 확인하는 평가가 여전히 필요하다.[1]

페르소나를 바꾸고 평가의 사용 범위를 다시 확인한다

협조적인 사용자만 시뮬레이션하면 에이전트의 약점이 가려질 수 있다. 연구는 조급하거나 산만한 사용자, 불안하고 신뢰가 낮은 사용자, 짧게 답하는 사용자, 회의적으로 협상하는 사용자 등을 포함한 여섯 유형으로 말투와 협조 방식을 바꿨다. 소매 업무의 해당 대조 실험에서 평균 검증 보상은 기본 사용자 조건의 0.47에서 페르소나 조건의 0.27로 낮아졌다. 과제의 사실과 목표를 유지한 채 상호작용만 바꿔도 처리 난도가 달라지며 만족도는 실제 성공뿐 아니라 사용자의 표현 방식에도 민감했다.[1]

저자들이 권하는 운영 방식은 먼저 결과를 검증할 수 있는 기준으로 평가 체계를 감사하고 그때 확인된 범위 안에서 저렴한 신호를 사용하는 것이다. 일상적인 변경에서는 정상 종료 여부로 절단 오류를 먼저 걸러내고 의미상 실패와 실제 처리 결과는 별도의 심사와 검증으로 확인한다. 심사자나 시뮬레이터가 바뀌거나 후보 집합이 달라지고 특히 성능이 비슷한 후보를 선택해야 할 때는 다시 감사한다. 만족도에 맞춰 가중치를 조정하거나 심사자들을 결합한 보정도 표본 밖에서는 개선이 유지되지 않았으므로, 한 번 보정한 점수가 계속 유효하다고 가정할 수 없다. 점수는 설정별로 모아 비교하며 표본이 적은 설정·페르소나 조합 한 칸만으로 배포를 결정하지 않는다.[1]

검증 기준 자체의 범위와 연구 한계도 남는다

논문이 검증 가능한 보상이라고 부르는 기준도 세부 구성을 확인해야 한다. 항공 업무는 데이터베이스 상태와 행동·전달 조건을 결정론적 코드로 검사하지만 소매 업무에는 결정론적 데이터베이스 검사에 더해 자연어 조건을 평가하는 LLM 항목이 일부 포함된다. 따라서 전 실험의 성공 판정이 완전히 LLM과 무관하다고 요약하면 부정확하다. 저자들은 소매의 해당 항목이 적용 가능한 2,537건 중 113건에서 결과에 영향을 줬다고 설명하고 LLM 항목이 없는 항공에서도 만족도와 실패의 간극이 남는다는 점을 근거로 든다.[1]

사람 평가단은 3명이 대화 150건을 읽은 규모이며 실제 고객과 실시간으로 상호작용한 실험은 아니다. SimulatorArena의 별도 수학 튜터링에서도 높은 만족도 31건 중 12건이 오답이었지만 이 결과가 모든 서비스에 같은 실패율로 적용되는 것은 아니다. Bedrock 실행 환경과 출력 파서 수정 때문에 절대 성공률을 다른 리더보드와 그대로 비교할 수도 없으며 실제 고객 환경으로의 일반화는 검증되지 않았다. arXiv v1의 결론에서 만족도는 서비스 경험의 지표로 남는다. 업무 성공은 분리해 측정하고 평가기가 믿을 만한 비교 범위를 먼저 확인해야 한다.[1]

참고 자료

[1] https://arxiv.org/html/2609.12191v1 — GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents — Bodhwani, Tran, Wei

2026년 9월 10일 제출된 arXiv v1의 본문과 부록을 바탕으로 정리했다. 표의 행·열과 분모를 대조하고 주요 비율을 검산했으며, 논문의 실험을 독립적으로 재실행한 것은 아니다.

원문 출처는 본문의 Source에서 확인할 수 있습니다.