Jungseob's Note
포스트
AI Engineer의 Tokens Should Have Jobs 발표

토큰에도 역할이 필요하다 — 실행·조언·채점·회고로 나누는 에이전트 전략

같은 토큰 예산에서도 실행·조언·채점·회고의 배분에 따라 결과가 달라진다. Anthropic의 금융 분석 실험을 평균 점수, 완전 성공률, 성공까지의 총비용으로 나누어 정리한다.

토큰에도 역할이 필요하다 — 실행·조언·채점·회고로 나누는 에이전트 전략

TL;DR

  • 약 60만 토큰으로 예산 상한을 맞춘 금융 분석 실험에서 실행만 하는 전략의 점수는 0.76이었다. 조언을 받는 전략은 0.89를 기록했다. 같은 모델과 예산에서도 토큰을 어떤 역할에 쓰느냐에 따라 결과가 달라졌다.
  • 조언은 실행 중 판단을 돕고 채점은 명시적인 기준에 따라 수정을 유도한다. 회고는 실행 기록에서 배운 내용을 메모리에 남겨 다음 실행에 전달한다. 세 전략은 개입 시점과 피드백의 용도가 다르다.
  • 평균 점수와 완전 성공률은 같은 지표가 아니다. 모든 평가 조건을 충족한 실행 비율은 Execute 42%, Advise 67%, Grade와 Dream 각각 75%였다. 부분적으로 맞는 손익계산서도 다시 검토해야 한다면 완전 성공률이 업무 효용에 더 가깝다.
  • 비용은 호출 한 번보다 쓸 수 있는 답을 얻기까지의 전체 과정으로 비교해야 한다. 발표에서는 토큰 효율에 Advise가, 한 번의 완전 성공 가능성에 Grade·Dream이 유리했다. 이 결과는 해당 실험의 비교이며 모든 업무에 적용되는 고정 순위는 아니다.

같은 예산에서도 역할 배분에 따라 점수가 달라졌다

Anthropic의 Katelyn Lesse와 Angela Jiang은 금융 분석 업무를 수행하는 에이전트에 토큰 예산을 더 주는 것과 토큰의 역할을 바꾸는 것을 나누어 실험했다. 약 60만 토큰으로 상한을 맞췄을 때 Execute의 평가 점수는 0.76, Advise는 0.89, Grade와 Dream은 각각 0.92였다. 슬라이드에는 모든 실행에 Opus 4.8을 사용했다고 명시되어 있다. 이 비교의 핵심은 더 강한 모델을 선택한 효과가 아니라 동일한 모델과 예산 조건에서도 작업 구성이 성능에 영향을 주었다는 점이다.[1]

처음부터 예산을 고정한 것은 아니다. 각 전략이 사용량을 스스로 정한 최초 비교에서는 Execute가 3.9만 토큰으로 0.15, Grade가 14.2만으로 0.63, Advise가 15.2만으로 0.65, Dream이 61.3만으로 0.92를 기록했다. 복잡한 전략이 더 높은 점수를 받았지만 토큰도 더 썼으므로 이 결과만으로 역할 분리의 효과를 판단하기 어렵다. 발표자들은 Dream의 사용량을 약 60만 토큰으로 설명하면서 이를 다른 전략의 예산 상한으로 삼아 비교 조건을 맞췄다.[1]

조언·채점·회고는 서로 다른 피드백이다

Advise는 실제 작업을 맡은 executor와 판단을 돕는 adviser를 분리한다. 실행 에이전트는 작업 중 조언자를 호출해 다음 단계가 맞는지 확인하고 그 조언을 바탕으로 진행한다. 발표의 영업 에이전트 사례에서는 후속 연락이 늦어지거나 거래가 정체되는 상황을 놓치지 않도록 여러 업무 요소를 함께 살피는 역할이다. 단순히 작업을 여러 에이전트에 나눠 병렬 처리하는 방식과는 목적이 다르다.[1]

Grade는 좋은 결과의 조건을 rubric이라는 평가 기준으로 먼저 정한다. 실행 결과를 별도 grader가 기준에 맞춰 검사하고 부족한 부분을 돌려주면 executor가 다시 시도한다. 환불 상담 사례라면 응답의 문장이 자연스러운지만 보는 대신 상점의 환불 조건에 맞는 결론을 냈는지 평가한다. 조언이 다음 행동의 방향을 잡아준다면 채점은 이미 만든 결과가 요구사항을 만족하는지 확인해 수정으로 연결한다.[1]

Dream은 한 번의 실행이 끝난 뒤에도 기록을 활용한다. dreamer가 executor의 작업과 대화 기록을 읽고 발견한 내용을 메모리에 쓰면 다음 실행이 이를 다시 사용한다. 채용 에이전트라면 후보자가 적합했는지에 관한 반복적인 피드백을 다음 탐색에 반영하는 식이다. 여기서 학습은 발표에 등장한 메모리의 축적과 재사용을 뜻하며 모델 가중치를 다시 훈련했다는 설명은 아니다.[1]

80% 맞는 결과와 실제로 쓸 수 있는 결과의 차이

발표자들이 지표를 바꾼 이유는 금융 분석가의 작업 방식에 있다. 손익계산서(P&L)의 평가 점수가 80%여도 수익이나 비용 숫자가 틀리면 분석가는 계산을 다시 하거나 에이전트를 다시 실행해야 한다. 부분 점수가 높다는 이유만으로 결과물을 바로 사용할 수는 없다. 그래서 모든 평가 조건을 충족한 실행만 통과시키고 하나라도 충족하지 못하면 실패로 처리하는 기준을 적용했다.[1]

같은 예산 조건에서 완전히 통과한 실행 비율은 Execute 42%, Advise 67%, Grade와 Dream 각각 75%였다. 앞의 0.76이나 0.92는 평가 점수이고 이 비율은 실행 전체의 통과 여부를 집계한 값이다. Grade가 0.92를 받았다는 사실을 업무를 완벽하게 끝낼 확률이 92%라는 뜻으로 읽으면 안 된다. 반대로 완전 통과도 해당 평가 기준을 만족했다는 의미이지, 기준에 없는 모든 현실 위험까지 없다는 보장은 아니다.[1]

재시도까지 포함하면 비용 순위도 달라진다

발표는 한 번의 실행에 들어간 토큰보다 완전히 통과한 답을 얻기까지의 총 토큰을 비용으로 비교한다. 슬라이드가 제시한 값은 Advise 약 120만, Grade 약 130만, Dream 약 170만, Execute 약 180만 토큰이다. Execute는 한 번의 실행이 단순해도 실패 후 재시도가 늘어나면 유효한 결과를 얻는 비용이 커진다. 반면 조언이나 채점에 별도 토큰을 배분한 전략은 추가 작업 자체가 재시도를 줄이는 데 기여할 수 있다.[1]

이 수치에는 설명용 근사가 들어 있다. 발표자는 Execute의 약 42% 통과율을 약 세 번의 실행으로 설명하고 실행당 60만 토큰을 곱해 180만 토큰을 제시한다. 다만 매 실행의 성공확률이 독립적으로 42%이고 매번 정확히 60만 토큰을 쓴다고 가정하면 첫 성공까지의 수학적 기대값은 약 2.38회, 약 143만 토큰이다. 이는 발표 수치와 구분해 검산한 가정 계산이며 실제 실행이 독립적이라는 뜻은 아니다. 따라서 슬라이드의 총비용을 그대로 보편적인 기대비용 공식으로 쓰거나 세 번이면 성공이 보장된다고 해석해서는 안 된다.

어떤 전략을 택할지는 최적화할 지표에 달려 있다. 이 실험에서 토큰 효율을 우선하면 Advise가 유리하고 한 번의 실행이 완전히 통과할 가능성을 높이려면 Grade나 Dream 쪽이 유리하다. 두 전략의 완전 통과율은 같아도 제시된 총비용은 달랐으므로 메모리를 활용하는 복잡한 구성이 언제나 더 경제적인 것은 아니다. 토큰 수와 실제 요금도 같은 값은 아니며 모델별 단가와 입출력·캐시 구성, 재시도에 걸리는 시간은 별도로 확인할 비용 요소다.[1]

실행 환경 위에 역할 조정 계층을 얹는다

발표 후반부의 구조는 단일 에이전트의 실행 환경과 여러 역할을 조정하는 계층을 구분한다. Execution Harness는 도구와 세션, 샌드박스, 오케스트레이션을 포함하고 그 위의 Coordination Harness가 executor와 adviser 같은 역할을 연결한다. 한 작업을 실행하면서 조언을 구하고 결과를 grader에게 넘긴 뒤 통과한 작업 기록을 dreaming에 보내는 조합이 가능하다. 개별 에이전트가 도구를 안정적으로 쓰도록 만드는 문제와 에이전트 사이의 피드백을 설계하는 문제를 나눠 보는 구조다.[1]

Claude Managed Agents의 공식 문서는 이 구분을 더 구체적으로 설명한다. Outcomes에서는 별도 컨텍스트의 grader가 rubric에 따라 결과를 평가하고 항목별 피드백을 실행 에이전트에 돌려준다.[2] Dreams는 기존 메모리와 과거 세션을 읽어 중복·모순·오래된 내용을 정리한 새 메모리 저장소를 만들며 입력 저장소를 직접 바꾸지 않는다.[3] 발표의 역할 개념을 실제 기능에 연결할 수 있지만 dreaming은 확인한 문서에서 연구 프리뷰로 안내하므로, 모든 계정이 즉시 사용할 수 있는 일반 기능으로 단정하지 않는다.

발표자들의 장기 목표는 모델과 플랫폼이 작업에 맞는 전략을 동적으로 구성하도록 만드는 것이다. 현재 발표가 보여준 것은 네 전략의 비교와 이를 조합할 기본 구조이며 모든 업무에서 최적 전략을 자동 선택하는 완성된 시스템의 검증 결과는 아니다. 평가 과제 수와 통계적 오차 범위도 발표에서 확인되지 않아 0.76과 0.89의 차이를 모든 업무에서 재현될 향상 폭으로 볼 수 없다. 실제 적용에서는 업무에 맞는 완료 기준을 먼저 정하고 점수·완전 통과율·총비용을 함께 비교하는 방식이 이 실험의 설계를 가장 충실하게 옮긴다.[1]

참고 자료

[1] https://www.youtube.com/watch?v=PXj0p_mW9nI — Tokens Should Have Jobs — Katelyn Lesse & Angela Jiang, Anthropic

[2] https://platform.claude.com/docs/en/managed-agents/define-outcomes — Define outcomes — Claude Platform Docs

[3] https://platform.claude.com/docs/en/managed-agents/dreams — Dreams — Claude Platform Docs

영상의 영어 자동자막을 통독하고 평가 그래프와 비용 그래프의 수치는 영상 프레임 OCR로 대조했다. 제품 기능의 설명에는 별도로 확인한 공식 문서를 덧붙였다.

원문 출처는 본문의 Source에서 확인할 수 있습니다.