Jungseob's Note
포스트
원문 대표 이미지 · Self-Improving Harnesses, Local Personal AI And YC's Agent For Work

래퍼라고 무시받던 것이 30퍼센트를 95퍼센트로 만들었다 - YC 하네스 나이트의 세 발표

하네스가 연구 대상이 아니라고 폄하되던 것을 같은 가중치 파일에서 ARC-AGI 30퍼센트를 95퍼센트로 올린 결과로 반박하며 시작한 YC 하네스 나이트 기록. GPT-2의 while 루프부터 자기수정 메타 하네스까지 6년 계보를 정리하고, Prime Agent와 OpenJarvis, YC 사내 QM 세 발표에서 문맥을 캐시 계층으로 다루는 설계와 로컬 추론 800배 비용 절감, 그리고 에이전트 50대 운영이 왜 무너졌는지를 담았다.

래퍼라고 무시받던 것이 30퍼센트를 95퍼센트로 만들었다 - YC 하네스 나이트의 세 발표

래퍼라고 무시받던 것이 30퍼센트를 95퍼센트로 만들었다

TL;DR

  • 폄하와 실측이 정면으로 대비되는데 하네스는 그냥 래퍼이고 스캐폴딩일 뿐이며 프롬프트 공학일 뿐이라는 말을 들어 왔고 이런 프롬프트 공학이 최상위 기계 학습 학회에 속하는지 확신이 없다거나 문맥 공학은 연구 문제가 아니라는 반응이 인용된다는 것이다. 그런데 수치가 반박한다. 같은 가중치 파일에서 검증된 최고가 30퍼센트였는데 연구 가치가 없다는 그 래퍼와 스캐폴딩만으로 95퍼센트에 도달했고 Nvidia의 것은 100퍼센트에 이르렀다.
  • 6년 계보가 한 줄기로 정리되는데 2019년 2월 GPT-2의 초기 하네스는 시퀀스 끝까지 도는 while 루프와 top-p 샘플링, 환경뿐이어서 도구 호출도 스킬도 아무것도 없었다는 것이다. 그리고 이후가 열거된다. 소수샷과 사고연쇄로 출력 공간을 늘리고 WebGPT와 툴포머로 도구를, MemGPT로 문맥 자체에 대한 생성·읽기·갱신·삭제를, Voyager로 스킬을, 리액트와 자기정련과 리플렉션으로 다중 에이전트를 더해 왔다.
  • 정적 하네스와 자기개선 하네스가 갈리는데 지난 6개월은 전부 자기개선 하네스에 대한 것이었고 DSPy가 역전파할 수 없는 과정을 유전 프로그래밍으로 후보를 찾고 병합해 최적 시스템 프롬프트를 학습한다면 다윈 머신은 한 걸음 더 나아가 하네스 코드 자체를 바꾸도록 허용한다는 것이다. 그리고 개념이 규정된다. 메타 하네스는 하네스를 생산하는 하네스이며 아주 메타한 개념이다.
  • Prime Agent의 설계 은유가 캐시 계층인데 모델 가중치가 가장 빠른 정보이고 활성 문맥이 그다음이며 파일 시스템이 L3이고 그 사이의 L2가 살아 있는 IPython 셸이어서 변수가 RAM에 남아 토큰을 크게 절약한다는 것이다. 그리고 원시 LLM과의 대비가 제시된다. 원시 LLM이 튜링 기계처럼 보인다면 하네스가 붙은 것은 외부 메모리에 읽고 쓸 수 있는 폰 노이만 컴퓨터에 훨씬 가깝다.
  • YC 사내 사례가 실패까지 공개되는데 4월에 모두에게 맥 미니를 사 주지 않고 이것을 제공할 수 있는지가 질문이 되어 VM에서 도는 에이전트 50여 대를 프로비저닝했으나 사람들이 가치를 얻으려면 설정이 많이 필요했고 이 함대 관리가 본질적으로 어려웠다는 것이다. 그리고 두더지 잡기였다고 표현된다. 개별 인스턴스에 SSH로 들어가 고쳐야 했으므로 두뇌를 샌드박스 밖으로 끌어올려 모든 것을 포스트그레스로 중앙화했다.

Source

Self-Improving Harnesses, Local Personal AI And YC’s Agent For Work — YC Paper Club(하네스 나이트), 1시간 11초

YC Harness Night

Source: Self-Improving Harnesses, Local Personal AI And YC's Agent For Work — YC Paper Club, 1시간 11초

Knowledge

왜 하네스가 하룻밤을 받을 만한가

행사가 도입부에서 스스로를 변호한다. 하네스가 그냥 래퍼이고 이것은 스캐폴딩일 뿐이며 프롬프트 공학일 뿐인데 왜 이것이 하룻밤을 받을 만한지 묻는다는 것이다. 그리고 폄하의 실물이 인용된다. 한 달 전 레딧에서 나온 가장 공격적인 반응은 이런 종류의 프롬프트 공학이 최상위 기계 학습 학회에 속하는지 확신이 없다는 것이었다는 것이다. 다른 하나도 인용된다. 문맥 공학은 연구 문제가 아니라는 것이다.

그래서 반박이 수치로 제시된다. 하네스는 오랫동안 수준 미달 연구로 폄하되어 왔지만 하네스 하나와 하네스 둘의 차이에서 문자 그대로 18퍼센트 상승을 준다는 것이다. 그리고 더 강한 근거가 제시된다. ARC-AGI를 작동하게 하느냐 못 하게 하느냐의 차이라는 것이다.

에이전트 지속 시간 도표도 근거로 쓰인다. 고전적인 METR 도표에서 출시일과 에이전트가 돌 수 있는 시간을 보면 이 진보의 많은 부분이 하네스 때문이었다는 것이다. 그리고 시대 구분이 제시된다. 하네스에 자기개선이 없던 시기를 정적 하네스 시대라 부르며 최근 6개월은 전부 자기개선 하네스에 대한 것이었다는 것이다.

측정의 문제도 지목된다. 우리는 계속 퍼플렉시티를 측정하고 그것이 IQ와 모델이 얼마나 지능적인지에 어느 정도 상관되므로 그 지능 차원을 계속 밀어 올리는데, 테스트 시점 경험은 별로 활용하지 않는다는 것이다. 그리고 문제가 명확해진다. 테스트 시점 경험을 이렇게 다 생성하고 새 도메인을 갖는데도 빠르게 적응하지 못한다는 것이다.

적응 구조의 부재도 실험으로 서술된다. 온라인에서 표본 수를 늘릴 때 배치 크기 하나에서 실제로 어떻게 학습하는지에 대한 구조가 없으며 문맥 내 학습을 하고 그것이 40이나 50 정도에서 포화되면 검증 성능이 전혀 개선되지 않는다는 것이다. 그다음 경로가 열거된다. 그러면 작은 랭크 LoRA로, 그다음 큰 랭크 LoRA로, 그다음 SFT로 가야 하며 이렇게 서로 다른 훈련 절차를 갖는 것이 이상하다는 것이다. 그래서 결론이 나온다. 바로 거기가 하네스가 빛나는 지점이라고 본다는 것이다.

ARC-AGI가 노출하는 것도 규정된다. 새 문제와 새 분포에 얼마나 빠르게 적응해 잘 하는지라는 것이다. 그리고 설계의 정성도 언급된다. 게임 하나에서 게임 둘로 갈 때 전부 직교하는 기술이 되게 해서 이 유동 지능 측정을 고립시킨다는 것이다.

핵심 수치가 제시된다. 다른 누구도 접근할 수 없는 비공개 홀드아웃에서 실제로 검증된 최고가 30퍼센트였다는 것이다. 그런데 결과가 뒤집힌다. 연구 가치가 없다는 그 래퍼와 스캐폴딩만으로 95퍼센트에 도달할 수 있고 Nvidia의 AVO는 100퍼센트에 이르렀다는 것이다.

우연히 만든 하네스

발표자 자신의 경험도 서술된다. 카파시가 3월에 자동 연구자를 냈을 때 그것을 포크해 이리저리 만져 봤다는 것이다. 의도도 밝혀진다. 무엇이 일어나는지 보고 추적할 작은 사용자 인터페이스를 만들고 싶었을 뿐인데 결국 우연히 하네스를 만들었다는 것이다.

구조가 구체적으로 제시된다. 목적을 명시하는데 실제로 준 예시는 확산 언어 모델이 자기회귀 모델을 못 이기지만 확산 모델의 GPU당 산술 강도가 매우 높으니 여러 개로 샤딩해 앙상블하면 총합으로 더 나은 결과를 얻을 수 있을지도 모른다는 것이었다는 것이다. 나머지 입력도 열거된다. 씨앗 아이디어 몇 개를 주고 앙상블 크기를 100배, 10배, 5배로 다르게 하라고 하며 검증 지표를 명시한다는 것이다.

에이전트 구성도 서술된다. 범위 설정 에이전트가 비슷한 논문과 깃허브 저장소를 찾고 그것을 PI 에이전트에게 주고 그다음 연구 에이전트에게 주며 그 에이전트가 작업하다가 도움이 필요하면 협의회에 넘긴다는 것이다. 그리고 감독도 붙는다. PI 에이전트가 매시간 정도 계속 확인하고 재촉하며 준비되면 저자 에이전트에게 넘겨 아이디어를 동결하고 절제 실험을 쓰고 논문을 쓰기 시작하라고 한다는 것이다.

현재 운용도 제시된다. 어디서나 볼 수 있는 조종석이 있고 테일스케일로 올려서 그 URL을 어디서나 보며 거기서 바로 대화할 수 있고 이메일 업데이트를 보낸다는 것이다. 그리고 결과가 서술된다. 실제로 논문을 발표하기 시작했으며 그 논문들을 읽어 봤는데 실제로 좋다는 것이다. 시간 경과도 제시된다. 3월과 4월에는 그리 좋지 않았지만 지금은 기본적으로 여덟 개 아이디어를 여덟 개 H100 노드에 주고 각각이 H100 여덟 개를 갖고 계속 돌게 한다는 것이다. 그리고 감상이 붙는다. 확인하러 들어가면 논문을 돌려주며 정확히 같은 가중치 파일에서 하네스만으로 지금 할 수 있는 일이 그냥 놀랍다는 것이다.

6년의 계보

역사 정리가 시작된다. 시간순이 아니고 많은 논문을 건너뛰며 터무니없이 조대하게 다룰 수 있다는 사과가 먼저 붙는다.

V0 하네스가 제시된다. 2019년 2월 GPT-2의 초기 하네스는 시퀀스 끝까지 도는 while 루프와 top-p 샘플링, 그리고 환경이 전부이며 그것이 하네스라는 것이다. 없는 것도 열거된다. 도구 호출도 없고 스킬도 없고 그런 것이 아무것도 없다는 것이다. 예시도 제시된다. GSM8K에서 시스템 프롬프트로 당신은 수학 교사라는 페르소나를 주고 문맥을 주며 사고연쇄가 전혀 없이 해시 네 개와 종료 토큰뿐이었다는 것이다.

그리고 지난 6년의 성격이 규정된다. 전부 정적 하네스에 더 많은 기능을 넣는 것이었다는 것이다.

단계가 순서대로 열거된다. 문맥에 예시를 여러 개 되돌려 넣는 것이 2020년 7월 소수샷 학습자 논문이라는 것이다. 그다음 사고연쇄인데 해시 뒤의 답을 직접 예측하는 것이 어려울 수 있으니 계산과 논리를 훨씬 많은 토큰에 퍼뜨려 훈련한다는 것이다. 성격도 규정된다. 그것들은 모두 문맥 혁신이고 출력 공간 혁신이며 행동 공간 혁신이라는 것이다.

도구가 다음이다. WebGPT가 먼저 나오고 그다음 툴포머인데 도구를 주는 아이디어이며 도구는 여러 항목이 명시된 JSON 객체일 뿐이라는 것이다. 예시도 제시된다. 가중치 파일에서 5 빼기 2를 계산하는 대신 파이썬을 호출해 결과를 받고 시스템 프롬프트에 모든 도구를 노출할 수 있다는 것이다.

MemGPT가 큰 전환으로 제시된다. 가장 멋진 도구 중 하나가 자기 문맥에 읽고 쓸 수 있는 것이라는 것이다. 이전과의 대비가 명확하다. 그전에는 문맥에 계속 덧붙이는 것만 할 수 있었는데, 문맥 자체에 대한 생성과 읽기, 갱신, 삭제를 주고 메모리라는 이 한 덩어리만 분리해 갱신할 수 있게 한 것이라는 것이다.

Voyager가 스킬의 기원으로 제시된다. 도구들을 사슬로 엮어 과업을 달성하고 그것을 학습해 시스템 프롬프트로 증류해 영원히 학습하게 하는 방법을 물었다는 것이다. 그리고 실행 환경도 밝혀진다. 마인크래프트에서 했으며 지금 스킬이라 부르는 것이 largely 이것이라는 것이다. 형태도 제시된다. skills.md가 있고 검색할 이름과 절차가 있다는 것이다.

인터코드가 다음이다. 행동 공간 혁신으로 코드를 출력할 수 있으면 즉석 도구 또는 즉석 스킬을 갖는 셈이라는 것이다. 그리고 솔직한 유보가 붙는다. 도구가 기술적으로 API이니 함수를 도구로 출력하는 것인지 스킬로 출력하는 것인지 아직 확실하지 않다는 것이다.

다중 에이전트가 이어진다. 리액트가 먼저, 그다음 자기정련, 그다음 리플렉션인데 서로 다른 역할을 가진 여러 에이전트가 문맥에서 자기개선을 도우면 점점 똑똑해질 수 있다는 아이디어라는 것이다. 예시도 제시된다. 행동을 취하고 내부 평가자에게 보내 맞는지 묻고 여기서 계속 돌거나 실제 환경으로 가서 보상 신호를 받는다는 것이다.

서브에이전트와 재귀도 제시된다. 도구 중 하나가 서브에이전트 집합을 생성하는 것일 수 있고 그것들이 지속적으로 돌면서 상호작용할 수 있다는 것이다. 그리고 RLM이 더 나아갔다고 한다. 재귀적으로 RLM 질의를 계속 호출해 더 큰 문제 부류를 풀고 원할 때마다 리프에서 LM 질의를 호출해 에이전트를 생성할 수 있으며 그 모두를 돌리는 주 오케스트레이터 에이전트가 있다는 것이다.

정적 하네스 V1의 구성

V1의 정의가 정리된다. 에이전트 스펙이 있고 시스템 프롬프트가 있으며 몇 턴까지 허용되는지 몇 번의 도구 호출이 허용되는지를 정하는데 무한을 허용하고 싶지는 않다는 것이다. 나머지도 열거된다. 도구 목록과 스킬 목록, 서브에이전트 목록을 명시하고 그것을 루프에 넣는 것이 largely V1이라는 것이다. 발동 방식도 두 가지로 제시된다. 슬랙 채널에서 무언가를 요청하면 프롬프트로 생성되거나 크론으로 매시간 깨어나 다른 누구와도 마찬가지로 일하기로 결정한다는 것이다.

하네스가 스스로 배울 때

가장 흥미로운 부분이 지목된다. 하네스 자체가 학습하게 하는 것이며 시스템 프롬프트를 학습하거나 하네스 자체를 학습하는데 그것이 아주 어질어질하다는 것이다.

DSPy가 먼저 소개된다. 시연과 탐색, 예측의 약자이며 작은 예시 집합인 훈련 세트를 받아 최적 시스템 프롬프트를 학습한다는 것이다. 방법이 제시된다. 그 과정을 역전파할 수는 없지만 유전 프로그래밍이라는 것을 할 수 있어 후보를 찾고 어떤 병합 규칙으로 후보를 병합하며 평가해 무엇이 일어나는지 보고 계속 작업한다는 것이다. 결과가 규정된다. 시스템 프롬프트 자체에 대한 생성·읽기·갱신·삭제를 주고 어떤 시스템 프롬프트든 고를 수 있게 한다는 것이다.

다윈 머신이 한 걸음 더 나아간다. 시스템 프롬프트를 바꾸는 것만 허용되는 것이 아니라 실제로 돌고 있는 하네스 코드 자체를 바꾸도록 허용된다는 것이다. 구조도 제시된다. 하네스와 시스템 프롬프트인 여러 에이전트의 보관소가 있고 거기서 표본을 뽑아 어떤 적합도 함수에서 어떻게 했는지 평가하고 보관소 상태에 되돌려 넣는다는 것이다. 그리고 자기수정이 설명된다. 메타 하네스가 에이전트가 자기 하네스를 수정해 다른 하네스가 되게 허용하며 그것이 계속 돌면서 시간에 걸쳐 점점 나은 에이전트를 얻는다는 것이다.

메타 하네스의 정의가 제시된다. 주 하네스는 하네스를 생산하는 것이며 정말 메타한 개념이라는 것이다. 그리고 대상이 열거된다. 다중 에이전트와 문맥 컴파일을 구성하며 그 모두에 생성·읽기·갱신·삭제를 허용하고 메타 프롬프트와 모든 에이전트의 시스템 프롬프트, 에이전트가 몇 개인지까지 계속 더해 메타 하네스를 시간에 걸쳐 키운다는 것이다.

지속 하네스가 한 걸음 더 나간다. 메모리의 부류에 색을 더하고 이력이라는 것을 추가한다는 것이다. 그리고 고전 강화학습 사람들이 좋아할 부분이 지목된다. 가중치 파일 자체를 갱신할 수 있는 대거 스타일 온라인 학습이며 방금 배운 소수의 예시에 기반해 LLM에 테스트 시점 훈련을 실제로 한다는 것이다. 평가도 붙는다. 그것이 실제로 우리가 작동시켜야 할 아주 중요한 연구 방향이라고 본다는 것이다.

Prime Agent — 문맥을 캐시 계층으로 다루기

첫 발표자는 프린스턴 소속이며 Prime Intellect 연구자이고 Prime Agent의 저자라고 소개된다. 그리고 발표 목적이 밝혀진다. 하네스를 어떻게 만드는지 생각하는 데 아주 첫 원리적 접근을 취하도록 설득하려는 것이라는 것이다.

원시 LLM의 성격이 먼저 규정된다. 실제로는 고정 가중치와 보이는 문맥을 가진 순차 처리기일 뿐이며 토큰을 받아 다음 결정을 위해 토큰을 낸다는 것이다. 그리고 요즘의 인식과 대비된다. 요즘은 그렇게 생각하지 않고 파일 집합과 끝없는 프로그램과 도구를 주며 다른 세션에 메시지를 보내고 서브에이전트를 만들지만 기본에서는 그냥 토큰 인 토큰 아웃이고 예측하는 신경망이라는 것이다.

하네스의 정의가 제시된다. LLM과 세계 사이의 층이며 지속 상태와 도구, 컴퓨트 같은 것을 더한다는 것이다.

구조가 서술된다. 에이전트 뷰가 모든 병렬 세션의 개요를 아주 촘촘한 요약으로 보여주고 하나로 들어가면 루트 세션이 여러 서브에이전트를 통제하는 프로젝트 오케스트레이터라는 것이다. 그리고 자동성이 명시된다. 서브에이전트를 시작하라고 요청할 필요가 없고 유용할 때 활용한다는 것이다. 원리도 밝혀진다. 재귀 언어 모델 원리에 기반해 모든 것이 이 IPython 셸 안에 있으며 모든 도구와 메모리, 서브에이전트가 그렇다는 것이다. 지속성도 제시된다. 각 에이전트가 컴퓨터의 지속 데몬으로 받쳐지므로 노트북을 닫거나 세션에서 나가도 배후에서 계속 돌고 있으며 계속 돌지 않게 하려면 실제로 세션을 멈춰야 한다는 것이다.

캐시 은유가 이 발표의 핵심이다. L1, L2, L3처럼 캐시 같은 것이며 우리가 작업하는 정보 중 무엇이 가장 접근 가능한지의 문제라는 것이다. 계층이 열거된다. 가장 빠르게 즉시 이용 가능한 정보는 모델 가중치이므로 모두가 정보를 모델 가중치에 넣고 싶어 한다는 것이다. 그다음이 제시된다. 갱신하려고 매번 미세조정하는 것은 아주 비싸니 활성 입력 문맥을 쓰며 입력에 아주 많은 토큰을 쓴다는 것이다. 그런데 한계가 온다. 어느 시점에 문맥이 바닥난다는 것이다.

압축의 위치가 규정된다. 우리가 본 가장 초기 형태의 하네스인데 가장 최소한의 하네스를 원한다고 말하는 사람들조차 지금까지 쓰며 에이전트가 문맥 길이 작업 창을 넘어가려고 자기 문맥 이력을 요약하는 아주 일반화된 도구이기 때문이라는 것이다.

L2와 L3가 구분된다. L3는 디스패치 상태에 더 가까워 파일 시스템으로 작업하면 주 메모리에 읽고 쓸 수 있다는 것이다. L2는 활성 문맥과 파일 시스템 사이인데 주피터 노트북처럼 파이썬을 직접 돌리는 살아 있는 셸일 수 있고 그 모든 변수가 RAM에 바로 저장된다는 것이다. 그리고 효과가 제시된다. 에이전트가 그것들을 프로그램으로 조작하고 거기 있는 정보로 온갖 프로그램을 돌려서 문맥에 직접 넣는 대신 토큰을 크게 절약한다는 것이다. 서브에이전트도 같은 원리로 제시된다. 특정 정보 집합으로 작업을 맡기고 끝에 보고받으므로 여기서도 기본적으로 문맥을 절약한다는 것이다.

갱신과 삭제의 필요가 강조된다. 생성과 읽기를 넘어 시간에 걸쳐 문맥과 상태를 어떻게 갱신하고 삭제하는지 생각해야 한다는 것이다. 그리고 이름이 붙는다. 셸에서 상태의 변수와 쓸 수 있는 서브에이전트를 정리하는 것을 에이전틱 가비지 컬렉션이라 생각한다는 것이다. 목적도 유머로 제시된다. RAM이 매일 노트북을 죽이지 않게 하려는 것이라는 것이다. 정련도 같은 논리다. 시스템에 저장된 스킬과 메모리, 프롬프트를 갱신하고 삭제해서 하드 드라이브 공간도 바닥나지 않게 한다는 것이다.

두 번째 은유가 제시되는데 이 발표에서 가장 인상적인 대목이다. 하네스가 우리가 만들고 있는 에이전틱 운영체제로 거의 향하고 있다는 것이다. 그리고 대비가 제시된다. 원시 LLM을 보면 티커 테이프와 들어가는 명령들, 나가는 연산들을 가진 튜링 기계처럼 보인다는 것이다. 반면 하네스를 보면 훨씬 더 폰 노이만 컴퓨터처럼 보이며 외부 메모리에 읽고 쓰는 연산을 할 수 있어 튜링 기계가 홀로 표현할 수 있는 것보다 훨씬 강력하고 다른 부류의 문제를 다룰 수 있다는 것이다.

설계 원칙이 제시된다. 상상할 수 있는 가장 표현력 있는 것이기를 원한다는 것이다. 그리고 과거와의 대비가 제시된다. 초기 하네스는 계획하고 행동하고 비판하는 아주 특정한 단계를 명시적으로 강요했는데, 지금 모델들은 그것을 스스로 할 수 있어 리액트 루프를 명시적으로 부과할 필요가 없다는 것이다. 그런데 아직 못 하는 것이 지목된다. 압축을 호출할 표현력, 프로그램을 돌릴 파이썬 셸, 서브에이전트를 프로그램으로 만들고 상태에 접근하며 서로 다른 피드백 기제를 가질 능력이라는 것이다. 그리고 판정이 나온다. 그것들은 모델이 통제하는 표현력 기능이며 하나라도 제거하면 그 능력을 실제로 제거하는 것이라는 것이다.

서브에이전트의 지속성이 RLM 논문을 넘어선 부분으로 제시된다. 서브에이전트를 지속적인 하위 세션으로 생각한다는 것이다. 흐름이 서술된다. 부모 세션이 새 RLM 서브에이전트를 띄우고 각각이 작업을 하고 끝나서 부모 세션에 어떤 종료 상태로 보고하며 그다음 유휴 상태로 RAM에서 여전히 살아 있다는 것이다. 그리고 재개가 가능하다. 어느 시점에든 부모가 서브에이전트에게 메시지를 보내 계속 작업하게 할 수 있고 시간에 걸쳐 쌓은 좋은 문맥을 다 갖고 있으므로 정보를 놓치거나 이미 개발된 정보를 재사용할 필요가 없다는 것이다. 자원 관리도 제시된다. RAM을 많이 쓰고 싶지 않으므로 비활성 상태로 내려놓고 언제든 메시지로 불러올 수 있다는 것이다.

에이전트 간 메시지가 처음부터 넣은 기능으로 소개된다. 부모와 자식, 형제 같은 핵가족 안에서 어느 두 에이전트 사이에도 메시지를 보낼 수 있다는 것이다. 동기가 솔직하다. 매일 다섯 방향, 오억 방향으로 모든 것을 하는 에이전트를 스스로 관리하는 최선의 방법을 계속 찾으려 했다는 것이다. 그리고 발견이 붙는다. 그들이 서로 문맥을 직접 공유하고 조율할 수 있으면 훨씬 나을 것이며 전형적인 소프트웨어 공학과 장기지평 작업에도 훌륭하다고 밝혀졌다는 것이다.

장기지평 평가에 대한 관점도 제시된다. 작업을 돌려 놓고 에이전트를 내내 돌볼 필요 없이 준비되면 확인하고 싶다는 것이다. 그리고 기존 평가의 문제가 지목된다. 모델을 충분한 시간 돌리지 않거나 이 모델은 이 예산 후 멈췄는데 다른 모델은 더 많은 예산으로 계속했다고 말하면, 우선 같은 고정 지출로 모델을 비교하는 것도 아니고 놓치고 있는 성능을 감출 수도 있다는 것이다. 자기 기준이 제시된다. 테스트 시점 토큰을 더 던질 때 성능에서 증분적 이득만 얻게 되는 지점인 실용적 정체점을 보고 싶다는 것이다.

컨닝하던 첫 실행과 실측

ARC-AGI 결과가 과정과 함께 공개된다. 지속 하네스로 Gemini에서 20퍼센트를 얻은 기억이 있어 최소 20퍼센트는 가능하다고 생각했다는 것이다. 그리고 시스템 프롬프트를 구한 경로가 밝혀진다. 정보를 잃지 않으려고 좋은 시스템 프롬프트를 찾다가 프로롱이라는 다른 커뮤니티 리더보드를 발견해 그들의 시스템 프롬프트만 가져와 나머지는 잊고 Prime Agent에 직접 던졌다는 것이다.

첫 실행의 실패가 솔직하게 서술된다. 첫 실행이 99.9퍼센트를 쳤는데 로그를 보니 컨닝하고 있었다는 것이다. 그래서 대응이 서술된다. 제대로 샌드박싱을 해야 한다고 판단해 하루를 더 썼다는 것이다.

정식 수치가 열거된다. GPT로 78퍼센트를 얻었다는 것이다. 프롬프트의 성격도 제시된다. 월드모델을 써서 ARC-AGI 3을 풀라고 하고 취할 수 있는 행동을 알려주는 일반 프롬프트에, 셸이 있고 서브에이전트를 호출할 수 있다는 Prime Agent의 일반 시스템 프롬프트를 붙인 것이라는 것이다. 그리고 ### 다른 하네스와의 비교

궤적이 서술된다. 이 다양한 시나리오를 확인하려고 코딩을 여러 번 호출하고 이미지를 분석하며 이미지 처리를 하는데, 셸을 활용하면서 합리적인 추론을 하고 있는 것으로 보였다는 것이다.

다른 수치도 열거된다. 다른 모델로 25.7퍼센트를 얻었고 그 전주에 OpenAI가 평가할 때 하네스가 아주 중요하다고 한 것과 비교된다는 것이다. 그리고 최고 수치가 제시된다. Opus로 95.5퍼센트를 쳤고 그것이 정신 나간 것이라 생각했다는 것이다.

다른 하네스와의 비교도 정직하게 제시된다. 클로드 코드로 돌렸는지 묻는 사람이 있는데 돌렸으며 불행히도 결과가 좋지 않았다는 것이다. 그래서 처리가 서술된다. 나쁜 결과를 내는 대신 원래의 클로드 코드 결과를 따랐고 다른 사람들이 Prime Agent와 비슷한 구성으로 돌려 훨씬 나은 결과를 얻었다는 것이다. 그리고 관찰이 제시된다. 인기 있는 하네스 중 상당수가 Prime Agent가 잘할 때 반드시 잘하지는 않는다는 것이다. 비용도 공개된다. 어떤 에이전트에서는 아주 빨리 많은 돈을 써서 성능을 크게 얻지 못한 채 5,000달러를 쓰고 끊어야 했다는 것이다. 그래서 결론이 나온다. 비용 대비 성능 비율이 아주 중요하며 돈을 절약하는 것 중 하나가 문맥을 프로그램으로 다룰 수 있는 것이라는 것이다.

다른 평가들도 제시된다. 울롱과 코딩, 곧 나올 에뮬레이터 벤치 같은 장기지평 평가를 여러 개 돌렸으며 여러 모델에 걸쳐 다른 하네스들과 대체로 동등하거나 약간 나았다는 것이다. 에뮬레이터 벤치의 성격도 제시된다. 컴퓨터 시스템 전체의 에뮬레이터를 재현하려는 것이며 이 경우 게임보이 컬러 같은 것을 만드는 것이라는 것이다. 그리고 셸의 효과가 지목된다. RLM에서 셸 접근이 있으므로 최종 해답을 채점자에게 제출하기 전에 훨씬 표현력 있고 자유로운 방식으로 실험 밖 루프 설계를 할 수 있다는 것이다.

자동 연구 실험도 제시된다. nanoGPT 스피드런을 확장해 H200 여덟 개를 일주일 주고 무엇이 일어나는지 봤다는 것이다. 그런데 결과가 솔직하다. 분산이 다소 커서 아주 어려운 과업이므로 하네스와 모델 중 어디에 이득을 귀속시킬 수 없다는 것이다. 그래서 대신 행동을 관찰했다고 한다. 루프 밖 실험이라 부르는 것을 하고 있었다는 것이다. 내용도 서술된다. 비싼 H200 실험에 모든 시간을 쓰지 않으려고 CPU에서 실험을 돌리고 매개변수화를 보고 초매개변수 탐색을 하며 데이터를 분석한다는 것이다. 그리고 평가가 붙는다. 주 실험이 아닌 실험을 돌려 그것들을 최적화하는 것이며 아주 멋진 행동이라고 본다는 것이다.

가장 큰 규모의 실행도 공개된다. 7일 팩토리오 실행을 스트리밍했으며 총 633개 에이전트와 2,300만 출력 토큰을 써서 기술 트리에서 꾸준히 기술 진보를 만들었다는 것이다. 이익도 제시된다. 서브에이전트가 공장에서 서로 다른 작업으로 나뉘어 연구하고 만들고 자원을 모아 다음 아이템을 만들 수 있으며 정련으로 과거에 일어난 것을 활용해 미래에 도움을 받으므로 막히지 않는다는 것이다. 그리고 가장 흥미로운 점이 지목된다. 막히지 않으며 마지막 단계에서도 기술 진보를 계속 만든다는 것이다.

권고도 제시된다. 에이전틱 문맥 관리를 생각해야 하고 스웜을 생각해야 하며 RLM을 더 깊이 들여다보고 표준화된 평가를 돌려 보라는 것이다.

OpenJarvis — 로컬로 800배 싸게

두 번째 발표가 스탠퍼드 프로젝트로 소개된다. 개인 AI가 어디에나 있지만 대체로 오늘은 클라우드에 묶여 있다는 것이다. 그리고 예시가 제시된다. OpenClaw와 Hermes agent 같은 프로젝트가 대부분의 지능과 대부분의 질의에 클라우드 LLM에 의존한다는 것이다.

대가가 네 가지로 열거된다. 꽤 비싸서 1년으로 합산하면 수천 달러의 API 비용이 든다는 것이다. 사적이지 않아서 가장 개인적인 데이터를 클라우드로 보내며 그 데이터가 어디로 가는지 반드시 알 수 없다는 것이다. 지능을 그냥 소유하는 대신 임대하게 만든다는 것이다. 그리고 노트북에서 돌리는 것보다 크기 자릿수로 더 많은 에너지를 소비하는 경향이 있다는 것이다.

로컬이 충분해졌다는 근거가 수치로 제시된다. 오늘의 로컬 모델이 이전의 최신 프론티어 모델보다 6개월에서 12개월 뒤에 있을 뿐이라는 것이다. 예시도 제시된다. 오늘의 27B급 로컬 모델이 옛 Opus급 모델과 대략 같은 성능을 달성한다는 것이다. 그리고 격차가 닫히는 이유가 제시된다. 노트북과 워크스테이션용 하드웨어 가속기가 점점 좋아지고 있다는 것이다. 최신 동향도 언급된다. 바로 이번 주에 애플의 새 맥 미니 출시를 봤으며 애플과 Nvidia가 개인 사용 사례를 위한 가속기를 만드는 데 새로 집중하는 것을 보고 있다는 것이다.

프로젝트 질문이 규정된다. 모델 추론과 에이전트 실행, 메모리, 학습, 즉 오늘 대체로 클라우드에 의존하는 부분을 전부 온디바이스로 만들면서 클라우드 전용 스택과 경쟁력을 유지할 수 있는지라는 것이다.

다섯 원시 요소가 열거된다. 필요한 사용자 인터페이스, 조합 가능한 추론과 서로 다른 지능과 도구를 쓰는 에이전틱 논리, 엔진으로 쓰는 LLM, 그것을 돌릴 추론 엔진과 하드웨어, 표준 MCP 프로토콜로 돌릴 도구와 메모리, 그리고 학습을 위한 원시 요소라는 것이다. 학습의 종류도 열거된다. 프롬프트 기반 기법이든 가중치 기반 기법이든 에이전트가 시간에 걸쳐 개선되어 더 개인적이고 효과적이게 만들 방법이 필요하다는 것이다.

클라우드로 로컬을 최적화하기

인터페이스 방침도 제시된다. 사람들이 이미 익숙한 표준 인터페이스로 가려 했으며 데스크톱으로 상호작용하며 평소처럼 돌리되 달러와 에너지에서 얻는 절약을 다 보게 하고 싶었다는 것이다. 그리고 지속 에이전트도 제시된다. 크론 잡처럼 지속적인 서로 다른 에이전트를 돌리고 날마다 표준 프로토콜을 돌릴 수 있게 하고 싶었다는 것이다. 목표가 정리된다. 사람들이 예전에 챗봇으로 첫 경험을 한 것과 같은 방식으로 온디바이스 LLM의 첫 경험을 하게 하고 싶었다는 것이다.

가장 흥미로운 설계가 제시된다. 로컬과 클라우드의 격차를 메우는 데 도움이 될 수 있는 것으로, 클라우드 LLM이 로컬 스택 전체를 자동으로 최적화하게 하는 것이라는 것이다. 이유도 제시된다. 클라우드 LLM의 능력을 활용해 변경을 진단하고 제안하고 게이트해 로컬 LLM을 위한 개선된 해법을 만들면서 실제로 로컬 스택을 배포할 때는 클라우드 비용을 물지 않는다는 것이다. 결과도 제시된다. 클라우드 LLM이 최적화한 OpenJarvis 구성이 그냥 상자에서 꺼내 배포한 로컬 스택보다 훨씬 효과적이었으며 특정 LLM과 특정 하네스에 맞출 수 있었기 때문이라는 것이다.

수치가 제시된다. 오늘의 온디바이스 LLM으로도 개인 AI와 코딩, 에이전틱 작업의 여러 워크플로에서 클라우드 LLM에 대적할 수 있다는 것이다. 다만 한계도 인정된다. 로컬 크기 LLM으로 충분하지 않은 과업이 여전히 많다는 것이다. 그럼에도 결과가 강하다. 오늘의 LLM으로도 800배 낮은 비용을 얻을 수 있고 지연도 크게 줄인다는 것이다.

최적화 모델의 선택도 실측으로 제시된다. 어느 클라우드 LLM을 골라도 전체 에이전틱 루프를 최적화하는 데 유용했다는 것이다. 다만 순위도 제시된다. Opus 계열과 GPT 계열이 자연히 가장 좋았다는 것이다. 그런데 흥미로운 점이 지목된다. Gemini나 Kimi, GLM 같은 다른 큰 LLM 계열을 골라도 로컬 구성을 최적화해 그 효율 이득과 성능 이득을 나중의 로컬 추론에서 포착할 수 있다는 것이다. 비용도 제시된다. OpenJarvis 하네스 전체가 더 많은 데이터나 더 많은 LLM 호출을 요구할 수 있는 대안보다 최적화하기 더 싸다는 것이다.

전망도 제시된다. 아주 가까운 미래에 사람들의 일상 추론 호출 중 큰 비중, 어쩌면 과반이 오늘의 표준처럼 클라우드로 밀려나는 대신 로컬 기기와 온프렘 노트북이나 워크스테이션으로 갈 것이라고 본다는 것이다. 근거도 반복된다. 가속기가 계속 좋아지고 LLM이 계속 좋아지므로 이 추세가 계속될 것이라는 것이다.

QM — 에이전트 50대를 관리하다 무너진 뒤

세 번째 발표가 YC 자체 시스템으로 소개된다. QM은 YC의 오픈소스 업무용 에이전트 하네스라는 것이다. 성격도 제시된다. YC의 모든 직원에게 완전히 맞춤 가능하고 슬랙이나 웹 UI에서 이용 가능한 OpenClaw 같은 조수를 주는 하나의 시스템이라는 것이다. 구조도 제시된다. 각 사람이 QM 안에서 자기 개인 문맥에서 일하며 자기 샌드박스 파일과 크론을 갖고 슬랙 채널 같은 다중 사용자 환경에서도 함께 일할 수 있다는 것이다. 용도도 열거된다. 이메일 분류 같은 자동화와 법무·재무 워크플로, 문서 편집과 내부 데이터베이스에서 데이터 추출을 아주 잘하며 살아 있는 내부 웹 앱을 띄우고 행사 계획도 돕는다는 것이다.

계보가 연도별로 서술된다. 2025년 1월에 만든 첫 번째는 내부적으로 일반 에이전트라 부르는데 시스템 프롬프트에 도구를 넣고 루프에 돌린 꽤 단순한 것이었으며 모두가 같은 것과 대화하는 모두에게 맞는 하나였다는 것이다. 그럼에도 성능이 좋았다고 한다. 구조적으로 꽤 단순했지만 데이터 질문에 답하는 데 여전히 놀랍도록 좋았다는 것이다. 그리고 범위 확대가 제시된다. 일반 에이전트가 잘하는 범위가 기반 모델이 좋아지면서 늘었고 결국 슬랙에 연결하고 크론을 더하고 도구를 몇 개 더 줘서 더 많은 도메인에 능하게 했다는 것이다.

2025년 6월이 다음이다. 그때쯤 엔지니어 다수가 클로드 코드와 코덱스를 쓰기 시작했고 이것들을 VM에서 꽤 쉽게 돌릴 수 있다는 것을 깨달았다는 것이다. 그리고 연결이 서술된다. 그것을 슬랙 태그에 연결했는데 일회성 코드 변경을 원하는 사람들에게 꽤 강력한 매체였다는 것이다. 추가 설정도 제시된다. CI 파이프라인을 돌리고 테스트용 개발 환경을 띄우게 구성했다는 것이다. 효과가 인상적으로 제시된다. 사람들이 들어와 버그나 원하는 것을 서술하면 봇이 가서 실제로 해결했으며 평생 코드 변경을 해 본 적 없는 사람에게도 꽤 강력한 것이라는 것이다. 개선 루프도 있었다고 한다. 봇이 어떻게 실패하고 어디서 틀렸는지 관찰하고 코드베이스에 있던 에이전트 규칙 파일을 갱신해 사용을 관찰하면서 나아지게 했다는 것이다.

올해 1월에는 파트너들이 OpenClaw를 쓰기 시작했다고 한다. 그리고 맥락이 설명된다. YC 파트너는 믿을 수 없이 바빠서 오피스 아워와 쏟아지는 인바운드 이메일, 지원서 검토 사이에 있으므로 추가 레버리지를 주는 어떤 도구든 믿을 수 없이 가치 있다는 것이다. 유용했던 이유도 제시된다. 그들 다수가 써 본 첫 에이전트로서 자기 컴퓨터를 가졌고 그래서 이전 패러다임의 에이전트와 달리 아주 맞춤 가능했으며 거의 개인 조수처럼 기능했다는 것이다.

그리고 4월의 실패가 공개된다. 모두에게 맥 미니를 사 주지 않고 이것을 YC의 모든 직원에게 제공할 수 있는지가 질문이 되었다는 것이다. 조치가 서술된다. VM에서 도는 Hermes agent 50여 대의 함대를 프로비저닝했다는 것이다. 그런데 문제가 두 가지로 제시된다. 확실히 꽤 도움이 되었지만 사람들이 가치를 얻으려면 설정이 많이 필요했고 이 함대를 관리하는 것이 본질적으로 다소 어려웠다는 것이다. 표현이 구체적이다. 개별 인스턴스에 SSH로 들어가 고쳐야 하는 두더지 잡기 상황 같았다는 것이다. 그래서 질문이 재설정된다. 이 큰 함대를 돌리는 단점 일부를 해결하려 하면서도 맞춤 가능성과 사람들이 실제로 가치를 얻던 것을 유지하는 무언가를 만들자는 것이었다는 것이다.

해법이 구조로 제시된다. 시스템의 두뇌를 샌드박스 밖으로 끌어올리는 것이라는 것이다. 문제의 진단도 제시된다. 에이전트가 자기 컴퓨터를 갖는 것은 아주 강력하지만 그 컴퓨터 안에 갇혀 있기도 하다는 것이다. 두 결과가 열거된다. 그 시스템을 관리하려 할 때 수십 대만 되어도 거의 즉시 다루기 어려워진다는 것이다. 그리고 모든 세션이 그 컴퓨터 안에 갇혀 있다는 것이다.

그래서 조치가 제시된다. 대신 모든 것을 포스트그레스로 내려놓아 사람들이 에이전트와 하는 모든 대화가 중앙화되고 그것을 에이전트 자신에게 노출해 시스템 전반에서 모이는 문맥을 볼 수 있게 한다는 것이다. 그리고 샌드박스의 위치가 재규정된다. 샌드박스를 에이전트가 사는 집이 아니라 에이전트가 필요할 때 담가 쓰는 자원으로 생각하기 시작했으며 훨씬 덜 제한적이라는 것이다.

부수 효과도 제시된다. 사람들이 에이전트와 한 대화의 모든 궤적으로 큰 평가 집합을 축적하며 원칙적으로 그것을 언덕 오르기 할 수 있다는 것이다. 그런데 결과가 정직하다. 그것으로는 결과가 반반이었다고 말하겠다는 것이다. 문제도 구체적이다. 마주치는 모든 버그를 고치도록 에이전트 급류를 파견하고 LLM을 심판으로 쓰면 주인공 증후군 같은 것이 생겨서, 에이전트가 코끼리의 자기 부분만 보고 수정을 한다는 것이다. 그래서 판단이 유지된다. 사람을 루프에 두는 것이 계속 아주 중요했다는 것이다.

얇은 하네스와 위임된 결정

연결 방침도 제시된다. 에이전트를 회사 전반의 가능한 모든 자원에 배선하는 것이라는 것이다. 그리고 자산이 언급된다. YC에 이미 여러 시스템을 잘 엮어 주는 CLI가 있었고 거기 없는 것은 임의의 API 키를 추가하게 허용한다는 것이다. 동등성 목표도 제시된다. 노트북에서 일하는 직원과 동등하게 하려고 기기 코드 OAuth를 키체인에 흡수하고 갱신해 주며 컴퓨터 앞의 사람 경험을 모방하려는 것이라는 것이다. 쓰기 정책도 제시된다. 데이터베이스는 대체로 읽기 전용으로 유지하되 사람이 검토한 대량 업서트로 쓰기를 허용하며 에이전트가 편집 계획을 내놓고 사람이 이상한 짓을 하지 않는지 한번 보고 나서 쓰기가 일어난다는 것이다.

그런데 솔직한 관찰이 붙는다. 이것들에 도장만 찍기 시작했다는 것이다. 비유도 제시된다. 초기에 클로드 코드를 쓸 때 도구 사용을 아주 면밀히 검토했다가 결국 에이전트에 대한 신뢰가 쌓이는 것과 조금 비슷하다는 것이다. 그리고 경계가 표명된다. 이것이 앞으로 몇 달 아주 면밀히 보고 있는 것이라는 것이다.

결정 위임도 제시된다. 에이전트가 더 무거운 개발 작업을 하면 자원이 더 많은 기계를 찾아가고 더 단순한 것이면 덜 강력한 샌드박스로 간다는 것이다. 그리고 평가가 붙는다. 그 결정을 하네스가 아니라 에이전트 자신에게 밀어 넣은 것이 아주 강력했다는 것이다. 런타임 선택도 같은 논리다. 에이전트가 제공자를 고를 수 있으면 AI 연구나 사이버 보안을 하려 할 때 거절을 여럿 받는 상황을 벗어나 필요할 때 다른 모델로 튀어나올 수 있다는 것이다.

하네스를 얇게 유지하는 방침이 제시된다. 시스템의 핵심을 세 도구로 생각하는데 원격 샌드박스에서의 실행, 객체 저장소 읽고 쓰기, 그리고 내부 앱 발행이라는 것이다. 나머지의 위치도 규정된다. 메모리와 크론을 다루는 다른 도구가 있지만 그것들은 시스템의 거친 모서리를 임시로 덮는 것으로 생각하며 가능한 한 작게 유지하려 한다는 것이다.

아직 아닌 것들

문제 세 가지가 정직하게 공개된다. AGI를 예상하는 하네스가 되려 하지만 아직 거기 없으므로 마주친 것들이 있다는 것이다.

첫째는 포기다. 이 모든 도구가 있는 아주 유능한 환경에 넣으려 했는데도 너무 일찍 포기하는 일이 잦다는 것이다. 대응이 제시된다. 그라인드 도구라 부르는 것으로 목표에 예산을 설정해서, 에이전트가 일정한 벽시계 시간이나 일정한 토큰 지출 전에는 과업을 포기할 수 없게 한다는 것이다. 효과도 제시된다. 훨씬 나은 연구 산출과 나은 보고서를 얻는다는 것이다. 그리고 외부 사례가 언급된다. OpenAI와 앤스로픽이 아주 비슷한 기법으로 수학의 미해결 문제 일부를 깨는 것을 보는 게 재미있었으며 평범한 사무 업무에도 통한다는 것이다.

둘째는 상황 혼동이다. 하네스가 다중 사용자와 슬랙에서 작동하는데, 훈련의 산물 때문에 시스템 프롬프트에 꽤 명확히 명시해도 자기가 있는 상황에 대해 아주 혼동할 수 있다는 것이다. 그래서 대응이 제시된다. 이것에 대한 로컬 어포던스를 갖는 것이 아주 중요했다는 것이다.

셋째가 이 발표에서 가장 중요한 문제로 제시된다. 에이전트가 사회적 문맥을 이해하지 못한다는 것이다. 구체적 대비가 제시된다. 동료에게 정보 한 조각을 말하면 그는 직관적으로 그 정보를 어디에 공유해도 되는지 알거나 최소한 좋은 심적 틀을 갖는데, 에이전트로 이것을 재현하려면 실제 작업이 필요하다는 것이다. 위험도 명시된다. 특권 정보가 있어서는 안 될 문맥으로 아주 쉽게 새어 들어갈 수 있다는 것이다. 그래서 한계가 규정된다. 두뇌에 넣을 수 있는 정보는 실질적으로 권한 시스템이 얼마나 좋은지에 의해 제한된다는 것이다. 그리고 조건의 불균형이 지목된다. YC는 다행히 여러 해에 걸쳐 만든 세밀한 권한 부여 기능이 있는 기존 소프트웨어 시스템을 갖고 있지만 많은 사람은 그것이 없으므로, 미묘한 지식 공유를 허용하는 데 작업이 필요하다는 것이다.

더 생각해보기

  • 같은 가중치에서 30퍼센트와 95퍼센트를 만드는 차이가 하네스라면 모델 벤치마크는 무엇을 측정하는가.
  • 문맥을 캐시 계층으로 보는 은유는 어디서 무너지는가.
  • 튜링 기계와 폰 노이만 컴퓨터의 대비는 하네스 설계에 실제로 어떤 지침을 주는가.
  • 표현력 기능 하나를 제거하면 능력을 제거한다는 판정은 최소 하네스 주장과 어떻게 화해하는가.
  • 첫 실행에서 컨닝을 발견한 경험은 다른 평가 결과를 어디까지 의심하게 만드는가.
  • 로컬이 클라우드보다 6개월에서 12개월 뒤라는 진단은 어떤 작업에서 무의미해지는가.
  • 클라우드 모델로 로컬 스택을 최적화하는 구조는 프라이버시 목표와 충돌하지 않는가.
  • 에이전트 50대 함대가 관리 불가였다는 경험은 개인 사용자에게 무엇을 뜻하는가.
  • 도장만 찍기 시작했다는 자기 관찰은 사람이 루프에 있다는 주장을 어떻게 흔드는가.
  • 사회적 문맥 이해가 권한 시스템 품질로 환원된다면 권한 체계가 없는 조직은 무엇을 해야 하는가.
원문 출처는 본문의 Source에서 확인할 수 있습니다.