Jungseob's Note
포스트
Dwarkesh Patel과 AI 연구자 세 명의 재귀적 자기개선 토론

AI가 AI를 개선해도 남는 병목 - 연구 목표와 지속학습을 둘러싼 세 연구자의 논쟁

재귀적 자기개선의 목표 설정, 현실적인 학습 분포, 지속학습과 RL의 제약을 논쟁의 쟁점별로 정리한다. 연구 생산성과 초지능의 시간표에 붙은 조건을 구분한다.

AI가 AI를 개선해도 남는 병목 - 연구 목표와 지속학습을 둘러싼 세 연구자의 논쟁

TL;DR

  • AI가 실험 코드를 잘 짜는 것과 스스로 다음 연구 목표를 정하는 것은 다르다. 재귀적 자기개선이 사람 없이 계속되려면 목표 선택·실험·해석·목표 수정이 함께 작동해야 한다. 세 연구자는 진보를 인정하면서도 이 순환이 어디까지 자립할지에는 견해가 갈린다.
  • 어려운 문제를 푸는 능력과 실제 업무에 잘 맞는 행동은 별개의 학습 축이다. 증류에서도 교사 모델 접근만큼 현실적인 프롬프트 분포가 중요하다. 벤치마크 점수를 복제해도 사용자와 여러 번 조율하는 능력까지 따라오는 것은 아니다.
  • 배포 경험을 다음 모델에 반영하는 과정과 한 모델이 매 순간 배우는 지속학습은 구분해야 한다. 작은 업데이트를 반복하면 망각과 일반 능력 저하가 생길 수 있다. 기업이 자신의 데이터를 공통 모델 학습에 제공할 유인도 별도 문제다.
  • RL의 성과에는 좋은 중간학습 데이터와 다양한 환경이 함께 기여한다. 작은 학습 신호도 행동을 크게 바꿀 수 있지만 모든 영역으로 추론이 전이되는지는 불확실하다. 오래 작업하는 능력과 다양한 생각을 내는 능력도 같지 않다.
  • 연구 생산성 10배의 시점에 John Schulman은 약 2년, Charlie O’Neill은 5~10년을 제시했다. Beren Millidge는 실험 피드백을 몇 차례 자율적으로 잇는 능력이 큰 차이를 만들 수 있다고 본다. 이 숫자는 같은 미래에 대한 합의가 아니라 정의와 병목 판단이 다른 개인 전망이다.

AI가 연구 코드를 사람보다 훨씬 많이 쓸 수 있어도 연구 전체가 같은 비율로 빨라지지는 않는다. 다음에 어떤 실험을 할지, 결과에서 무엇을 배울지, 언제 기존 접근을 버릴지에 약점이 남으면 그 부분이 전체 속도를 묶는다. Dwarkesh Patel과 John Schulman, Beren Millidge, Charlie O’Neill의 대화는 AI가 AI를 개선하는 재귀적 자기개선이 이런 병목까지 넘을 수 있는지에서 시작한다.

실험을 실행하는 능력과 질문을 고르는 능력

Schulman은 새로운 모델에 감탄했다가 실제로 써 보면서 한계를 다시 발견하는 일이 반복될 수 있다고 본다. 한 분야의 약점이 개선돼도 판단이나 자기 검증이 부족한 다른 분야가 병목으로 남는다. Millidge는 시뮬레이션과 현실의 간극, 지속학습의 어려움이 예상보다 오래 이어지는 경우를 생각한다. 다만 이것이 자신이 가장 유력하게 보는 미래라는 뜻은 아니며 왜 급격한 도약이 일어나지 않을 수 있는지를 설명하는 조건부 시나리오다.

O’Neill의 의문은 현재의 트랜스포머와 RL 조합이 가능한 학습 시스템의 최선에 얼마나 가까운지다. 이미 정한 손실이나 보상을 더 잘 최적화하는 연구는 자동화하기 쉬울 수 있다. 그러나 다음 패러다임을 열 목표 자체를 찾아야 한다면 같은 방법을 더 크게 돌리는 것만으로 충분하지 않을 수 있다. 무어의 법칙처럼 매끄러워 보이는 성장 곡선 아래에도 개별적인 기술 전환이 필요했다는 비유다.

Schulman은 과거 자신도 다음 토큰 예측만으로 중요한 지능을 배우기는 어렵다고 생각했지만 실제 결과는 달랐음을 인정한다. 학습 목표에 직접 쓰지 않은 능력이 일반화로 나타나는 일이 이미 있었기 때문에 이론적인 반론만으로 미래를 닫을 수는 없다. 반대로 과거에 예상 밖의 일반화가 있었다는 사실이 다음 일반화까지 보장하지도 않는다. 대화의 쟁점은 진보의 존재보다 어디까지 전이될지에 있다.

연구의 마지막 판단은 무엇을 원하는지 정하는 일이다

목표가 명확한 연구에는 자동화할 여지가 아직 많다. 기존 실험 자료를 더 깊게 분석하고 작은 실험을 설계하며 잘못된 가정을 일찍 찾아내면 큰 학습 실행 전에 낭비를 줄일 수 있다. O’Neill은 스케일링 법칙과 학습률 연구를 예로 들어 주어진 목표 안에서 분석을 잘하는 것만으로도 상당한 진전을 앞당길 수 있다고 본다. 그러나 이미 존재하는 자료를 더 오래 생각하는 일과 새 목표를 선택하는 일은 같지 않다.

Millidge는 자립적인 자기개선에 목표 제안, 최적화, 결과 이해, 다음 목표 제안의 반복이 필요하다고 설명한다. 중간에 방향을 잃지 않고 이 순환을 오래 유지해야 사람 없는 연구가 된다. 현재 모델은 실험 구현에 비해 어떤 질문을 할지 정하는 데 약하고 작고 흩어진 제안을 내놓기 쉽다는 경험도 공유한다. 단순히 작업 시간을 늘리는 것만으로 이 능력을 확인할 수는 없다.

Schulman이 가장 오래 남을 인간의 역할로 꼽는 것은 원하는 행동과 목표의 정의다. AI 비서가 어떻게 행동해야 하는지, 도움이 된다는 것이 무엇인지, 헌법이나 모델 행동 규범에 무엇을 넣을지 결정하는 작업이 여기에 속한다. 정렬도 목표를 정하는 부분과 그 목표를 달성하도록 최적화하는 부분으로 나눌 수 있다. 기술적 실행을 자동화하더라도 목적을 정하는 판단까지 같은 속도로 사라진다고 보지는 않는다.

증류의 경쟁력은 현실적인 질문 분포에 달려 있다

선도 모델 개발에는 막대한 자원이 필요한데도 모델 공급자가 소수로 완전히 정리되지 않는 이유로 Schulman은 증류를 든다. 먼저 발견한 행동을 다른 모델이 학습할 수 있으면 선두의 이점이 뒤따르는 기업으로 이동한다. Millidge는 지속학습도 이 추격을 자동으로 막지는 못한다고 덧붙인다. 교사가 계속 개선되면 이를 배우는 과정도 같은 주기로 운영할 수 있다는 논리다.

그렇다고 교사 모델과 추론 과정에 접근하기만 하면 모든 능력을 쉽게 복제할 수 있는 것은 아니다. 어떤 질문으로 교사에게 행동을 끌어낼지가 중요하다. 현실의 사용자는 결과를 보고 요구를 바꾸고 새 기능을 요청하며 때로는 계획 자체를 되돌린다. 이런 넓고 실제적인 프롬프트 분포가 없으면 어려운 시험 문제의 정답은 따라 해도 실제 사용자와의 조율은 약할 수 있다.

대화에서는 일부 중개 서비스의 사용자 기록이 증류에 유용한 자료가 된다는 주장과 중국 연구소의 경쟁력을 둘러싼 가설이 나온다. 이는 출연자들의 설명이며 각 회사의 내부 학습 과정을 독립적으로 감사한 결과는 아니다. 중요한 기술적 구분은 Schulman이 제시한 난도와 현실성의 두 축이다. 검증하기 쉬운 고난도 퍼즐을 많이 만드는 것과 여러 목표·피드백이 섞인 실제 업무를 재현하는 것은 서로 다른 설계 과제다.

큰 모델은 좁고 어려운 과제에서 현실적인 업무로 더 잘 일반화할 가능성이 있다. 작은 학생 모델이 같은 벤치마크 점수를 얻었다고 그 일반화까지 보존했다고 할 수는 없다. 반대로 현실적인 질문 분포를 잘 확보하면 더 작은 모델도 사용자가 원하는 행동을 잘 배울 수 있다. 모델의 체감 품질 차이를 크기나 시험 점수 하나로 설명하기 어려운 이유다.

자동 연구자는 사람의 취향과 연습 환경을 함께 배운다

Schulman은 자동 연구자를 만드는 실제 경로가 인간 피드백과 다단계 연구 환경의 조합일 가능성이 높다고 본다. 연구자가 AI를 사용하면서 반복적으로 발견하는 약점을 다음 학습에서 고친다. 어떤 약점은 사람의 평가로, 어떤 약점은 새로운 연습 환경으로 보완한다. 연구자의 안목을 배우는 과정과 직접 시도해 결과를 확인하는 과정이 함께 들어간다.

O’Neill은 최신 학습 과정에서 찾은 버그와 개선점을 다음 세대의 환경으로 만드는 방식에 주목한다. 연구 역사의 처음으로 돌아가 모든 것을 재발견하게 하기보다 현재 도달한 지점에서 새 과제를 만드는 편이 연산 비용상 현실적일 수 있다. Millidge는 환경의 목표를 사람보다 높게 설정할 수도 있으므로 인간의 기존 궤적을 그대로 모방하는 데만 갇히지는 않는다고 반박한다. 쟁점은 환경에서 얻은 성과가 모호하고 열린 연구 문제에도 충분히 이어지는지다.

실제 연구는 정해진 점수를 올리는 일만으로 이루어지지 않는다. 새로운 방법이 가능할 것이라는 직관에서 출발해 현실성을 일부 낮춘 작은 과제를 만들고 작동 신호를 확인한 뒤 다시 현실적인 조건으로 확장하기도 한다. 이런 과제에서는 시험 자체가 연구 방향을 전부 알려주지 않는다. 무엇을 확인하려고 시험을 만들었는지 이해하는 능력도 필요하다.

배포 데이터를 쓰는 것과 계속 배우는 것은 다르다

대화는 모델이 경험을 학습하는 시간 단위를 구분한다. 배포 중 생긴 기록을 모아 다음 세대의 사전학습·중간학습·후처리에 반영하는 일은 가능하다. 하지만 지금 작동하는 모델이 매번 새 경험을 얻는 즉시 가중치를 바꾸고 이전 능력을 잃지 않는 지속학습은 더 어려운 문제다. 긴 간격으로 이뤄지는 모델 개선을 실시간 집단 학습과 동일시할 수는 없다.

실사용 피드백을 학습 신호로 바꾸는 일도 간단하지 않다. 사용자가 수정을 수락했는지는 관찰하기 쉽지만 그것이 장기적으로 좋은 결과였는지는 다를 수 있다. Schulman은 자연스럽게 발생한 데이터에서 올바른 보상함수를 정하는 문제가 크다고 지적한다. 표면적인 수락률만 최적화하면 사용자가 진짜로 원하는 품질과 다른 행동을 강화할 수 있다.

여기에는 경제적 제약도 있다. 기업은 자사의 업무 경험이 공통 모델에 흡수돼 경쟁자에게도 돌아가는 것을 원하지 않을 수 있다. O’Neill은 LoRA나 압축된 메모리 같은 별도 모듈로 기업별 지식을 넣는 방향을 생각한다. Millidge는 배포별 특화와 기록 수집, 다음 모델로의 통합이 반복되면서 그 주기가 점차 짧아질 수 있다고 본다. 기술적으로 가능한 데이터 이용과 고객이 허용하는 이용은 구분해야 한다.

작은 업데이트가 쌓이면 잊는 것도 늘 수 있다

좁은 업무의 성공 기록만으로 같은 모델을 계속 미세조정하면 새 지식이 늘면서 이전에 배운 내용이나 일반 능력이 손상될 수 있다. O’Neill은 수많은 작은 업데이트를 반복하는 조건에서 이런 망각과 성능 저하가 나타난다고 설명한다. 온폴리시 증류가 문제를 늦출 수는 있어도 무한히 안정적인 갱신을 보장하지는 않는다는 평가다. 큰 데이터 묶음으로 학습하는 것과 한 업무의 적은 자료로 계속 수정하는 것은 다르다.

Millidge는 같은 크기의 모델을 전체 자료로 새로 학습하면 더 나은 결과를 얻을 수 있다는 점에서 용량만의 문제는 아니라고 본다. 분포가 계속 변하는 자료를 받아들이면서 오래된 정보를 유지하는 기법이 부족할 수 있다. 반면 새 모델을 처음부터 학습하는 데에는 큰 비용이 든다. 현재 가능한 장기간의 중간학습과 어느 것도 잃지 않는 영구적인 지속학습 사이에는 간격이 남는다.

O’Neill은 누적되는 연구와 계속 변하는 업무의 차이도 제안한다. 학습 알고리즘의 발견은 다음 연구의 기반으로 남을 수 있지만 법률 사무소의 관계·암묵적 관행·정보 위치는 계속 바뀐다. 이처럼 분포가 계속 바뀌는 환경에서는 오래된 경험을 보존하는 일뿐 아니라 달라진 정보를 갱신하는 일도 중요하다. 다만 Schulman은 생각의 다양성과 장기적인 판단처럼 표본 효율 외의 약점도 있으므로 모든 병목을 지속학습 하나로 설명하지 않는다.

데이터가 좋아지는 것과 새로운 신호가 생기는 것

사전학습 자료에는 이미 신호가 있지만 잡음이 많아 필터링이 중요하다. 모델이 기존 지식의 경계에 다가가면 상황이 달라진다. 아직 발견되지 않은 증명이나 새로운 연구 결과는 웹 자료를 더 정제한다고 나타나지 않는다. 그 단계에서는 인간의 새 추론, 새로운 실험 환경, 실제 배포에서 얻은 경험처럼 다른 경로에서 학습 신호를 가져와야 한다.

RL 환경은 어렵기만 해서는 안 된다. 모델이 성공 궤적을 거의 찾지 못하면 정답에 대한 보상을 줄 기회도 부족하다. 중간 난도의 과제로 이어지는 커리큘럼과 좋은 초기 모델이 중요한 이유다. 환경을 만드는 비용과 실제 롤아웃을 실행하는 시간도 함께 늘어나므로 무한한 연습 과제를 저렴하게 공급할 수 있다고 가정할 수는 없다.

Patel은 작은 규모에서 과거 학습 방식과 여러 시기의 데이터셋을 교차한 조사 결과를 소개한다. 같은 수준의 능력에 도달하는 연산 효율 개선에서 데이터는 약 12.0배, 아키텍처 개선은 약 3.7배에 해당했다는 설명이다. 이 수치는 그 소규모 비교의 결과이며 대형 모델에서도 같은 분해가 성립하는지는 확인하지 못했다. 두 값을 단순히 곱해 AI 발전 전체를 설명하는 배수로 사용할 수는 없다.

Millidge는 아키텍처가 새로운 학습 영역을 열 수 있다는 점을 덧붙인다. 긴 컨텍스트를 경제적으로 처리할 수 없던 모델은 그 길이의 자료 자체를 활용하기 어렵다. 짧은 컨텍스트에서만 두 아키텍처를 비교하면 이런 변화의 가치를 놓칠 수 있다. 데이터의 질과 그것을 사용할 수 있게 만드는 구조는 독립적인 개선량으로 깔끔하게 나뉘지 않을 수 있다.

모델 크기의 최적점은 무엇이 부족한지에 따라 달라진다

긴 RL 롤아웃에서는 추론 비용이 중요하다. O’Neill은 당분간 환경의 난도와 공급이 병목인 만큼 활성 파라미터가 크게 늘지 않을 가능성을 제시한다. Schulman은 연산 자원과 GPU가 커지므로 모델 크기도 계속 커질 것으로 예상하지만 데이터 효율이 설계의 더 중요한 기준이 될 수 있다고 본다. 총파라미터와 한 번의 계산에 쓰는 활성 파라미터도 다른 자원이다.

희소한 모델에서는 여러 전문가 모듈이 같은 지식을 각각 학습해야 해서 데이터 효율이 달라질 수 있다는 논의가 나온다. 하드웨어의 메모리 용량과 대역폭 역시 큰 모델을 실제로 서비스하고 학습하는 범위를 제한한다. 연산이 부족하면 추론이 저렴한 작은 모델이 유리할 수 있지만 데이터가 더 부족해지면 큰 모델의 일반화와 표본 효율이 중요해질 수 있다. 어느 크기가 최선인지에 대한 일치된 전망이나 확정된 스케일링 법칙을 제시한 대화는 아니다.

RL은 적은 신호로도 행동을 크게 바꾼다

Millidge는 RL의 성공 중 상당 부분이 좋은 중간학습에서 시작한다고 설명한다. 합성 추론 자료와 관련 환경으로 모델을 준비한 뒤 RL로 정책을 조정하면 모든 행동을 처음부터 배울 필요가 없다. 중간학습이 최종 결과의 상당 부분까지 이미 도달한다는 그의 설명은 모든 학습 실행에서 측정된 고정 비율이 아니다. 중요한 것은 RL 전의 출발점과 RL 자체의 기여를 구분하는 일이다.

지도학습은 교사 궤적의 구체적인 토큰을 따라가지만 RL은 결과에 대한 보상에 집중할 수 있다. 정답을 만드는 데 중요하지 않은 표현까지 일치시키지 않아도 되므로 신호가 적다고 효과도 작다고 단정할 수는 없다. 파라미터의 작은 변화도 입력과 출력의 관계에서는 큰 행동 차이를 만들 수 있다. 학습 신호의 양과 그 신호가 갖는 방향성이 함께 중요하다.

O’Neill은 분야를 가로지르는 일반화보다 긴 시간 동안 작업을 이어 가는 일반화에 더 무게를 둔다. 수학 학습이 곧바로 최고의 코딩 능력을 만든 것은 아니지만 새 환경에서도 더 오래 진전을 유지하는 능력은 전이됐다는 해석이다. Millidge는 분야 간 전이도 일부 존재하며 학습 대상 환경 자체가 훨씬 넓어졌다고 덧붙인다. 따라서 최근 성능 향상을 순수한 범용 추론의 출현이나 단순 암기 중 하나로만 설명하기는 어렵다.

창의적인 해법과 다양한 목소리는 별개다

Schulman은 창의성이라는 말 안에 서로 다른 능력이 들어 있다고 본다. 제약이 많은 문제에서 뜻밖의 해법을 찾는 탐색 능력은 AI가 잘할 수 있다. 동시에 글의 주제와 등장인물 이름, 문체가 반복되면 출력 분포의 다양성은 낮을 수 있다. 하나의 뛰어난 스타일을 자주 내는 것과 여러 사람처럼 폭넓은 관점을 갖는 것은 다르다.

증류가 많이 이뤄지면서 여러 모델의 문체와 습관이 비슷해지는 현상도 이 맥락에서 논의된다. Schulman은 이런 단일한 문화의 형성을 걱정한다. Millidge는 그것이 RL이나 증류의 필연적인 성질이라기보다 좁은 데이터와 단순한 평가자의 선호를 최적화한 결과일 수 있다고 반박한다. 독창적인 한 번의 성공 사례와 전체 출력의 다양성을 각각 평가할 필요가 있다.

같은 시간표를 말하는 듯해도 목표가 다르다

일반적인 원격 사무직을 한 달 정도 수행하는 모델에 대해 O’Neill은 조직이 정보를 프로그램으로 접근하기 쉽게 제공한다면 약 1년, 브라우저 사용을 강하게 요구하면 더 오래 걸릴 수 있다고 본다. Millidge는 완전한 일반성을 약 3년으로 보면서 그 전에 조직이 AI에 맞게 바뀌어 상당 부분을 해결할 수 있다고 예상한다. Schulman도 약 1년 안에 일부 일을 잘하는 형태는 가능할 수 있지만 사람의 업무 품질 자체가 다양하다는 점을 강조한다.

AI 연구자의 전체 생산성 10배라는 질문에서는 차이가 더 커진다. Schulman은 약 2년, O’Neill은 5~10년을 제시한다. Millidge는 실험 결과를 해석하고 다음 실험을 고르는 과정을 두세 차례라도 자율적으로 이어 가면 큰 도움이 될 수 있다고 본다. 반면 O’Neill은 자신이 정보를 흡수하고 다음 실험을 판단하는 능력을 더 오래 남을 병목으로 생각한다. 코드 작성 속도와 연구 전체의 속도를 같은 배수로 놓지 않는 차이다.

컴퓨터로 할 수 있는 모든 분야에서 최고 전문가를 능가하는 모델이라는 더 강한 질문에는 Schulman이 3~4년, O’Neill이 5~10년을 답한다. Millidge는 연구소가 집중하는 영역에서 약 5년을 생각하지만 관심과 연산이 배정되지 않은 긴 꼬리 영역은 더 오래 걸릴 수 있다고 본다. Schulman의 전망에도 충분한 온보딩 자료와 장기 학습 문제가 해결된다는 조건이 붙는다. 모두 대화 시점의 개인적 전망이며 기술 로드맵이나 세 사람의 합의가 아니다.

참고 자료

AI researchers debate how close we are to recursive self-improvement — Dwarkesh Patel, 2026년 9월 11일. 출연자는 John Schulman(Thinking Machines), Beren Millidge(Zyphra), Charlie O’Neill(Baseten)이며 소속은 대화의 소개 기준이다.

공식 화자별 전사. 영상의 영어 수동자막과 공식 전사를 대조해 정리했다. 사례와 수치는 출연자의 설명·경험·가설을 구분해 옮겼으며 스폰서 광고는 본문에서 제외했다.

원문 출처는 본문의 Source에서 확인할 수 있습니다.