루프가 사고연쇄를 숨긴 것이 아니다 - Astra 소문에서 시작한 루프 트랜스포머 해부
Astra가 재귀 깊이를 쓰고 그것이 사고연쇄를 감춘다는 보도를 검증한 글. 같은 트랜스포머 블록을 여러 번 통과시키는 루프 구조가 무엇이며 파라미터는 절반이 되지만 계산량과 KV 캐시는 줄지 않는다는 대가를 정리하고, 추론 흔적이 짧아진 것은 루프가 아니라 능력 향상의 부수 효과라는 논거를 같은 계열 모델 비교로 제시한다.
루프가 사고연쇄를 숨긴 것이 아니다
TL;DR
- 검증 대상이 보도 하나로 특정되는데 공식 모델 발표 이틀쯤 전에 어떤 내부 정보에 따르면 Astra가 재귀 깊이 또는 루프 트랜스포머라 불리는 개념을 쓰고 있다고 보도되었다는 것이다. 그리고 판정이 두 갈래로 나뉜다. 저자는 Astra가 루프 트랜스포머 측면을 쓸 가능성이 아주 높다고 보지만 성공의 이유는 주로 개선된 훈련 레시피와 훈련 데이터일 것이며 루프 조정이 조금 도울 수는 있어도 보도가 그 기여를 과대평가한다고 본다.
- 구조가 한 문장으로 규정되는데 중간 표현을 한 번이 아니라 같은 트랜스포머 블록을 여러 번 통과시키는 아키텍처 조정이고, 요령은 이 통과들에서 가중치가 그대로라는 점이라는 것이다. 그리고 실물 예시가 제시된다. 어떤 3B 모델은 22개 블록 스택을 두 번 적용해 펼치면 44회 블록 적용이 되는데 두 번째 22회는 첫 스택의 가중치를 재사용하므로, 유효 깊이를 22에서 44로 늘리면서 가중치를 한 벌 더 추가하지 않는다.
- 절감과 대가가 구분되는데 22개 블록을 두 번 쓰면 44개 관행 블록보다 파라미터가 대략 절반이어서 가중치 저장 메모리는 줄지만 순전파에서 여전히 44회 블록 적용을 통과한다는 것이다. 그리고 KV 캐시도 줄지 않는다. 두 번째 통과에서 블록에 들어가는 중간 상태가 달라 키와 값도 다르므로 캐시를 따로 유지해야 하며, 어떤 연구팀은 캐시 공유로 크기를 절반으로 줄였지만 성능이 더 나빴다.
- 사고연쇄 감춤 주장이 반박되는데 OpenAI는 처음부터 추론 흔적의 대부분을 숨겨 왔으므로 최종 사용자에게는 큰 차이가 없어야 하고 해석 우려는 대체로 모델 개발자에 관한 것이라는 것이다. 그리고 비교로 논거가 제시된다. 같은 계열의 작은 모델이 비슷한 성능에서 80퍼센트 더 많은 토큰을 쓰는데 그것이 큰 모델을 덜 해석 가능하게 만드느냐고 물으며, 더 유능한 모델이 문제를 더 효율적으로 푼다는 것이 더 그럴듯한 답이라는 것이다.
- 컴퓨터 사용 훈련의 실체가 밝혀지는데 강화학습용으로 맥 미니와 맥 스튜디오 수만 대를 구매했다는 보도와 일관되며 맥은 모델을 훈련하는 기계가 아니라 모델이 macOS와 그 도구를 쓰도록 배우게 운영체제를 노출하는 환경이라는 것이다. 그리고 절차가 열거된다. 과업을 주고 화면 캡처를 제공하면 모델이 마우스와 키보드 행동을 예측하고 하네스가 실행해 갱신된 화면을 다시 넣으며, 성공과 실패 신호와 검증기를 훈련 피드백으로 쓴다.
Source
GPT-6 Astra, Looped Transformers, and Hidden Reasoning — Sebastian Raschka, PhD, 2026년 9월 9일
Knowledge
무엇이 개선되었는가
글은 최근 상황에서 시작한다. 지난 몇 주간 많은 일이 있었고 지금 모두의 머릿속에 새 모델이 있을 것이라는 것이다. 관심사도 열거된다. 성능에 대한 생각과 루프 트랜스포머 또는 재귀 깊이 측면, 그리고 Astra가 추론 흔적을 숨긴다는 소문이라는 것이다.
사용 소감이 먼저 제시된다. 지난 며칠 써 봤고 예외적으로 좋은 모델이며 이 글을 쓰는 시점까지 써 본 것 중 최고일 것이라는 것이다. 그런데 질문이 남는다고 한다. 정확히 무엇을 개선했고 어떻게 했는지라는 것이다.
강점의 성격이 특정된다. 다른 모델에 상대적으로 3D 렌더링과 애니메이션 과업에 불균형하게 좋다는 것이다. 그리고 의미가 밝혀진다. 글쓰기와 수학, 코딩 등 실질적으로 모든 범주에서 전작을 뛰어넘지만 그래픽 데모에서 특히 그렇다는 것이다.
벤치마크도 제시된다. 수학과 코딩에 정말 좋다는 것이다. 그리고 강조되지 않은 수치가 하나 제시된다. Astra가 논리 퍼즐 풀이와 일반화의 혼합을 측정하는 ARC-AGI-3 벤치마크에서 99.9퍼센트를 달성하며 전작은 7.8퍼센트였다는 것이다. 다만 우선순위가 제시된다. 수학과 코딩, 컴퓨터 사용 벤치마크가 실제 사용에 더 가까워서 더 흥미롭다는 것이다.
그런데 격차의 크기가 조정된다. 여러 에이전틱 코딩 과업을 섞은 코딩 에이전트 지수에서 Astra는 분명히 프론티어에 있지만 압도적으로 앞서지는 않는다는 것이다. 그리고 지능 지수에서도 같다고 한다. 코딩만이 아닌 여러 유형의 과업을 섞은 일반 지능 지수에서도 그렇게 보인다는 것이다.
독립 벤치마크의 장점도 제시된다. 독립적이므로 모델 개발자의 자체 평가 벤치마크보다 조금 더 신뢰할 만할 수 있다는 것이다.
그리고 하네스 문제가 지적되는데 이 논점이 중요하다. 하네스 설정이 벤치마크에 따라 다르다는 것이다. 공유 하네스를 쓰는 평가에서는 동일 조건 비교에 더 가까워진다는 것이다. 그런데 훈련 쪽 편향이 지목된다. 모델 훈련 중 모델은 보통 하나의 주 하네스를 염두에 두고 개발되며 다른 하네스에는 미세조정이 덜 된다는 것이다. 게다가 주 하네스는 종종 모델의 강점에 맞추고 증폭하도록 개발된다는 것이다. 그래서 결론이 나온다. 어떤 에이전틱 평가는 Astra가 자기 주 하네스에서 얼마나 잘하는지를 과소평가할 수 있으며 이것이 지능 지수 점수에 얼마나 영향을 주는지는 같은 과업으로 하네스를 넘나들며 비교해 시험해야 한다는 것이다.
곁가지 제안도 하나 제시된다. 동료가 최근 제안했고 클로드 코드 리드도 권한 것처럼, 기존 에이전트 규칙 파일과 스킬 파일 일부를 삭제하거나 보관하는 것이 나쁜 발상이 아닐 수 있다는 것이다. 이유도 제시된다. 새 모델이 프롬프트를 이해하고 문제를 푸는 데 더 효율적이 되었으므로, 추가적인 핸드홀딩이 새 모델을 불필요하게 제약해 더 나쁜 해법으로 이끌 수 있다는 것이다. 다만 유보가 붙는다. 스킬 파일을 다시는 쓰지 말라는 것이 아니고 어떤 작업 흐름에서는 재사용 시 효율을 높일 수 있는데 모델이 다시 발견하지 않아도 되기 때문이라는 것이다. 그리고 주장이 정리된다. 어떤 작업 흐름은 서술이 필요 없고 옛 서술은 더 이상 이상적이지 않을 수 있으며 LLM이 더 나은 해법을 낼 수 있으니, 그 지시 파일을 갱신하거나 재생성할 때인지도 모른다는 것이다.
컴퓨터 사용과 맥 수만 대
컴퓨터 사용 능력이 강점으로 제시된다. 이미지와 렌더링 과업에 예외적으로 강해 보인다는 것이다. 그리고 확장이 제시된다. 이 과업이 그래픽 사용자 인터페이스와 상호작용하는 것을 포함하면 컴퓨터 사용 능력도 보이며 모델이 앱을 통해 로컬 컴퓨터의 소프트웨어를 조작한다는 뜻이라는 것이다.
실제 시연도 제시된다. 브라우저 버전 그림판에서 컴퓨터의 마우스를 써서 자기 사진을 다시 그리게 한 비교를 했다는 것이다. 그리고 괄호가 붙는다. 토큰을 다 낭비하고 싶지 않아 최상위 노력 수준은 쓰지 않았다는 것이다. 의미도 규정된다. 이것이 모델의 예술적 능력만이 아니라 더 중요하게는 컴퓨터의 도구를 쓸 능력을 보여주며 마우스 커서로 인터페이스를 쓰는 것을 볼 수 있다는 것이다.
첫 사례가 아니라는 점도 명시된다. 하네스 안에서 일반 컴퓨터 사용이 가능한 첫 모델이 아니며 올해 초부터 엑셀 경비 관련 과업 같은 UI 작업에 성공적으로 썼다는 것이다. 다만 성숙도는 인정된다. 컴퓨터 사용은 상대적으로 새 능력이고 하네스가 가능하게 하며 보통 아직 그만큼 성숙하게 느껄지지 않는다는 것이다. 이유도 제시된다. LLM은 텍스트 모델이므로 자연히 낮게 달린 과일은 글쓰기와 코딩, API와 CLI 사용이라는 것이다.
그런데 반문이 제시된다. 아직 CLI를 노출하지 않는 도구와 소프트웨어가 많으므로, 누군가 그 인터페이스를 설계할 때까지 기다리는 대신 모델이 그래픽 사용자 인터페이스를 쓰도록 개선하지 않을 이유가 무엇이냐는 것이다. 비유도 제시된다. 이것이 떠오르는 휴머노이드 로봇 발전과 어느 정도 비슷하다는 것이다. 논리도 제시된다. 휴머노이드 로봇이 특수 목적 기계가 있는 조립 라인에서 가장 효율적인 로봇은 아니지만 다용도라는 것이다.
전망도 제시된다. 앞으로 몇 달이나 몇 년이 LLM과 에이전트 하네스 양쪽에서 컴퓨터 사용을 정교화하는 시대일 것이라 예상한다는 것이다. 그리고 결과가 제시된다. 이것이 기술 세계 밖의 일상 컴퓨터 과업에 LLM을 더 접근 가능하게 만들 것이라는 것이다.
훈련 방식도 설명된다. 컴퓨터 사용 추세는 OpenAI가 강화학습용으로 맥 미니와 맥 스튜디오 수만 대를 구매했다는 최근 보도와도 일관된다는 것이다. 그리고 역할이 정확히 규정된다. 여기서 맥은 모델을 문자 그대로 훈련하는 데 쓰이는 것이 아니고 그것에는 GPU가 낫지만 모델 훈련 중 macOS를 노출해 모델이 그 운영체제와 안의 도구를 쓰도록 배우게 하는 것이라는 것이다. 성격도 규정된다. 맥 또는 정확히는 macOS가 훈련 중 모델이 상호작용할 수 있는 환경으로 기능한다는 것이다.
작업 흐름이 단계로 열거된다. 앱을 열고 무엇을 하라는 식으로 과업을 주어 모델을 프롬프트한다는 것이다. macOS 인터페이스의 화면 캡처를 제공하며 보통 하네스가 한다는 것이다. LLM이 클릭과 키 입력, 스크롤 같은 마우스와 키보드 행동을 예측한다는 것이다. 그 행동을 맥에서 실행하며 역시 하네스가 한다는 것이다. 행동 수행 후 갱신된 환경의 새 화면 캡처를 넣는다는 것이다. 과업이 성공하거나 실패할 때까지 반복한다는 것이다. 그리고 성공과 실패 신호와 검증기 또는 채점기를 훈련 피드백으로 쓰며 사후훈련 중 강화학습을 포함하고 이것이 검증 가능한 보상을 쓰는 일반 강화학습과 유사하다는 것이다.
하드웨어도 언급된다. 모델은 아마 엔비디아 GPU에 있고 API로 맥에 전달된다는 것이다. 그리고 규모가 인용된다. 엔비디아 CEO가 Astra가 약 10만 개 그레이스 블랙웰 GPU에서 훈련되고 있다고 언급했다는 것이다.
패러다임 변화는 아니라고 못 박는다. 앞 절에서 논의한 컴퓨터 사용 훈련의 초점은 훈련 파이프라인의 근본적 패러다임 전환이 아니라는 것이다. 그리고 정체가 유지된다. Astra는 그리고 아마 예측 가능한 미래의 어떤 LLM도 여전히 추론 모델이라는 것이다. 뜻도 규정된다. 검증 가능한 보상을 쓰는 강화학습으로 훈련되고 중간 추론 흔적인 사고연쇄를 만든다는 것이다.
루프 트랜스포머란 무엇인가
정의가 한 문장으로 제시된다. 루프 트랜스포머는 본질적으로 아키텍처 조정이며 주된 발상은 중간 표현을 한 번만이 아니라 같은 트랜스포머 블록을 여러 번 통과시키는 것이라는 것이다. 그리고 요령이 특정된다. 블록을 그냥 더 추가하는 것과 비교하면 여기서의 요령은 이 통과들에 걸쳐 가중치가 그대로라는 것이다.
용어도 정의된다. 트랜스포머 블록은 어텐션과 피드포워드 모듈, 정규화, 단축 연결을 담은 단위이며 논문에서 흔히 트랜스포머 레이어라 불린다는 것이다. 스택은 트랜스포머 블록의 연속이라는 것이다. 블록 적용은 입력을 트랜스포머 블록에 한 번 통과시키는 것이라는 것이다.
새롭지 않다는 점도 명시된다. 루프 트랜스포머는 새로운 것이 아니며 기본 발상은 2018년 유니버설 트랜스포머 논문에 이미 나왔다는 것이다.
실물 예시가 제시된다. 7월에 나온 어떤 3B 오픈웨이트 모델이며 일반 트랜스포머처럼 보이지만 트랜스포머 스택 시작으로 되돌아가는 추가 화살표가 있다는 것이다. 흐름도 서술된다. 다른 트랜스포머 기반 LLM처럼 입력 텍스트가 토큰화되어 임베딩 벡터로 변환되고 이 벡터가 22개 트랜스포머 블록을 통과하며 각 블록은 자기 가중치를 갖는다는 것이다. 그리고 루프 측면이 제시된다. 첫 통과 후 은닉 상태가 같은 22개 블록을 통해 되먹여지며 블록 1이 다시 적용되고 블록 2가 이어지는 식으로 22까지 간다는 것이다.
펼친 결과도 제시된다. 이 계산을 펼치면 44회 트랜스포머 블록 적용이 된다는 것이다. 그런데 차이가 제시된다. 44개 별개 블록을 가진 관행 트랜스포머와 비교하면, 두 번째 22회 블록 적용은 첫 스택의 가중치를 재사용한다는 것이다. 대응도 구체적이다. 블록 적용 23은 블록 1의 가중치를, 24는 블록 2의 가중치를 쓰는 식이라는 것이다. 그래서 목적이 정리된다. 유효 깊이를 22에서 44회 블록 적용으로 늘리면서 트랜스포머 가중치를 한 벌 더 추가하지 않는 것이라는 것이다.
왜 2회인지도 다뤄진다. 논문에 세부가 많지 않지만 본질적으로 가장 효율적인 설정이었다고 말한다는 것이다. 그리고 판단이 제시된다. 루프를 2에서 3으로 늘리면 모델링 성능이 올라갈 수 있지만 추가 계산 비용이 값어치가 없었다는 것이다.
절감되는 것과 절감되지 않는 것
목적이 먼저 제시된다. 이 루프를 하는 이유는 본질적으로 블록을 더 추가해 모델을 그냥 크게 만드는 것의 대안이라는 것이다.
파라미터 절감이 제시된다. 22개 블록을 두 번 쓰는 모델은 44개 관행 블록 모델과 비교해 트랜스포머 블록 파라미터가 대략 절반이라는 것이다. 그리고 효과가 제시된다. 이것이 가중치 저장에 필요한 메모리를 줄인다는 것이다. 곁가지도 붙는다. 보통 크고 전체의 상당 부분을 차지하는 임베딩과 출력 레이어는 이 비교에서 별개이며 그 3B 모델에서는 총 3B의 약 25퍼센트이고 둘 사이 가중치 공유로 12.5퍼센트로 줄일 수 있다는 것이다.
그런데 계산은 줄지 않는다고 한다. 루프에서 같은 블록을 재사용하는 것도 여전히 계산을 요구한다는 것이다. 정확히는 순전파 중 중간 입력을 44회 블록 적용에 통과시킨다는 것이다. 훈련도 마찬가지다. 훈련 중 기울기가 공유 스택의 두 반복 모두를 거꾸로 흐른다는 것이다. 그래서 판정이 나온다. 22개 블록을 한 번만 쓰는 것과 비교하면 상당한 작업이 추가되며 실제로 44개 별개 블록을 갖는 것과 비슷하게 비싸다는 것이다. 예외도 명시된다. 옵티마이저가 갱신할 별개 파라미터가 더 적을 뿐이고 역전파는 여전히 44회 블록 적용 전체를 통과한다는 것이다.
KV 캐시도 다뤄진다. 이전 토큰의 어텐션 키와 값을 저장해 다음 토큰 생성 단계에서 재사용하는 KV 캐시가 관행 트랜스포머와 루프 트랜스포머 양쪽에 있다는 것이다. 그리고 절감이 없는 이유가 제시된다. 루프 트랜스포머에 가중치 공유가 있어도 두 번째 통과에서 블록에 들어가는 중간 상태가 다르므로, 결과 키와 값도 두 스택 사이에 다르며 루프가 없는 경우와 마찬가지라는 것이다. 그래서 결론이 나온다. KV 캐시 관련 절감도 없다는 것이다.
구체적 대응도 제시된다. 루프 설정에서 둘 다 블록 1을 쓰는 블록 적용 1과 23을 생각하면, 각 적용이 여전히 자기 KV 캐시 항목을 필요로 한다는 것이다. 그래서 결과가 정리된다. 두 통과의 캐시를 따로 유지해야 하므로 22개 블록의 반복 스택은 44개 별개 블록 관행 트랜스포머와 같은 KV 캐시 요구량을 갖는다는 것이다.
그리고 실험 결과도 인용되는데 이 대목이 흥미롭다. 연구자들이 통과 사이에 KV 캐시를 공유해 보려 했다고 논문에서 보고했다는 것이다. 결과도 제시된다. 물론 KV 캐시 크기가 절반이 되었지만 모델이 별개 캐시를 쓴 버전보다 나빴으며 별개 캐시 버전이 공개된 버전이라는 것이다.
다른 선택도 두 가지 인용된다. 루프 아키텍처를 처음부터 훈련하는 것이 이미 사전훈련된 트랜스포머를 업사이클링으로 변환하는 것보다 잘 작동했다는 것이다. 그리고 두 통과가 선호하는 절충을 줬는데 더 많은 통과는 작은 추가 이득만 가져오면서 훈련을 늦추고 최적화를 덜 안정적으로 만들었다는 것이다.
통과 횟수를 유연하게
유니버설 트랜스포머가 다시 제시된다. 앞의 3B 모델에서는 22개 블록 스택을 두 번 적용하는데, 2018년 유니버설 트랜스포머 논문에서는 블록 스택을 반복하는 대신 같은 트랜스포머 블록을 반복 적용한다는 것이다. 다만 주된 발상은 비슷하다고 한다.
적응적 중단도 제시된다. 단계 수는 고정될 수 있지만 논문은 적응적 중단도 탐색한다는 것이다. 예시도 제시된다. 특정 위치의 토큰이 루프를 한두 번만 통과할 수 있고 다른 토큰은 세네 번 통과할 수 있다는 것이다. 그리고 이익이 제시된다. 이것이 추가 계산에서 이익을 얻는 토큰에 계산을 배분할 유연성을 준다는 것이다.
결정 방식도 설명된다. 모델이 각 단계에서 각 위치에 대해 이른바 중단 확률을 출력하는 작은 훈련된 함수를 쓴다는 것이다. 절차도 제시된다. 연속된 루프에 걸쳐 이 확률을 더하고 주어진 위치에서 합이 임계값을 넘으면 루프를 멈춘다는 것이다. 그리고 안전장치가 있다고 한다. 혹시 모르니 최대 루프 수도 계산을 제한한다는 것이다.
또 다른 예시도 제시된다. 어떤 2.6B 모델이 같은 48개 블록 스택을 네 번 적용하며 48개 별개 블록의 가중치를 저장하면서 192회 블록 적용이 된다는 것이다. 그리고 성격이 규정된다. 기본적으로 앞의 사례보다 더 극단적인 경우라는 것이다. 추가 기제도 제시된다. 학습된 종료 게이트가 서로 다른 종료점에 확률을 부여하고 누적 확률의 임계값이 어느 통과가 출력을 제공하는지 결정한다는 것이다. 그래서 계보가 제시된다. 유니버설 트랜스포머의 적응적 중단 발상도 차용한 것이며 앞의 모델은 쓰지 않았다는 것이다. 다만 실무적 단서가 붙는다. 공개된 구현이 출력을 선택하기 전에 설정된 모든 통과를 계산하므로 루프 수가 사실상 4로 하드코딩된 것처럼 보인다는 것이다.
라우터로 통과 횟수를 정하기
세 번째 접근이 제시된다. 2025년 논문인 재귀 혼합이며 본질적으로 앞서 논의한 유니버설 트랜스포머의 더 정교한 버전이라는 것이다. 공통점도 제시된다. 유니버설 트랜스포머와 비슷하게 개별 토큰이 트랜스포머 블록을 한 번 이상 통과한다는 것이다. 그런데 혁신이 특정된다. 이 루프 횟수가 토큰별로 결정되는 방식이라는 것이다.
구조도 제시된다. 루프되는 반복 스택이 여기서 재귀 블록이라 불리고 여러 트랜스포머 블록을 담으며 별개의 첫 블록과 마지막 블록 사이에 앉는다는 것이다.
결정 방식이 대비된다. 앞서 논의한 유니버설 트랜스포머에서는 각 단계의 학습된 중단 확률에 기반한다는 것이다. 그런데 이 접근은 다르다고 한다. 작은 학습된 라우터를 쓴다는 것이다. 유사성도 제시된다. 전문가 혼합 모델의 라우팅 발상과 비슷한데, 다만 여기서 라우팅 결정은 공유 스택을 몇 번 적용할지 결정한다는 것이다.
중요한 세부도 제시된다. 라우터가 토큰의 은닉 표현에 작동하며 그것은 문맥 정보도 담고 있다는 것이다. 그래서 오해가 방지된다. 특정 토큰의 모든 출현에 같은 통과 수를 부여하는 것으로 생각하지 말아야 한다는 것이다. 이유도 제시된다. 그 단어가 어디 나타나고 앞에 무엇이 왔는지에 따라 결정이 바뀔 수 있다는 것이다.
두 라우팅 방식도 제시된다. 전문가 선택 라우팅에서는 각 재귀 단계가 자기가 처리할 토큰을 선택하며 종료한 토큰은 이후 단계에서 제외된다는 것이다. 토큰 선택 라우팅에서는 라우터가 처음에 한 번 결정해 각 토큰을 한 번이나 두 번이나 세 번 통과하는 경로에 배정한다는 것이다.
공통점도 정리된다. 두 경우 모두 트랜스포머 가중치가 통과에 걸쳐 재사용된다는 것이다. 그리고 추가 유연성의 출처가 제시된다. 각 토큰이 얼마나 많은 계산을 받는지 선택하는 데서 온다는 것이다. 훈련도 함께 이뤄진다고 한다. 모델과 라우터가 함께 훈련되므로 모델이 훈련 중 이 다른 경로들과 작동하는 법을 배운다는 것이다.
성과도 제시된다. 가장 작은 모델 규모에서는 일반 트랜스포머가 가장 잘한다는 것이다. 그런데 규모가 커지면 뒤집힌다. 더 큰 모델에서는 재귀 혼합이 따라잡고 종종 더 잘하며 특히 더 작은 훈련 예산에서 그렇다는 것이다. 그리고 가장 큰 예산에서는 여러 곡선이 아주 가깝다고 한다. 결론도 제시된다. 이점이 모델 크기와 훈련에 쓰는 컴퓨트에 달렸다는 것이다.
세부 하나도 지적된다. 동일 훈련 컴퓨트가 반드시 동일 훈련 토큰 수를 뜻하지 않으며 어떤 계산을 건너뛰어 같은 예산 안에서 더 많은 토큰을 처리할 수 있다는 것이다.
그래서 요약이 제시된다. 모델이 충분히 크면 루프 트랜스포머 사용이 고정 컴퓨트 예산에서 모델 품질을 개선할 수 있다는 것이다. 그리고 방법론적 교훈이 붙는다. 규모에서 실험을 돌리는 것의 중요성도 보여주는데, 더 작은 135M 파라미터 모델만 봤다면 반대 결론을 냈을 것이라는 것이다.
RNN과의 차이
익숙한 개념과 연결된다. 딥러닝 배경이 있거나 1990년대 인공신경망을 안다면 루프 또는 재귀 깊이 발상이 어느 정도 익숙할 것이라는 것이다. 그리고 순환신경망이 지목된다. 순환신경망의 발상 전체가 이전 반복의 레이어와 가중치를 재사용하는 것이라는 것이다.
주된 구분도 제시된다. 순환신경망은 시간 단계에 걸쳐 가중치를 재사용하며 은닉 상태가 한 토큰에서 다음으로 전달된다는 것이다. 반면 루프 트랜스포머에서 토큰의 루프는 아키텍처 깊이에 걸쳐 일어난다는 것이다.
부연도 제시된다. 관행적 순환신경망에서 각 단계는 입력 시퀀스의 다음 요소와 이전 단계의 은닉 상태를 받으므로, 텍스트 덩어리를 처리할 때 한 번에 한 단어나 토큰을 읽고 앞선 단어의 정보를 은닉 상태로 전달한다는 것이다. 반면 루프 트랜스포머에서는 주어진 토큰의 중간 표현이 트랜스포머 스택을 여러 번 통과하며 모델은 여전히 어텐션으로 토큰 사이에 정보를 전달한다는 것이다.
더 단순한 이해법도 제시된다. 이 비유가 좀 혼란스럽다면 루프 트랜스포머를 트랜스포머 블록을 재사용하는 것으로 생각하는 것이 아마 더 단순하며 모델을 크게 만드는 것과 비슷하지만 가중치 공유가 있는 것이라는 것이다.
Astra가 실제로 쓰는가
질문이 제기된다. 루프 트랜스포머 기제가 추론 흔적을 가렸는지 논의하기 전에, Astra가 애초에 루프 트랜스포머 개념을 쓰는지 묻는다는 것이다.
전제가 먼저 명시된다. 이것이 여전히 소문이거나 단독 보도일 뿐이고 공식 확인이 없다는 것을 기억해야 한다는 것이다. 그리고 조건이 제시된다. 모델이 오픈웨이트라면 물론 직접 확인할 수 있겠지만 이 경우에는 검증되지 않은 보도에 의존해야 한다는 것이다.
그럼에도 판단은 긍정이다. Astra가 루프 트랜스포머 측면을 쓸 가능성이 아주 높다고 생각한다는 것이다. 근거도 세 가지로 열거된다. 첫째로 위에 언급한 보도가 있다는 것이다. 둘째로 과거 연구에서 유망함을 보인 기법이므로 안 쓸 이유가 없다는 것이다. 셋째로 OpenAI 수석과학자가 말한 것이 있다는 것이다.
그 발언도 인용된다. Astra를 포함한 현재 프론티어 모델의 계산 그래프 깊이가 GPT-4의 2배 이내라는 것이다. 다만 해석이 열려 있다고 한다. 그러나 이것이 루프 트랜스포머 아키텍처를 명시적으로 확인하는 것은 아니며 관행 트랜스포머 블록을 두 배 쓴다는 뜻일 수도 있다는 것이다.
그리고 저자의 의견이 명확히 제시된다. Astra의 성공, 즉 좋은 모델링 성능은 아마 주로 다른 이유이며 개선된 훈련 레시피와 훈련 데이터라는 것이다. 판정도 붙는다. 루프 트랜스포머 조정이 조금 도울 수 있지만 보도가 그 기여를 과대평가한다고 생각한다는 것이다.
사고연쇄를 숨긴다는 주장
핵심 질문이 제기된다. 루프 트랜스포머가 추론 흔적을 가리는지라는 것이다.
첫 반박이 제시된다. OpenAI는 아주 처음부터 첫 추론 모델 이래로 추론 흔적의 대부분을 사용자에게 숨겨 왔다는 것이다. 그래서 결론이 나온다. 최종 사용자에게는 큰 차이가 없어야 한다는 것이다. 그리고 우려의 위치가 재규정된다. 해석 우려는 대체로 모델 개발자에 관한 것이라는 것이다.
추론 모델의 작동도 설명된다. 추론 모델은 보통 최종 답을 내기 전에 중간 단계를 생성하며 이 단계는 일반 텍스트 토큰을 쓰고 어떤 인터페이스에서는 사용자에게 선택적으로 숨겨지며 추론 흔적 또는 사고연쇄라 불린다는 것이다. 예시도 제시된다. 합이 10이고 곱이 21인 두 수를 물으면 모델이 처음에 5와 5를 시도하고 합은 맞지만 곱이 25이므로 다음에 3과 7을 시도해 두 조건을 다시 확인한다는 것이다. 그리고 되돌아가기가 지목된다. 모델이 실수를 알아채고 앞선 선택을 다시 살펴본 뒤 다른 접근으로 계속한다는 것이다.
성격도 규정된다. 모델은 여전히 한 번에 한 토큰을 생성하며 프롬프트와 이전 토큰을 문맥으로 쓴다는 것이다. 그래서 중간 단계의 역할이 제시된다. 스크래치 패드로 작동하며 최종 답 전에 계산을 추가한다는 것이다.
그리고 토큰 사용이 검증된다. 추론 흔적의 추가 토큰이 계산을 더하고 루프 트랜스포머도 토큰이 더 많은 블록을 통과하므로 계산을 더한다는 것이다. 그래서 주장이 정리된다. 루프가 있는 모델이 내부적으로 더 많은 계산을 쓰므로 외부 사고 토큰이 그만큼 필요하지 않다고 주장할 수 있다는 것이다.
실측도 제시된다. Astra가 노력 수준 전반에서 전작보다 반드시 더 적은 토큰을 쓰지는 않는다는 것이다. 다만 조건부로는 사실이라고 한다. 고정 정확도에서는 Astra가 전작보다 더 적은 토큰을 쓴다는 것이 사실이라는 것이다.
그런데 해석이 제시된다. 이것이 해석 가능성에 대한 우려인지 묻고 반드시 그렇지 않다고 답한다는 것이다. 이유도 제시된다. 더 적은 토큰을 쓰는 것은 그저 모델이 더 유능해서 실수를 덜 하고 되돌아가기를 덜 쓴다는 뜻일 수 있으며 첫 시도에 더 많이 맞힐 뿐일 수 있다는 것이다. 그래서 판정이 나온다. 자기에게 그것은 해석 가능성에 대한 즉각적 우려를 낳지 않는다는 것이다.
같은 계열 비교로 논거가 강화되는데 이 대목이 이 글의 핵심 반박이다. 이전 모델에도 같은 것이 참이라는 것이다. 그리고 질문이 제기된다. 같은 과업 성능에서 훨씬 많은 토큰을 쓰는 더 작은 계열 모델보다 큰 모델이 그렇게 훨씬 덜 해석 가능하다고 강하게 우려하는 사람이 있다고 생각하지 않는다는 것이다. 수치도 제시된다. 작은 모델이 비슷한 모델링 성능에서 80퍼센트 더 많은 토큰을 쓴다는 것이다. 그리고 반문이 붙는다. 그것이 큰 모델을 그만큼 덜 해석 가능하게 만드느냐는 것이다. 더 그럴듯한 답도 제시된다. 오히려 더 유능하고 더 많은 컴퓨트를 쓰는 잘 훈련된 큰 모델이 문제를 더 효율적으로 풀 수 있으며 여기서 효율적이란 더 적은 토큰을 뜻한다는 것이다.
유보도 하나 명시된다. 추론 흔적이 모델 안에서 일어나는 모든 것을 충실히 서술한다고 보장되지 않는다는 것도 기억할 값어치가 있다는 것이다. 그래서 유효한 우려가 특정된다. 자기 견해로 유일하게 유효한 우려는 루프 트랜스포머가 관행 트랜스포머보다 더 자주 가짜 추론 흔적을 제시해 의도적으로 사용자를 오도한다는 것이라는 것이다. 다만 증거가 없다고 한다. 그것이 일어난다는 강한 증거가 있다고 생각하지 않는다는 것이다.
시스템 카드도 인용된다. Astra의 시스템 카드가 추론 흔적의 모니터 가능성이 감소했다는 증거가 있고 전작에 비해 약간의 후퇴가 있다고 진술한다는 것이다. 그리고 원인도 제시된다. 대체로 더 짧고 정보가 덜한 흔적과 연관된다는 것이다. 다만 판정은 유지된다. 이것도 루프를 근본 원인으로 확립하지 않으며 앞의 계열 비교와 비슷하게 그저 전반적으로 짧은 길이 때문일 수 있다는 것이다.
수석과학자의 해명도 인용된다. 혼란스러운 보도가 촉발한 모니터 불가능성으로의 경쟁을 막고 싶다는 것이다. 그리고 수치가 반복된다. Astra를 포함한 현재 프론티어 모델의 계산 그래프 깊이가 GPT-4의 2배 이내라는 것이다. 태도도 제시된다. OpenAI는 첫 추론 모델부터 사고연쇄 모니터링을 보존하고 활용하려 노력해 왔으며 이 기법을 깊이 아낀다는 것이다. 이유도 제시된다. 모델 정렬이 훈련 분포에서 어떻게 일반화되는지 볼 수 있게 해 준다는 것이다. 그런데 인정도 있다. 그것이 깨지기 쉽고 불행히도 부정적 방향으로 향하고 있다고 생각하지만 아키텍처 변경에 달린 이유가 아니며 곧 그것에 대해 쓸 것이라는 것이다. 그럼에도 의지가 제시된다. 그것을 강화할 수 있는 일이 있고 현재 연구 프로그램의 핵심 목표라는 것이다.
그리고 해석이 붙는다. 혼란스러운 보도는 아마 앞서 언급한 그 단락을 가리키며 루프 측면이 사고연쇄 변화와 아무 관계가 없다는 뜻이라는 것이다.
관련 연구 네 편
첫 편은 잠재 추론이다. 2025년 논문이며 모델이 추론 시점에 추가 루프를 어떻게 쓸 수 있는지 연구하고 이를 위해 800B 토큰으로 3.5B 파라미터 모델을 훈련했다는 것이다. 구조 차이도 제시된다. 유니버설 트랜스포머처럼 같은 블록을 계속 재사용하는 대신 스택을 반복하지만 공유된 네 블록 스택을 초기 2블록과 최종 2블록 사이에 끼운다는 것이다. 또 다른 차이도 제시된다. 공유 스택이 매 루프 시작마다 이전 루프의 은닉 상태 외에 초기 블록의 출력도 받으며 이것들이 이어져 학습된 선형 투영을 통과한 뒤 네 공유 블록에 들어간다는 것이다. 의미도 제시된다. 스택이 매 통과마다 같은 초기 입력 표현에 접근하게 하는 것으로 생각할 수 있다는 것이다.
훈련 세부도 흥미롭다. 연구자들이 훈련 중 루프 수를 변화시키며 이것이 추론 시점에 다른 양의 계산과 작동하도록 모델을 준비시킨다는 것이다. 방식도 제시된다. 훈련 중 루프 수가 무작위로 표집되고 추론 시에는 8이나 32나 64처럼 고정 예산이 모델을 돌리는 사람에 의해 선택된다는 것이다. 추가 기제도 제시된다. 다음 토큰 확률 분포에 기반한 토큰별 적응적 중단 기제가 있으며 연속된 두 라운드 사이 KL 발산이 임계값 아래이면 즉 분포가 너무 비슷하면 루프가 멈춘다는 것이다. 성과도 과업별로 갈린다. 어떤 벤치마크는 약 여덟 루프 뒤 성능이 대체로 평평해지고 다른 것들은 더 많은 루프에서 이익을 얻는다는 것이다. 그리고 제목의 한계도 지적된다. 제목이 잠재 추론을 언급하지만 모델은 여전히 텍스트 사고연쇄를 생성할 수 있으며 루프는 각 출력 토큰 전에 추가 계산을 줄 뿐이라는 것이다.
두 번째는 지식 검색과 추론의 구분이다. 2025년 6월 논문이 LLM의 암기와 추론을 따로 측정해 이것을 조사한다는 것이다. 첫 결과가 제시된다. 암기 실험에서 파라미터 수가 고정되면 루프가 저장된 정보량을 거의 바꾸지 않으며 별개 파라미터 수를 늘리면 그 용량이 늘어난다는 것이다. 그래서 결론이 나온다. 루프가 모델이 더 많은 지식을 추가하거나 검색하게 하지 않으며 정보 검색은 정보가 저장되면 상대적으로 단순한 과업이고 루프 자체가 저장이 아니라 계산 기제이므로 이해가 된다는 것이다. 두 번째 결과도 제시된다. 별개 추론 실험에서 블록 재사용이 파라미터를 추가하지 않고 다단계 수학 문제 성능을 개선한다는 것이다. 그래서 결론이 나온다. 추가 계산이 정보 저장 공간이 더 없어도 모델이 문제를 풀도록 도울 수 있다는 것이다. 다만 유보가 붙는다. 더 큰 모델도 추론을 개선할 수 있으며 다만 파라미터도 추가한다는 것이다.
세 번째는 컴퓨트를 맞춘 비교다. 2026년 9월에 막 나온 논문이 비용 비교로 돌아온다는 것이다. 질문도 제시된다. 토큰당 컴퓨트와 총 비임베딩 파라미터, KV 캐시 요구량을 대략 같게 맞춰 루프와 관행 트랜스포머를 비교하면 무엇이 일어나는지라는 것이다. 설계도 제시된다. 전문가 혼합 아키텍처를 쓰고 트랜스포머 블록의 중간 절반을 두 번 적용하며 앞 사례와 비슷하지만 잠재 추론의 끼워 넣기가 있다는 것이다. 보정도 열거된다. 추가 블록 적용에 필요한 컴퓨트를 보상하려 은닉 차원을 좁히고 그러면 파라미터 수가 작아지므로 전문가를 추가해 총 파라미터 수를 회복하며 KV 캐시를 비슷하게 유지하려 어텐션 헤드 구성도 조정한다는 것이다. 규모와 결과도 제시된다. 실험이 54B 비임베딩 파라미터까지 확장되며 맞춘 스케일링 곡선에서 연구된 컴퓨트 범위 안에서 같은 검증 손실에 도달하는 데 훈련 컴퓨트가 약 6.8~18퍼센트 덜 든다고 추정한다는 것이다. 그래서 답이 나온다. 루프 트랜스포머가 계산적으로 값어치가 있느냐에 대해 그렇다는 것이며 같은 컴퓨트 예산에서 약간 더 나은 모델을 준다는 것이다.
네 번째는 토큰 위치에 걸친 재귀다. 2026년 8월 논문이며 각 디코딩 단계에서 이전 토큰의 최종 은닉 상태를 새로 표집된 토큰의 임베딩과 학습된 게이트로 결합해 다음 순전파의 입력으로 삼는다는 것이다. 그래서 성격이 제시된다. 다음 토큰의 계산이 스택 밑바닥에서 이전 토큰의 최종 표현에 접근하며 잠재 추론과 어느 정도 비슷하다는 것이다. 결과도 제시된다. 1B 기본 모델을 쓸 때 잠재 피드백 접근이 정확도를 유지하거나 개선하면서 더 짧은 추론 흔적을 출력한다는 것을 발견했다는 것이다. 그런데 조건이 있다. 그 단축 효과가 지시 조정 후에는 사라진다는 것이다.
연결도 제시된다. 이것이 루프가 더 짧은 추론 흔적을 낳는지에 대한 앞선 논의와 직접 연결되므로 흥미롭다는 것이다. 다만 결과가 피드백 기제와 모델 훈련 방식 양쪽에 달렸다고 한다. 그리고 미검증 부분이 지적된다. 그 실험이 더 짧은 흔적이 덜 충실한지는 확립하지 않는다는 것이다. 큰 단서도 제시된다. 연구의 큰 단서는 루프 대신 블록을 더 추가하는 관행적 방식으로 모델 크기를 늘리는 것이 추론 흔적 길이에 비슷한 효과가 있는지 시험하지 않았다는 것이다.
결론
세 가지가 정리된다. Astra가 아주 강한 모델이며 특히 컴퓨터 사용에서 큰 도약을 하고 있다는 것이다. 그리고 전망이 제시된다. 컴퓨터 사용이 앞으로 몇 달간 오픈소스와 상용 하네스의 다음 큰 초점 영역이 될 것이라 믿는다는 것이다. 오픈소스의 중요성도 강조된다. 컴퓨터 사용에서 특히 중요하다고 보는데, 큰 힘에는 큰 책임이 따르며 주 컴퓨터에 접근을 주기 전에 하네스를 감사할 수 있는 것이 좋기 때문이라는 것이다.
두 번째가 제시된다. Astra가 루프 트랜스포머의 변형을 쓸 가능성이 높으며 루프 트랜스포머는 단순히 고정 컴퓨트 예산에서 더 나은 모델링 성능을 준다는 것이다.
세 번째가 제시된다. 더 나은 모델링 성능이 더 짧은 추론 사슬로 이어질 수 있지만 이것은 새 추세가 아니라는 것이다. 근거도 반복된다. 크기가 다른 모델들의 같은 계열 안에서 항상 봐 왔다는 것이다.
그리고 저자의 견해가 정리된다. 더 짧은 추론 흔적은 실수를 덜 하고 추론 흔적을 스크래치패드로 쓰는 대신 아키텍처 안에서 더 많은 계산에 접근할 수 있는 더 지능적이고 유능한 모델의 부수 효과라는 것이다.
마지막으로 인간 비유가 붙는다. 어떤 의미에서 인간에게도 같은 것이 참이라는 것이다. 그리고 장면이 제시된다. 대면 대학 수학 시험에서 똑똑하고 잘 준비된 학생은 아마 연습지를 덜 쓰고 되돌아갈 필요도 덜하다는 것이다.
더 생각해보기
- 파라미터는 절반인데 계산과 KV 캐시가 그대로라면 루프의 실질 이득은 어디에 남는가.
- KV 캐시를 공유했을 때 성능이 나빠진 결과는 무엇을 시사하는가.
- 통과 횟수를 토큰별로 라우팅하는 방식은 추론 비용 예측을 어떻게 어렵게 만드는가.
- 135M 모델만 봤다면 반대 결론이었다는 사실은 소규모 실험의 신뢰도를 어떻게 조정하게 하는가.
- 루프가 지식 저장을 늘리지 않고 계산만 늘린다는 구분은 모델 설계에 어떤 선택을 강요하는가.
- 짧아진 추론 흔적이 능력 향상의 부수 효과라는 설명은 어떤 관찰로 반증될 수 있는가.
- 추론 흔적이 내부를 충실히 서술한다고 보장되지 않는다면 모니터링은 무엇을 감시하는 것인가.
- 계산 그래프 깊이가 GPT-4의 2배 이내라는 해명은 무엇을 확인하고 무엇을 확인하지 않는가.
- 주 하네스가 모델 강점을 증폭하도록 개발된다면 하네스를 통일한 비교는 공정한가.
- 오래된 스킬 파일을 지우라는 권고와 스킬로 효율을 얻는다는 이점은 어떻게 양립하는가.
