Jungseob's Note
포스트
원문 대표 이미지 · Inside xAI: Building Grok Imagine in 3 Months, Videogen vs World Models, and Video Agents— Ethan He

시각 지능은 대부분 언어에서 온다 - xAI 월드모델 리드가 3개월 만든 Grok Imagine의 내부

Nvidia Cosmos를 만들고 xAI로 옮겨 3개월에 Grok Imagine을 낸 Ethan He와의 104분 대담. 비디오 모델 훈련의 전체 계보와 저장 비용 실측, 월드모델을 실시간·상호작용·장기지평 세 조건으로 정의하는 방식을 담고, 시각 지능의 개선이 대부분 확산 모델이 아니라 언어 모델에서 온다는 주장과 그가 xAI를 떠나 언어 모델로 향한 이유까지 이어진다.

시각 지능은 대부분 언어에서 온다 - xAI 월드모델 리드가 3개월 만든 Grok Imagine의 내부

시각 지능은 대부분 언어에서 온다

TL;DR

  • 이 대담의 가장 큰 주장이 첫 문장에 놓이는데 시각 지능이 실제로 대부분 언어에서 오고 있으며 확산 모델 기술이 더 성숙해진 지금부터는 이 비디오 모델들에서 개선을 볼 때마다 그것이 대부분 비디오 확산 모델 자체가 아니라 언어 모델에서 온다는 것이다. 그리고 근거가 규모로 제시된다. Cosmos에서 비디오 모델 자체는 7B였고 프롬프트 재작성기 역할을 한 언어 모델이 그보다 더 컸다.
  • 3개월의 조건이 밝혀지는데 2025년 5월 xAI에 합류했을 때 인프라도 데이터도 모델도 없었고 엔지니어 몇 명뿐이었는데 3개월에 만들어 첫 모델 Grok Imagine 0.9를 냈다는 것이다. 그런데 속도의 원인이 인력으로 지목된다. 가장 중요한 것은 인재이며 모두가 매우 강하고 영리하고 공동 목표를 향해 서로 아주 가까웠고, 캘린더에 회의가 그리 많지 않아 하루 싱크 한 번 정도면 그다음은 전부 만드는 것이었다.
  • 개선의 출처가 반직관적으로 제시되는데 다소 지루하지만 많은 개선이 새 알고리즘에서 오지 않고 데이터 파이프라인과 훈련 파이프라인 여기저기서 작은 버그를 찾는 데서 오며 그것들이 모델 품질에 가장 큰 상승을 준다는 것이다. 그리고 병목의 이동이 예고된다. 코딩 모델이 훨씬 효율적이어서 몇 시간 안에 만들 수 있게 되었으니 모든 아이디어를 시도할 컴퓨트가 충분해야 하며 컴퓨트가 다시 반복 속도의 병목이 될 수 있다.
  • 월드모델 정의가 세 조건으로 제시되는데 실시간이고 상호작용하며 장기지평인 비디오이고, 300FPS는 3밀리초 안에 응답해야 하는데 대부분의 비디오 모델이 그것을 못 하며 디지털 휴먼이라면 200밀리초가 훨씬 관대한 기준이라는 것이다. 그리고 대가가 지목된다. 시간 차원을 압축하지 않으면 시퀀스 길이가 폭발하므로 실시간성을 원하면 장문맥 문제를 풀어야 한다.
  • 떠난 이유가 같은 주장으로 귀결되는데 회사에서는 할 수 없는 연구가 많고 우선순위와 목표가 아주 빠르게 바뀔 수 있으며 그것은 xAI도 마찬가지여서 언어 모델 쪽에서 하고 싶은 연구를 할 수 없었다는 것이다. 그리고 판단이 밝혀진다. 자기가 온 곳인 확산 기술의 개선이 이득의 원천이었지만 이제는 대부분의 이득이 언어 모델 자체에서 오는 지점이며 비디오 모델의 병목은 실제로 언어 부분이라는 것이다.

Source

Inside xAI: Building Grok Imagine in 3 Months, Videogen vs World Models, and Video Agents — Latent Space × Ethan He, 1시간 44분 42초

Ethan He 인터뷰

Source: Inside xAI — Building Grok Imagine in 3 Months — Latent Space × Ethan He (ex-xAI 월드모델 리드), 1시간 44분 42초

Knowledge

인프라도 데이터도 모델도 없이 3개월

이력이 먼저 서술된다. xAI 이전에는 Nvidia에서 Cosmos 월드모델을 작업했다는 것이다. Cosmos의 성격이 규정된다. 세계를 요약하려는 거대 비디오 파운데이션 모델이며 모든 로봇 연구자가 그 위에 만들 기반으로 쓰인다는 것이다. 시점도 제시된다. 2024년 말이었다는 것이다.

이동의 이유가 밝혀진다. Cosmos를 만들고 나서 비디오 모델도 언어 모델과 비슷한 스케일링 법칙을 갖는다는 것을 깨달았다는 것이다. 그래서 결론이 나온다. 비디오 모델을 더 확장해야 하며 그래서 훨씬 많은 컴퓨트 자원이 있는 곳으로 옮겨야 한다고 깨달았다는 것이다. 진행자의 반응도 붙는다. Nvidia보다 더 많은 곳이라니, GPU 부자 왕국 그 자체인데 하는 것이다.

합류 시점과 조건이 서술된다. 2025년 5월에 xAI로 옮겼으며 그때는 xAI가 비디오 모델과 멀티모달 모델을 막 만들려던 시점이었다는 것이다. 그리고 상태가 명시된다. 인프라도 없고 데이터도 없고 모델도 없었으며 엔지니어 몇 명뿐이었다는 것이다. 결과가 제시된다. 3개월에 만들어 첫 모델 Grok Imagine 0.9를 냈다는 것이다. 이후 경로도 서술된다. 그때부터 비디오 모델을 계속 작업하며 사전훈련에서 사후훈련으로 더 옮겼고 예로 참조 투 비디오 같은 카메오 기능과 비디오 확장이 있다는 것이다. 떠나기 전 마지막 역할도 밝혀진다. 월드모델을 작업했으며 실시간 장기지평 비디오 생성에 집중하는 소규모 팀을 이끌었다는 것이다.

속도의 원인이 인력으로 지목된다. 가장 중요한 것은 인재라고 본다는 것이다. 조건이 열거된다. 모두가 매우 강하고 영리했으며 공동 목표를 향해 서로 아주 가까웠다는 것이다. 그래서 효과가 제시된다. 그것이 속도를 많이 올렸고 사람들 사이의 소통 대역폭을 줄여 모두가 같은 목표를 향해 일할 수 있었다는 것이다. 구체적 모습도 서술된다. 캘린더에 회의가 그리 많지 않아 하루에 싱크 한 번 정도이고 그다음은 전부 만드는 것이었으며 그때는 꽤 재미있었다는 것이다.

두 번째 요인은 기반이다. xAI가 데이터 인프라와 모델 인프라, 그리고 지원 체계의 아주 강한 기반을 갖고 있어 모델 개발에 큰 도움이 된다는 것이다. 그리고 핵심 지표가 제시된다. 가장 중요한 것은 하루에 몇 번의 반복을 할 수 있는지이며 반복을 더 많이 할 수 있으면 모델을 훨씬 빨리 훈련할 수 있다는 것이다. 효과가 두 가지로 열거된다. 강한 인프라와 많은 컴퓨트가 있으면 아주 짧은 기간에 모델을 훈련할 수 있어 오류를 위한 훨씬 큰 완충을 얻고 버그를 더 많이 발견할 기회도 준다는 것이다.

반복의 정의도 제시된다. 새 데이터를 획득하고 새 알고리즘을 설계해 더 작은 규모로 새 모델을 훈련하는 것이며 사이클 타임은 이 모델이 이전 반복보다 나은지 평가하기까지라는 것이다.

큰 개선은 알고리즘이 아니라 작은 버그에서

반직관적인 관찰이 제시된다. 다소 지루하지만 많은 개선이 새 알고리즘에서 오지 않는다는 것이다. 어디서 오는지가 밝혀진다. 데이터 파이프라인과 모델 훈련 파이프라인 여기저기서 작은 버그를 찾는 데서 오며 그것들이 모델 품질에 가장 큰 상승을 준다는 것이다.

LLM으로 버그를 찾는지에 대한 답도 나온다. 2025년 5월에는 코딩 모델이 아직 그만큼은 아니었다는 것이다. 그리고 시점이 특정된다. 2025년 12월에는 극도로 좋았던 것을 기억한다는 것이다. 초기의 문제도 구체적으로 서술된다. 때로는 유지하기 어려운 코드를 만들어냈고 처음에는 극도로 빠르게 뭔가를 만들었지만 수천 줄의 스파게티 코드를 줘서 유지할 수 없었으며 LLM 자체도 무엇이 잘못되었고 그 위에서 어떻게 개선할지 알아내지 못했다는 것이다. 그런데 현재는 다르다고 한다. 지금은 훨씬 훨씬 훨씬 낫다는 것이다.

그리고 병목의 이동이 예고된다. 이제 코딩 모델이 훨씬 효율적이어서 구현을 훨씬 빠르게 도울 수 있으니 컴퓨트가 다시 병목이 될 수 있다는 것이다. 논리가 제시된다. 이전에는 새 합성 데이터를 만들거나 새 알고리즘을 쓰려면 몇 주가 걸렸고 그 기간에는 돌릴 실험이 없었을 수 있다는 것이다. 그런데 지금은 몇 시간 안에 그것을 만들 수 있어 즉시 모델을 훈련할 수 있으며 이제 모든 아이디어를 시도할 컴퓨트가 충분해야 한다는 것이다. 그래서 결론이 나온다. 컴퓨트가 다시 반복 속도의 병목이 될 수 있다는 것이다.

스트레스도 언급된다. 시간당 GPU 수천 개를 먹어치우는 것이라 아주 비싸고 그 컴퓨트가 다른 연구자에게 갈 수 있다는 것이다. 대응 두 가지가 제시된다. 코딩 모델로 많은 작업이 자동화될 수 있어 훨씬 낫다는 것이다. 그리고 마라톤이므로 좋은 건강과 규칙적인 일정을 유지해야 한다는 것이다.

캡션은 눈이 보이지 않는 사람이 재구성할 수 있을 정도로

훈련 계보가 순서대로 제시된다. 비디오 모델을 만들려면 실제로 먼저 이미지 모델을 만들어야 한다는 것이다. 그리고 데이터의 성격이 규정된다. 이 두 모델을 만들 때 필요한 데이터는 언어와 이미지 또는 언어와 비디오의 100퍼센트 합성 쌍이라는 것이다.

이유가 제시된다. 인터넷에서 비디오는 텍스트와 자연스럽게 연결되어 있지 않다는 것이다. 반론도 미리 처리된다. 유튜브에 제목과 설명, 댓글이 있다고 할 수 있지만 그것들은 비디오 자체와 관련이 없다는 것이다. 예시가 붙는다. 비디오가 산의 자연 풍경인데 제목이 오늘 너무 행복해 같은 것이라면 상관관계가 전혀 없다는 것이다.

부트스트랩 문제도 다뤄진다. VLM이 없으면 애초에 텍스트를 어떻게 생성하느냐는 질문에 불가능하다고 답한다는 것이다. 그래서 시작점이 제시된다. 처음에는 사람에게 비디오를 가능한 한 상세하게 서술하게 한다는 것이다. 요구 범위도 열거된다. 모든 객체와 모든 캐릭터, 그리고 비디오 안의 모든 상호작용과 대화를 서술하게 한다는 것이다.

Cosmos 라벨링 프로토콜의 기준이 인상적으로 제시된다. 라벨러에게 준 목표는 비디오를 아주 상세하게 서술해서 눈이 보이지 않는 사람이 그 텍스트를 듣고 머릿속에서 비디오가 어떤 것인지 재구성할 수 있어야 한다는 것이었다는 것이다.

라벨 없는 데이터도 섞인다고 한다. 생성 모델 훈련에는 보통 라벨 없는 데이터의 작은 비율도 있으며 그래서 모델은 어떤 텍스트 지시 없이 비디오를 생성하도록 지시받고 그것도 모델의 일반화를 돕는다는 것이다.

토크나이저와 확산 트랜스포머

다음 단계가 제시된다. 중요한 공통 단계 하나가 이미지나 비디오의 압축기 또는 토크나이저를 훈련하는 것이라는 것이다. 이유가 수치로 제시된다. 기술적으로 이론적으로는 순수 픽셀로 훈련할 수 있지만 토큰이 너무 많다는 것이다. 예시가 붙는다. 1,000 곱하기 1,000 이미지는 100만 토큰이고 100만 픽셀이므로 그것으로 트랜스포머를 훈련하는 것은 불가능하다는 것이다. 그래서 필요한 것이 제시된다. 이미지에서 잠재 공간으로, 잠재 공간에서 다시 이미지로 갈 수 있는 토크나이저를 훈련해야 한다는 것이다.

생성 모델의 어휘 성격도 밝혀진다. 생성 모델에서 어휘는 연속적이며 연속 공간이라는 것이다. 구조가 제시된다. 이미지를 16이나 48 같은 고정 길이 벡터로 매핑하고 그 벡터를 다시 이미지 공간으로 매핑한다는 것이다. 그리고 매핑이 패치 기반이라고 한다. 16 곱하기 16 패치가 있고 그 픽셀 패치를 잠재 공간으로 매핑한다는 것이다. VAE에는 합성곱 네트워크와 트랜스포머가 둘 다 있고 둘 다 할 수 있다는 것도 명시된다.

확산 트랜스포머 훈련이 서술된다. VAE 이후 얻은 것은 잠재 공간 토큰과 언어 토큰이며 확산 트랜스포머 훈련은 실제로 꽤 표준적이고 언어 트랜스포머 모델을 훈련하는 방식과 매우 비슷하다는 것이다. 차이가 하나로 특정된다. 시각 토큰이 들어가고 시각 토큰이 나오는데, 유일한 차이는 노이즈 제거 과정이 있다는 것이다. 방식도 서술된다. 시각 토큰에 무작위 노이즈를 더하고 모델이 그 노이즈를 제거해 깨긋한 토큰을 생성하도록 훈련하며 추론 때 모델은 100퍼센트 노이즈에서 반복적으로 노이즈를 제거할 수 있다는 것이다.

이미지 모델이 왜 기반인지도 논증된다. 이미지 모델이 훈련하기 더 싸고 언어와 이미지 사이의 연결이 훨씬 밀집해 있다는 것이다. 비교가 제시된다. 10억 이미지로 훈련하면 텍스트에서 이미지로의 매핑이 있는데, 같은 규모로 10억 비디오를 훈련하는 것은 훨씬 비싸며 비디오가 자연히 이미지보다 토큰이 많기 때문이라는 것이다. 그리고 원리가 밝혀진다. 확산 모델의 언어 이해는 순수하게 이 매핑에서 오므로, 매핑이 충분하지 않으면 예컨대 1,000만 비디오로만 훈련하면 훈련에서 충분한 언어 토큰을 보지 못해 모델이 인간의 의도를 충분히 이해하지 못한다는 것이다. 그래서 순서가 정해진다. 먼저 이미지 확산 모델을 훈련하고 거기서 비디오 모델을 부트스트랩한다는 것이다.

MP4를 쓰지 않는 이유와 압축의 절충

MP4 압축을 토큰으로 쓰는 접근이 검토되고 기각된다. 사람들이 실제로 시도했지만 주된 난점은 MP4 토큰의 잠재 공간이 모델에게 이해 가능하지 않았다는 것이다. 결과가 제시된다. 그것으로 훈련하기가 극도로 어려웠으며 그래서 더 연속적인 잠재 공간을 만드는 VAE를 만들었다는 것이다. 원리가 제시된다. 그래야 모델이 그 잠재 공간을 이해하고 훨씬 쉽게 학습할 수 있다는 것이다.

VAE 안에서도 난이도 차이가 있다고 한다. 가장 순진한 VAE는 이미지를 벡터로 그냥 섞는 것이어서 VAE를 훈련할 필요가 없지만 그 잠재 공간은 모델이 훈련하기에 극도로 어렵다는 것이다.

시간 압축의 절충이 수치로 제시된다. 시간 차원을 압축하면 훨씬 높은 압축률을 얻는데 프레임 사이에 시간적 중복이 존재하기 때문이며 이 프레임과 지난 프레임은 대체로 비슷해서 작은 차이만 있다는 것이다. 예시가 제시된다. 어떤 VAE는 8 곱하기 8 곱하기 4 압축률을 가져 네 개의 시간 토큰을 하나로 압축하며 그것이 문맥 길이를 많이 절약한다는 것이다. 반대 경우도 제시된다. 프레임별로 하면 8 곱하기 8 곱하기 1을 해야 하고 문맥 길이가 네 배 커진다는 것이다.

그런데 프레임별 압축의 이익이 실시간성이라고 한다. 모델 출력을 프레임별로 스트리밍하면 모델이 어떤 사용자 요청에도 즉시 응답할 수 있다는 것이다. 반대로 시간 4배 압축이 있으면 본질적으로 거기에 지연이 있다는 것이다.

저장 비용의 실측

비용이 실제 숫자로 계산된다. 놀랍게도 비디오 모델의 비용이 언어 모델과 비교할 만하다는 것이다. 위치도 제시된다. 가장 큰 규모는 언어 모델이고 비디오는 언어 모델의 중간 규모 정도라는 것이다.

저장 비용이 먼저 계산된다. 비디오를 저장하는 것만으로도 많이 든다는 것이다. 예시가 제시된다. 10억 개 비디오가 있고 각각 5MB라면 그것만 저장하는 데 5PB가 필요하다는 것이다. 그리고 추가분이 제시된다. VAE로 비디오를 압축하고 그 연속 특징도 저장해야 하는데 그것도 비디오 자체와 비교할 만한 크기라는 것이다. 합계가 제시된다. 이 비디오들과 특징을 저장하는 것만으로 수십 PB라는 것이다.

진행자들이 실시간으로 요금을 조회하는 대목도 있다. S3 표준으로 5PB는 월 10만 달러이고 수십 PB면 20만 달러라는 것이다. 그런데 더 비싼 것이 지목된다. 인그레스와 이그레스가 더 비싸며 인터넷을 통해 그 비디오들을 내려받는 것만으로 AWS에서 저장하는 것보다 더 비싸다고 믿는다는 것이다. 조건도 제시된다. 각 훈련 실행마다 아마 한 번은 당겨 와야 하고 여러 번 훈련하면 그보다 더 많다는 것이다. 총액 추정이 나온다. 저장과 네트워크 비용만으로 월 수백만 달러 정도가 될 것이라는 것이다.

모델 규모도 제시된다. 오픈소스 비디오 모델은 19B 파라미터 밀집 모델 같은 것이 있고 사람들이 MoE도 탐색해서 활성 20B에 총 100B 정도일 수 있으며 그것은 중간 규모 LLM과 비슷한 크기라는 것이다. 토큰 수도 제시된다. Cosmos에서 공개했듯 시각 토큰으로 수십조 토큰이라는 것이다. 그래서 결론이 제시된다. 이것들을 합치면 비디오 모델 훈련 비용이 실제로 LLM과 비교할 만하며 인프라가 LLM과 약간 달라 이 모델들을 훈련하는 것이 덜 효율적일 수 있다는 것이다.

단계 증류와 GAN의 귀환

추론 측 절감이 서술된다. 추론 측의 가장 큰 이득은 이 모델들의 증류에서 온다는 것이다. 이름이 특정된다. 단계 증류라고 부르며 LLM의 지식 증류와 약간 다르다는 것이다.

원리가 수치로 제시된다. 흐름 매칭 모델은 보통 100단계 정도가 필요하고 확산 모델은 좋은 이미지나 비디오를 생성하려면 1,000단계처럼 더 많이 필요하다는 것이다. 방식이 제시된다. 전체 모델로 100단계에 생성하게 하고 10단계만 생성하는 모델을 그 완벽한 것에서 배우게 한다는 것이다.

왜 작동하는지에 대한 직관도 제시된다. 강한 교사 모델은 인터넷 전체의 이미지와 비디오를 모델링하려 하고 그 분포는 극도로 복잡하다는 것이다. 반면 단계 증류 모델은 교사에서만 배우려 하고 교사는 모델이며 크기가 고정되어 있어 분포가 인터넷 전체보다 훨씬 단순하다는 것이다. 실제 수치도 제시된다. Cosmos에서는 4단계와 8단계가 있었고 이미지 투 이미지 변환 같은 더 단순한 작업이면 Cosmos 트랜스퍼에서 1단계로도 돌 수 있다는 것이다.

GAN도 재평가된다. GAN을 잊지 말아야 하며 그것이 원조 단계 증류였다는 것이다. 이유가 제시된다. 애초에 한 단계로 훈련했기 때문이라는 것이다. 그리고 현재 쓰임이 제시된다. 분포 매칭 증류가 GAN을 증류의 손실 중 하나로 쓴다는 것이다. 작동 방식의 대비도 제시된다. 훈련에서 모델은 인터넷의 실제 이미지를 재구성하도록 요구받는데 그것은 극도로 어렵고 GAN을 훈련할 때는 한 단계 과정이어서 이 이미지가 인터넷의 이미지만큼 실제처럼 보이느냐는 훨씬 단순한 작업이라는 것이다.

오디오와 비디오를 함께, 그리고 시간 정렬

Grok Imagine 0.9의 위치가 제시된다. 대규모로 배포된 첫 오디오 비디오 공동 모델이라고 믿는다는 것이다.

어려움이 특정된다. 어려운 부분은 모달리티 정렬이라는 것이다. 이유가 제시된다. 이 공동 모델 이전에는 텍스트 투 비디오 정렬이 있었고 대응하는 텍스트와 비디오가 있었지만 대부분의 VLM은 이미지와 비디오를 이해하고 비디오는 매우 드물며 대체로 오디오는 이해하지 못한다는 것이다. LLM 쪽 오디오 생성의 한계도 제시된다. 그들과 완벽히 대화할 수 있지만 노래를 부르라고 하면 보통 별로 좋지 않고 음악도 없다는 것이다.

오디오의 이중 구조가 지목된다. 오디오는 실제로 두 성분을 가지며 이산 성분과 연속 성분이 있다는 것이다. 이산 성분이 언어이고 우리가 말할 때는 어떤 특성을 가진 텍스트 토큰이라는 것이다. 그런데 음악은 완전히 다르다고 한다. 매우 연속적이어서 언어 모델처럼 이산 토큰으로 모델링할 수 없다는 것이다. 그리고 난제가 제시된다. 텍스트와 비디오, 오디오를 함께 정렬해야 한다는 것이다.

이미지 라벨링의 기준이 오디오로 확장된다. 이미지 생성에서 눈이 보이지 않는 사람이 재구성할 수 있도록 상세히 서술해야 했듯, 여기서는 귀가 들리지 않는 사람이 실제로 듣지 않고도 음악이 어떻게 들리는지 재구성할 수 있어야 한다는 것이다. 그리고 LLM의 약점도 지목된다. 놀랍지 않게도 대부분의 LLM이 음악의 비트와 톤, 세부를 인식하는 데 아주 나쁘며 이것이 어떤 노래인지 일반적 예측은 줄 수 있지만 음악의 세부를 서술하기는 아주 어렵다는 것이다.

가장 중요한 것이 시간 정렬로 특정된다. 모델은 비디오와 오디오가 어느 시간 단계에서 서로 대응하는지 시간 기반 정렬을 알아야 한다는 것이다. 대비도 제시된다. 다른 대부분의 모달리티에는 이런 정렬이 없으며 텍스트와 이미지, 텍스트와 비디오는 느슨하게 정렬되어 있고 보통 1초 시점에 무엇이 일어났는지 정확한 서술을 갖지 않는다는 것이다. 그래서 모델이 시간을 인식해야 한다고 한다. 그리고 LLM과의 대비가 붙는다. LLM에게 작업을 시키면 12시간 걸릴 것이라 말하고는 한 시간 만에 돌아와 이미 이틀을 썼고 모든 것을 소진했다고 말하며 그들 자신은 시간 감각이 없다는 것이다.

월드모델의 세 조건

정의가 세 부분으로 제시된다. 논쟁하지 않겠다는 전제를 달고 자기 정의로 월드모델은 실시간 상호작용 장기지평 비디오라는 것이다.

상호작용이 먼저 서술된다. 월드모델은 키보드와 마우스, 어쩌면 음성으로도 상호작용하게 하며 모든 모달리티로 모델과 상호작용할 수 있고 모델은 합리적으로 응답해야 한다는 것이다.

실시간이 수치로 규정된다. CS:GO 프로 선수라면 10밀리초 이하나 그보다 적게 응답해야 한다고 말할 수 있다는 것이다. 진행자들과의 계산도 이어진다. 300FPS는 3밀리초라는 것이며 대부분의 비디오 모델은 그것을 할 수 없다는 것이다. 완화된 기준도 제시된다. 디지털 휴먼 같은 비디오 모델이면 응답 시간이 더 관대할 수 있고 실시간 상호작용은 보통 200밀리초라는 것이다. 그런데 그조차 까다롭다고 한다. VAE에서 오는 시간 압축이 있으므로 시간 차원을 압축하지 않으면 시퀀스 길이가 폭발하며 실시간성을 원하면 이 장문맥 문제를 풀어야 한다는 것이다.

장기지평이 세 번째다. 비디오 게임을 몇 초만 하지 않을 것이고 대부분의 비디오 모델은 몇 초뿐인데 우리는 몇 분, 몇 시간을 할 것이므로 모델이 장편 콘텐츠를 생성할 수 있어야 한다는 것이다.

최종 상태도 그려진다. 플립북의 비디오 버전 같은 것이어서 뉴로 컴퓨터와 상호작용하고 마우스를 움직여 생성된 인터페이스를 클릭하면 실시간으로 픽셀을 통해 응답하는 것이라는 것이다. 다만 거기까지 가는 길은 아주 멀다고 한다.

첫 단계는 비디오 확장

중간 단계가 제시된다. Grok Imagine에서 소규모 월드모델 팀을 이끌며 한 첫 단계는 비디오 확장을 만드는 것이었다는 것이다. 이유가 제시된다. 이것이 장기지평 비디오를 해금한다는 것이다.

기존 방식의 한계가 서술된다. 대부분의 비디오 생성 모델은 프롬프트나 이미지를 첫 프레임으로 주고 비디오를 생성하면 그것으로 끝이며 한 번뿐이라는 것이다. 창작자들의 해법도 제시된다. 일부는 마지막 프레임을 두 번째 비디오의 첫 프레임으로 쓰려 하는데 때로는 작동하지만 몇 번 하면 품질이 떨어진다는 것이다. 예시도 제시된다. 어떤 모델은 지난 비디오의 1초 문맥을 갖는데 마지막 프레임을 쓰는 것보다 약간 낫지만 비슷한 문제가 있고 1분까지 몇 번 확장하면 비디오 품질이 첫 비디오보다 훨씬 나빠 보인다는 것이다. 두 번째 문제도 제시된다. 모델이 이전에 무엇이 일어났는지 장거리 지식을 갖지 않아서 두 사람이 말하는 대화를 생성하면 목소리가 시간에 걸쳐 바뀔 수 있으며 특히 1초 조건화는 이전 문맥을 덮지 못한다는 것이다.

Grok Imagine 비디오 확장의 해법이 제시된다. 이전 모든 비디오의 역사적 문맥을 갖는다는 것이다. 내용도 열거된다. 누가 말하고 있고 어떤 객체가 나타났는지 문맥을 갖고 다음 비디오를 생성한다는 것이다.

그런데 문맥 폭발이 지목된다. 순진하게 이전 역사 비디오 토큰을 모두 문맥에 넣으면 문맥 길이가 쉽게 폭발한다는 것이다. 수치가 제시된다. Cosmos에서 비디오 5초가 5만에서 6만 토큰 정도이므로 50초는 50만 토큰이고 그보다 길면 쉽게 폭발한다는 것이다. 그리고 반응이 제시된다. 사람들이 비디오 확장을 사랑하며 많은 창작자가 더 긴 형식의 비디오를 만들려고 그것을 쓴다는 것이다.

참조 비디오와 문맥 선택

두 번째 기능이 제시된다. 비디오에는 실제로 중복이 많고 VAE로 픽셀 중복은 많이 풀었지만 장거리 장기지평 비디오에는 더 많은 중복이 있다는 것이다. 예시가 제시된다. 캐릭터가 첫 클립에 나타났다가 사라지고 비디오 끝에 다시 나타나지 않으면 생성 중간에는 그 문맥이 필요 없으며 그 캐릭터가 필요한 곳에만 필요하다는 것이다.

그래서 만든 것이 참조 비디오라는 것이다. 최대 일곱 개 이미지를 조건으로 업로드해 비디오를 생성하게 하며 캐릭터나 객체, 심지어 장면일 수도 있다는 것이다. 성격도 규정된다. 그것이 거기의 많은 문제를 풀 수 있지만 중간 단계 해법으로 느껴진다는 것이다. 이상적 형태도 제시된다. 모델이 어디서 참조를 끌어와야 할지 선택적으로 알아야 하며 영화를 생성한다면 10초씩 자기회귀적으로 생성하면서 이 캐릭터가 나타나면 처음 나타난 곳으로 되돌아가 그것을 가져올 수 있어야 한다는 것이다.

기존 휴리스틱도 소개된다. 프레임 팩이라는 논문은 최근 역사인 마지막 1초는 전체를 넣고 그 이전 역사는 압축해 비디오를 작게 만드는 휴리스틱을 갖는다는 것이다. 패턴이 규정된다. 최대 시퀀스 길이가 고정되는 아름다운 패턴을 따르며 현재 프레임에서 멀수록 더 작은 이미지를 갖는다는 것이다. 그리고 방향이 제시된다. 이것은 휴리스틱일 뿐이고 더 자동적일 수 있으며 모델이 역사의 어느 부분을 선택할지 인식해야 한다는 것이다.

그리고 언어 모델과의 비교에서 흥미로운 판정이 나온다. 이 장문맥 부분은 실제로 LLM 쪽보다 약간 앞서 있다고 느낀다는 것이다. 근거가 제시된다. LLM에서는 문맥이 계속 자라고 도구 호출 이력이 극도로 길어도 여전히 문맥에 있으며 주제를 다른 것으로 바꾸어도 전체 문맥이 거기 있다는 것이다. 현재 대응도 제시된다. 도구 결과를 잘라내거나 파일을 조회할 때 상위 200줄만 보여주도록 돕는 에이전트 하네스가 있지만 그것들은 아주 휴리스틱 주도라는 것이다. 그래서 전망이 제시된다. 지속 학습의 돌파 하나가 자기 문맥을 자동으로 관리하는 방법일 수 있으며 같은 것이 LLM과 비디오 모델에서 동시에 연구되고 있다는 것이다.

인간과의 비교도 붙는다. 인간의 주의 지속 범위는 놀랍도록 작아서 11자리 전화번호밖에 기억하지 못한다는 것이다. 그런데 인간의 문맥이 작동하는 이유가 제시된다. 여러 곳에서 문맥을 동적으로 끌어올 수 있기 때문이며 같은 메커니즘이 LLM과 비디오 모델에서 일어날 것이라고 본다는 것이다.

생성 UI와 비용 계산

플립북이 소개된다. 웹 브라우저 UI를 위에 얹은 것 같지만 차이는 모든 UI가 생성 이미지 모델로 실시간 생성된다는 것이며 여기 있는 어떤 것도 가짜라는 것이다. 작동도 서술된다. 그 상상의 세계 안을 탐색할 수 있고 설명 일부를 클릭하면 모델이 알고 싶은 세부를 서술하는 새 하위 페이지를 생성한다는 것이다.

비전이 제시된다. 이것이 월드모델을 위한 최종 단계라고 생각한다는 것이다. 사고 실험도 제시된다. 인터넷이 존재하지 않는데 google.com을 입력한다면 모델이 무엇을 보여줘야 하는지이며 이 웹페이지는 완전히 존재하지 않는다는 것이다. 그래서 전망이 제시된다. 추론 비용이 내려가면 모든 것에 생성 UI를 갖게 될 것이라는 것이다.

논거가 코딩 모델과 대비된다. 코딩 모델은 웹페이지 코드를 쓰고 그 코드가 바이너리로 변환되고 바이너리가 화면에 픽셀을 렌더링한다는 것이다. 그리고 질문이 제시된다. 기계 학습에서 돌파가 있을 때마다 더 직관적이 되므로, 왜 사용자 지시에서 픽셀로 직접 가지 않느냐는 것이다. 예시도 제시된다. 이메일을 원하는데 모두가 같은 인터페이스를 갖지만 나는 약간 다르게 원하고 틱톡처럼 좌우로 스와이프하며 이메일을 보고 싶을 수 있다는 것이다.

미래 구조가 제시된다. 미래에는 훨씬 강력한 LLM과 코딩 모델이 배후에서 돌고 프런트엔드에서는 확산 모델이 실제로 프런트엔드가 되어 보여줄 것이라는 것이다. 진행자의 요약이 붙는다. 확산 프런트엔드에 결정적 백엔드라는 것이다.

비용도 계산된다. H100이 시간당 1달러이고 하루 8시간, 30일 쓰면 월 240달러라는 것이다. 판정이 나온다. 아무도 그것에 지불하지 않을 것이며 클로드 맥스보다도 비싸다는 것이다. 그런데 전망이 제시된다. 컴퓨트 비용이 매년 두 배씩 내려간다고 생각하면 그 미래가 몇 년 안에 실제로 도래할 것이라고 본다는 것이다.

대역폭 논거도 제시된다. 인간은 자연히 무언가를 볼 때, 비디오를 볼 때 최대 대역폭을 가지며 말할 때 최대 출력 대역폭을 갖는다는 것이다. 그래서 미래가 그려진다. 우리가 AI 모델에게 말하고 AI 모델이 생성 UI로 응답하는 것이며 그것이 뉴럴링크가 일어나기 전 AI 모델과 상호작용하는 최대 입출력 대역폭일 것이라는 것이다.

뉴럴 OS와 과분포 일반화

두 번째 예시가 제시된다. 뉴럴 OS인데 비디오 모델로 운영체제를 시뮬레이션하며 문자 그대로 조작하고 둠을 하거나 파이어폭스를 쓸 수 있다는 것이다.

그리고 흥미로운 관찰이 제시된다. 뉴럴 OS는 그냥 보면 우리가 가질 수 있는 윈도의 형편없는 버전처럼 느껴진다는 것이다. 이유가 제시된다. 이 모델은 기존 운영체제에 과적합되어 있어 그것과 다른 것을 아무것도 생성할 수 없다는 것이다.

그런데 비디오 모델과의 유사가 지목된다. 비디오 모델과 이미지 모델을 인터넷으로 훈련하는데 인터넷에는 상상의 초자연적인 것이 없지만 훈련하고 나면 데이터셋에 존재한 적 없는 초자연적인 것을 생성하도록 프롬프트할 수 있다는 것이다. 그래서 추론이 나온다. 인터넷 전체의 표준 화면 녹화로 뉴럴 컴퓨터를 훈련하면 모델이 컴퓨터와 상호작용하는 완전히 새로운 인터페이스를 상상할 수 있다는 것이다. 진행자의 반응도 붙는다. 보통 과분포 일반화는 나쁜데 어쨌든 어떤 내부 월드모델을 배웠다는 것이다.

시각 지능은 대부분 언어에서 온다

이 대담의 가장 큰 주장이 제시된다. 시각 지능이 실제로 대부분 언어에서 오고 있다는 것이다. 조건도 붙는다. 확산 모델 기술이 더 성숙해진 지금부터는 이 비디오 모델들에서 개선을 볼 때마다 그것이 대부분 비디오 확산 모델 자체가 아니라 언어 모델에서 온다는 것이다.

Cosmos의 구조가 근거로 제시된다. 이 모델들은 두 부분을 가지며 프롬프트 재작성기 또는 프롬프트 업샘플러 부분이 있다는 것이다. 구체적 구성이 밝혀진다. Cosmos에서는 라마나 믹스트랄을 썼고 Cosmos 비디오 모델 자체는 7B뿐인데 프롬프트 재작성기인 언어 모델은 그보다 더 크다는 것이다. 역할도 제시된다. 프롬프트 재작성기의 작업은 사용자 지시를 받아 비디오의 극도로 상세한 서술로 변환하는 것이라는 것이다.

확산 모델의 성격이 솔직하게 규정된다. 비디오 확산 모델은 다소 멍청하다고 서술하겠다는 것이다. 이유가 제시된다. 입력 지시를 문자 그대로 받아들이기 때문이며 훈련 과정에서 합성 텍스트 쌍을 만들 때 비디오를 가능한 한 상세하게 서술해야 했기 때문이라는 것이다. 사례도 제시된다. 사용자 지시는 정말 단순해서 그냥 고양이라고 하면 모델이 그것을 문자 그대로 받아들여 흰 배경에 고양이를 보여주고 배경을 서술하지 않았기 때문이며 움직임을 서술하지 않았으므로 고양이는 움직이지 않는다는 것이다.

3분의 정체도 밝혀진다. GPT 이미지가 3분에 이미지를 생성하는데 3분이 전부 그림 생성이 아니라 많은 시간이 생각에 쓰인다는 것이다. 그리고 진화가 제시된다. 프롬프트 재작성기가 이제 생각만이 아니라 에이전트 모델일 수도 있다는 것이다. 예시도 제시된다. 오늘 뉴스의 이미지를 생성하려면 온라인에서 오늘 뉴스를 가져와 처리하고 소화한 뒤 레이아웃을 조직해 생성한다는 것이다.

실제 경험도 제시된다. Cosmos에서 행복한 양을 생성했는데 재작성이 없으면 아주 CGI처럼 보였고 재작성한 뒤에는 아주 아름다워 보였다는 것이다. 조건도 명시된다. 어떤 공동 훈련도 없이 이 재작성만으로 훨씬 나았다는 것이다.

비디오 에이전트

다음 단계가 예고된다. 비디오 에이전트인데 대체로 언어 모델이 이 생성 모델을 별도 모델이든 확산 헤드든 도구로 쓰게 될 것이라는 것이다. 효과가 제시된다. 이 모델이 결과를 반복적으로 정련하거나 아주 긴 사고 연쇄로 더 긴 콘텐츠를 생성할 수 있다는 것이다.

인간의 창작과의 유사가 제시된다. 인간이 예술을 만드는 방식과 아주 비슷하며 우리는 픽셀을 직접 생성하지 않는다는 것이다. 도구 목록도 확장된다. 확산을 도구 하나로 쓰는 것만이 아니라 전통적 도구도 쓸 수 있으며 포토샵의 이미지 편집 도구나 FFmpeg 같은 비디오 편집기도 쓸 수 있다는 것이다. 그래서 결과가 제시된다. 이것들과 생성 AI 기술의 조합을 도구 세트로 삼아 프로덕션 등급 품질의 훨씬 나은 비디오를 상호작용적으로 만들 수 있다는 것이다.

기존 창작자의 실제 작업도 근거로 제시된다. 기존 전문 창작자는 이 모델들에서 비디오를 생성하는 데서 끝내지 않고 편집기로 가져가 여기저기 편집한다는 것이다. 그리고 인정이 붙는다. 때로는 실제로 비디오가 좋은 이유가 비디오 모델이 아니라 편집이라는 것이다.

Grok Imagine 에이전트 베타가 그 방향의 첫 시도라고 소개된다. 1분 비디오를 만들라고 요청할 수 있는데 같은 프롬프트를 비디오 모델에 주면 불가능하지만 이 모델은 다른 도구들을 호출해 그것을 한다는 것이다. 그리고 오해도 서술된다. 비디오 편집 모델을 처음 냈을 때 이 비디오를 1분으로 늘려 달라고 시도한 사람들이 있었는데 비디오 편집이 어떻게 작동하는지 이해하지 못했기 때문이며 비디오 편집은 보통 제거와 추가, 교체, 스타일 전이 같은 것이라는 것이다. 그런데 판정이 뒤집힌다. 그것이 실제로 비디오 에이전트의 가정 아래서는 유효한 작업이라는 것이다.

계보도 그려진다. 먼저 탭 완성 같은 AI 보조 코딩과 깃허브 코파일럿이 있었고 거기서 점차 완전 자동으로 하는 코덱스와 클로드 코드로 진화했다는 것이다. 그리고 대응이 제시된다. Grok Imagine 에이전트 모드에서도 들어가서 직접 할 수 있고 모델 능력이 올라가면서 모든 것을 완전 자동으로 할 수 있게 될 것이라는 것이다.

시점 예측도 제시된다. 올해 말까지 이것이 크게 히트할 것이며 변곡점이 거기 있을 것이라고 본다는 것이다. 조건이 제시된다. 비디오 에이전트로 생성된 비디오가 프로덕션 등급 품질에 도달해 광고로 제시되고 배포될 수 있다는 것이다. 그리고 결과가 제시된다. 그런 일이 일어나면 기업이 비디오 모델에 훨씬 많은 예산을 가질 것이며 에이전트는 그 과정에서 많은 변형을 생성하므로 본질적으로 비디오 모델 자체보다 비싸다는 것이다. 그럼에도 전망은 강하다. 이 모델들이 사용성 임계를 넘으면 그 이후로 기하급수적 성장이 될 것이라는 것이다.

로봇은 자연히 따라올 수 있다

로봇에 대한 견해가 제시된다. 로봇공학이 큰 부분이 될 것은 분명하지만 그 과정이 자연히 일어날 수 있다고 본다는 것이다.

예측이 제시된다. 물리적 AI가 실제로 실제 세계에 있지 않아도 풀릴 수 있으며 아주 강한 비디오 능력을 가진 LLM으로 풀릴 수 있다는 것이다. 경로가 제시된다. 지금 이 모델들은 화면 녹화와 컴퓨터 화면으로 훈련되고 있는데, 이 모델들이 컴퓨터를 쓸 수 있고 컴퓨터의 미래 상태를 극도로 잘 이해하게 되면 로봇이 아주 강력한 AI가 쓸 수 있는 도구 중 하나가 될 수 있다는 것이다. 그래서 결론이 제시된다. 강력한 AI가 물리적 구현체를 자연스럽게 제어할 수 있을 것이라는 것이다.

안전과 워터마크

워터마크 상황이 서술된다. 워터마크 없는 생성 AI 비디오를 허용하지 않는 나라가 많아서 그 모든 나라에서 Grok Imagine은 워터마크를 넣었다는 것이다. 그리고 대응 속도도 언급된다. 비디오 삭제도 극도로 빠르게 일어났다는 것이다.

SynthID의 한계가 지목된다. 이전에는 구글만이었는데 지금은 여러 플랫폼이 채택하고 있다는 것이다. 그런데 한계가 명확하다. 기술의 논문이 공개되어 있어 사람들이 그것을 제거하는 방법을 역설계할 수 있으며 발전해도 여전히 역설계가 가능하다고 본다는 것이다. 진행자의 보완도 붙는다. 레딧에서 사람들이 구글이 적용하는 패턴을 뽑아내 어떤 구글 생성 사진에도 적용하고 SynthID를 되돌릴 수 있다는 것이다.

판별의 어려움도 서술된다. 몇 년 전에는 손가락이 여섯 개인 것처럼 아주 명백했다는 것이다. 그런데 이제는 다르다고 한다. 개인적으로는 이제 이 비디오들이 논리적 의미를 갖는지로 판단해야 한다는 것이다. GAN의 원리와도 연결된다. GAN이 훈련 과정에 있었고 목표는 모델이 이미지를 생성하고 판별자가 실제인지 아닌지 판정하며 모델은 이미지를 더 실제처럼 만들도록 훈련되므로, 모델이 더 발전할수록 점점 더 어려워질 것이라는 것이다. 진행자들의 판별 단서도 제시된다. 오디오가 너무 좋고 너무 스튜디오 품질이며 조명이 너무 좋고 피부가 너무 깨긋해서 불완전함이 없다는 것이다.

문화와 첫 원리

xAI 문화가 세 문장으로 제시된다. 빠르게 움직여라, 어떤 목표도 너무 야심적이지 않다, 그리고 첫 원리라는 것이다. 그리고 실제 느낌도 붙는다. 목표 설정이 아주 야심적이었고 처음 그것을 생각했을 때는 달성 가능하지 않았다는 것이다.

첫 원리의 적용 방식도 구체적으로 제시된다. 첫 원리 사고가 모델보다 물리적 세계에 더 적용된다고 말할 수 있지만 예컨대 비디오를 얼마나 빨리 획득할 수 있는지, 모델을 종단간 훈련하는 반복 속도가 무엇인지, GPU를 더 추가하면 그 시간표가 얼마나 가속되는지, 인간 데이터가 필요하면 그것이 도착하는 데 걸리는 시간이 무엇인지를 묻는다는 것이다. 그래서 정의가 나온다. 그 모두를 합쳐 무언가를 달성하는 것이 가능한 최소 일수가 무엇인지 묻는 것이 첫 원리 사고라는 것이다. 일론의 어법도 인용된다. 깨뜨릴 수 없는 유일한 법은 물리 법칙이라는 말로 유명하다는 것이다.

왜 떠났고 다음은 무엇인가

이유가 제시된다. 회사에서는 할 수 없는 연구가 많고 우선순위와 목표가 아주 빠르게 바뀔 수 있으며 그것은 xAI도 마찬가지라는 것이다. 그래서 결정이 밝혀진다. 특히 언어 모델 쪽에서 하고 싶은 연구가 있는데 xAI에서는 할 수 없었다는 것이다.

그리고 이유가 이 대담의 주장으로 귀결된다. 자기가 온 곳인 확산 기술의 개선이 이득의 원천이었지만 이제는 대부분의 이득이 언어 모델 자체에서 오는 지점이라는 것이다. 결론이 명확하다. 지금 비디오 모델의 병목이 실제로 언어 부분이고 에이전트이며 그것이 LLM을 더 작업하고 싶은 이유라는 것이다.

다음 예측도 제시된다. 언어 모델이 문맥을 인식하고 자기 문맥을 관리하게 되는 것이 곧 일어날 것이라고 본다는 것이다. 근거가 비디오에서 온다. 비디오 모델 쪽에서 장기지평 문제로 고통받아 왔고 문맥 길이 문제를 여러 방법으로 풀려 했으며 하나는 그냥 더 긴 문맥 길이를 무차별 훈련하는 것이고 다른 하나는 문맥을 더 잘 관리하는 것이라는 것이다.

현재 LLM의 문제도 지목된다. 언어 모델은 자기 문맥 길이가 얼마나 긴지 인식하지 못하며 80퍼센트 정도에 닿으면 자동 문맥 압축이 발동되는데 모델은 작업하는 동안 그것을 인식하지 못한다는 것이다. 그래서 제안이 나온다. 모델이 80퍼센트에 접근하고 있다는 것을 아는 것이 좋을 수 있다는 것이다. 시간 인식의 예도 제시된다. 어떤 도구에서는 무언가를 입력할 때마다 현재 로컬 시간이 메시지에 자동으로 붙어서 모델이 몇 시인지 실제로 안다는 것이다. 그리고 현재 상태가 정리된다. 문맥 제거와 문맥 추가, 문맥 압축이 모두 하네스 시스템 자체에서 오며 휴리스틱 공학이 모델 자체에 흡수되도록 돕는다는 것이다.

더 급진적인 구상도 제시된다. 모델이 에이전트 하네스 자체의 코드 전체에 접근해 원하는 대로 수정할 수 있으면 어떨지 상상한다는 것이다. 구체적 형태가 제시된다. 하네스가 충분히 짧으면 시스템 프롬프트의 문맥 길이에 그냥 넣을 수 있고 모델이 자기 미래 버전을 생성하고 싶을 때 하네스를 수정할 수 있다는 것이다. 예시도 제시된다. 긴 문서를 읽을 때 전체를 덩어리로 읽고 돌아와 요약을 합칠 수도 있고 처음 200줄만 읽고 나머지를 버릴 수도 있다는 것이다. 그래서 결론이 나온다. 그 모든 선택을 모델 자신이 할 수 있다면 아주 흥미로울 것이며 모델이 테스트 시점에 온라인으로 자기를 프로그래밍할 수 있다는 것이다.

열 년의 전환들

경력 이력이 열거된다. 10년 전에는 ResNet 저자들과 연구했다는 것이다. 그때의 주제도 제시된다. 연구가 완전히 달라서 대체로 컴퓨터 비전이었고 이미지 인식과 객체 탐지, 객체 추적이었으며 네트워크 압축도 하고 있었는데 요즘의 지식 증류와는 꽤 달랐다는 것이다.

그리고 실패가 솔직하게 제시된다. 교수가 되고 싶었고 박사 지원 때 이미 최상위 학회에 제1저자 논문 몇 편이 있어 자신 있게 최상위 학교에 지원했다는 것이다. 결과가 밝혀진다. 최상위 박사 프로그램 전부에서 거절당했다는 것이다. 그래서 산업으로 가야 했다는 것이다. 다음 위치도 제시된다. 그때 얀 르쿤이 이끄는 페이스북 AI 리서치에 있었고 거기서 자기지도 학습으로 전환했는데 컴퓨터 비전에서 하던 것과 꽤 달랐다는 것이다.

이후도 이어진다. 그 뒤 Nvidia Cosmos였으며 확장이 극도로 중요하다는 것을 깨달았다는 것이다. 두 작업이 제시된다. 하나는 Cosmos로 비디오 모델을 수십억 파라미터로 확장한 것이고 다른 하나는 MoE 작업이라는 것이다. 성과도 제시된다. Megatron MoE는 이 MoE들을 수천억에서 수조 파라미터까지 40퍼센트 MFU로 효율적으로 훈련할 수 있는 첫 오픈소스 프레임워크였다는 것이다. 그리고 xAI 이동의 이유도 반복된다. 더 큰 컴퓨트 규모에서 더 나아가려는 것이었다는 것이다.

교훈이 정리된다. 실제로 많은 다른 것을 작업했으며 ML 안에서는 생각보다 전환하기가 실제로 더 쉽다고 느낀다는 것이다. 흔한 오해도 반박된다. 많은 사람이 컴퓨터 비전을 하니 항상 컴퓨터 비전을 해야 하고 언어로 전환할 수 없다고 말할 수 있지만 자기 경험으로는 최소한 Nvidia에서 언어 모델 MoE와 비디오 모델을 둘 다 작업했으므로 그렇지 않다는 것이다. 근거가 제시된다. 큰 모델을 훈련하는 핵심 원리는 대체로 같다는 것이다.

더 생각해보기

  • 시각 지능의 개선이 대부분 언어에서 온다는 주장은 확산 모델 연구자에게 무엇을 뜻하는가.
  • 프롬프트 재작성기가 본체보다 크다면 무엇을 비디오 모델이라 불러야 하는가.
  • 인프라도 데이터도 없이 3개월이 가능했던 조건 중에서 재현 가능한 것은 무엇인가.
  • 큰 개선이 작은 버그 수정에서 온다는 관찰은 팀 규모를 키우는 판단과 어떻게 충돌하는가.
  • 눈이 보이지 않는 사람과 귀가 들리지 않는 사람을 기준으로 삼는 캡션 프로토콜은 어디까지 확장되는가.
  • 월드모델의 실시간 기준을 3밀리초로 잡을 때와 200밀리초로 잡을 때 필요한 기술이 어떻게 갈리는가.
  • 장문맥 관리에서 비디오 쪽이 언어 쪽보다 앞서 있다는 판정은 무엇을 근거로 삼는가.
  • 생성 UI가 코드를 대체한다는 구상에서 접근성과 검증은 어디로 가는가.
  • 물리적 AI가 실제 세계 없이 풀릴 수 있다는 예측은 어떤 실패로 반증되는가.
  • 워터마크가 역설계 가능하다면 출처 증명은 무엇으로 대체되어야 하는가.
원문 출처는 본문의 Source에서 확인할 수 있습니다.