Jungseob's Note
포스트
원문 대표 이미지 · Own Your Intelligence: A How-To Guide

지능을 빌리면 두 번 지불한다 - 세쿼이아가 정리한 자체 지능 소유 로드맵

오픈웨이트 프런티어가 예상보다 빨리 따라붙고 독립 사후훈련 스택이 성숙했다는 두 조건에서 출발해, 평가·하네스·사후훈련·온라인 학습 네 단계로 자체 지능 소유 경로를 정리한 글. 하비의 1,200개 과제 벤치마크와 7명 연구팀 사례가 근거로 쓰인다.

지능을 빌리면 두 번 지불한다 - 세쿼이아가 정리한 자체 지능 소유 로드맵

지능을 빌리면 두 번 지불한다

TL;DR

  • 문제 제기가 두 인용으로 시작하는데 최근 알렉스 카프는 기업들에게 생산 수단을 소유하라고 권했고, 얼마 지나지 않아 사티아 나델라는 프런티어 랩에서 지능을 사는 것은 두 번 지불하는 것과 같다고 선언했다는 것이다. 두 번의 정체가 명확하다. 한 번은 돈으로, 또 한 번은 그 지능을 유용하게 만들기 위해 드러내는 독점적 지식으로 지불한다.
  • 단서를 먼저 붙이는데 자체 지능 소유는 명령도 아니고 랩에서 벗어나라는 권고도 아니며 많은 워크로드에서 프런티어 API와 에이전트가 여전히 정답이라는 것이다. 그런데 흐름은 분명하다. 포트폴리오 전반에서 제품의 일부를 위해 자체 AI 역량을 구축하며 자기 가중치를 소유하고 형성하는 쪽으로 수직 통합하는 기업이 늘고 있다.
  • 지금이 시점인 이유가 둘인데 첫째로 오픈웨이트 프런티어가 예상보다 빠르게 움직여 Kimi K3와 GLM 5.2가 극도로 좋고, 예전에는 몇 달을 파인튜닝해도 다음 프런티어 릴리스가 성과를 지워버리는 러닝머신이었지만 이제는 프런티어에 가까운 기준선에서 출발할 수 있다. 둘째는 스택 성숙이다. 강한 평가와 하네스 엔지니어링, 사후훈련, 온라인 학습이 있으면 오픈 모델이 특정 도메인에서 프런티어 모델을 이길 수 있다.
  • 전선이 이동했다고 규정되는데 1년 전에는 성능을 희생할 수 있을 때 오픈 가중치를 선택했지만 이제는 실존적이고 전략적인 문제가 되고 있으며, 가장 새로운 전장은 지능 계층이라는 것이다. 그리고 통합이 지목된다. 앱 계층과 지능 계층이 합쳐지기 시작해 랩은 제품으로 올라오고 앱 기업은 제품이 사고하는 방식을 정의하는 훈련 루프로 내려가고 있다.
  • 실행의 첫 조건이 사람인데 이것을 플랫폼 팀에 억지로 밀어넣지 말라는 것이고 자체 지능 소유에는 공격을 하는 사람들이 필요하다는 것이다. 규모는 작아도 된다. 작고 새로 만든 팀이 여섯 곳 남짓의 생태계 파트너와 협력하며 아주 멀리 가는데, 예컨대 하비는 단 일곱 명의 팀으로 놀라울 만큼 많은 연구를 해냈다.

Source

Own Your Intelligence: A How-To Guide — Sonya Huang, Sequoia Capital, 2026년 8월 19일

부제는 AI 애플리케이션 계층 경쟁이 UI나 워크플로, GTM만의 문제가 아니라 지능 계층 자체를 둘러싼 싸움이라는 것이다.

[sequoiacap.com/article/own-your-intelligence-a-how-to-guide](https://www.sequoiacap.com/article/own-your-intelligence-a-how-to-guide/)

Knowledge

두 번 지불한다는 말

글은 두 인용으로 문제를 세운다. 최근 알렉스 카프가 기업들에게 생산 수단을 소유하라고 권했다는 것이다. 그리고 얼마 지나지 않아 사티아 나델라가 선언했다는 것이다. 프런티어 랩에서 지능을 사는 것은 두 번 지불하는 것과 같다는 것이며 한 번은 돈으로 그리고 또 한 번은 그 지능을 유용하게 만들기 위해 드러내는 독점적 지식으로 지불한다는 것이다. 그래서 모두가 묻는 질문이 정리된다. 당신 사업의 핵심에 있는 지능을 누가 소유해야 하느냐는 것이다.

그런데 곧바로 단서를 붙인다. 분명히 하자면 자체 지능을 소유하는 것은 명령도 아니고 랩에서 벗어나라는 권고도 아니라는 것이다. 많은 워크로드에서 프런티어 API와 에이전트가 여전히 올바른 답이라고 인정한다. 그럼에도 관찰되는 흐름이 있다. 자기들 포트폴리오 전반에서 제품의 일부를 위해 자체 AI 역량을 구축하며 자기 가중치를 소유하고 형성하는 쪽으로 수직 통합하는 기업이 늘고 있다는 것이다. 글의 출처도 밝힌다. 몇 주 전 세쿼이아가 AI 창업자와 빌더 그룹을 모아 자체 AI 스택 소유에 관한 행사를 열었다는 것이다. 참여 구성도 정리된다. 하비가 고객 관점의 시각을 주었고 그다음 머코와 랭체인, 트라젝토리, 파이어웍스가 사후훈련 스택의 기술적 구성 요소들을 안내했다는 것이다. 그리고 발표들을 통틀어 명확한 플레이북이 나타났다고 한다.

왜 지금인가 — 두 가지 조건

첫 번째 조건이 오픈웨이트의 속도다. 오픈웨이트 프런티어가 예상보다 빠르게 움직였다는 것이다. Kimi K3와 GLM 5.2가 극도로 좋다고 평가된다. 그리고 과거와의 대비가 결정적이다. 오픈 모델로 훈련하는 것은 예전에는 러닝머신이었다는 것이다. 몇 달을 파인튜닝했는데 다음 프런티어 릴리스가 당신의 성과를 지워버렸을 수 있다는 것이다. 그런데 지금은 다르다. 프런티어에 가까운 기준선에서 출발할 수 있다는 것이다.

두 번째 조건이 독립 사후훈련 스택의 성숙이다. 머코와 파이어웍스 같은 기업들 덕분에 모든 기업이 프런티어 연구 랩의 기술 스택에 접근할 수 있게 되었다는 것이다. 범위가 열거된다. 훈련에서 추론까지, 그리고 인간 또는 합성 데이터까지라는 것이다. 그래서 결과가 나온다. 강한 평가와 하네스 엔지니어링, 사후훈련, 온라인 학습이 있으면 오픈 모델이 이제 특정 도메인에서 프런티어 모델을 이길 수 있다는 것이다. 그래서 전선의 이동이 선언된다. 1년 전에는 성능이 희생할 수 있는 것일 때 오픈 가중치를 선택했다는 것이다. 그런데 이제는 실존적이고 전략적인 문제가 되고 있다는 것이다. 가장 새로운 전장은 지능 계층이며 당신의 가중치도 당신의 제품도 아니라고 규정된다.

언제 움직여야 하는가 — 네 가지 제약

만능 접근법은 없다고 전제한다. 성능 외에도 지능을 빌리는 것이 제약이 되는 제품의 조각들이 있을 수 있다는 것이고 네 가지가 제시된다. 첫째는 비용이다. AI 제품이 성공할수록 AI 매출원가가 높아진다는 것이다. 그래서 조건이 명확하다. 추론 비용이 사용량에 직접 비례해 늘어난다면 모델을 소유하는 것이 마진을 지키는 최선의 방법이라는 것이다. 둘째는 속도다. 코딩의 탭 자동완성이나 사이버보안 같은 도메인에서 운영한다면, 속도가 너무 중요하기 때문에 작은 증류 커스텀 모델이 큰 범용 모델을 이길 수 있다는 것이다.

셋째는 독점 데이터다. 당신의 피드백과 평가, 고객 상호작용, 도메인 데이터가 시스템을 더 좋게 만드는 것이라면 그 데이터가 당신의 벽 안에 머무는 것을 선호할 수 있다는 것이다. 넷째는 자기 운명의 통제다. 앱 계층과 지능 계층이 합쳐지기 시작했다는 것이다. 양방향의 움직임이 서술된다. 랩들은 제품으로 올라오고 있고 앱 기업들은 제품이 사고하는 방식을 정의하는 훈련 루프로 내려가고 있다는 것이다. 그래서 결론이 나온다. 제품을 소유한다는 것이 점점 학습 루프와 지능 자체를 더 많이 통제하는 것을 뜻할 수 있다는 것이며 하비 리서치와 램프랩스, 글린, 팩토리 등의 공로를 언급한다.

로드맵 — 팀부터 시작한다

무엇을 소유하고 무엇을 빌릴지 전략을 정했다면 질문이 바뀐다고 한다. 어떻게 0에서 1로 가느냐는 것이다. 첫째가 팀 구축이다. 이것을 플랫폼 팀에 억지로 밀어넣지 말라는 것이다. 이유가 명확하다. 자체 지능을 소유하는 데는 공격을 하는 사람들이 필요하다는 것이다. 할 일이 열거된다. 평가를 구축하고 데이터를 형성하고 오픈 모델로 실험하고 하네스를 튜닝하며 한 도메인에서 성능을 밀어붙이는 것이다. 규모에 대한 통념도 깨진다. 작고 새로 만든 팀이 여기서 아주 멀리 가는데, 여섯 곳 남짓의 생태계 파트너와 협력한다는 것이다. 그리고 사례가 붙는다. 예컨대 하비는 단 일곱 명의 팀으로 놀라울 만큼 많은 연구를 해냈다는 것이다.

둘째가 작업을 읽을 수 있게 만드는 것이다. 지금 모든 구매자가 자기의 AI 챔피언을 고르고 있다는 것이다. 그리고 결정 요인이 지목된다. 점점 그 결정타는 발표된 연구와 벤치마크, 기술 포스트라는 것이다. 그래서 권고가 나온다. 사내에서 훌륭한 연구를 하기로 선택한다면 그것을 생태계와 공유하라는 것이다. 셋째가 기술적 단계 실행이다. 아래에 높은 수준의 프레임워크를 정리했다고 한다.

1단계 평가 — 벤치마크가 없으면 훈련할 수 없다

하비의 게이브 페레이라가 잘 말했다고 인용된다. 좋은 벤치마크가 없으면 모델을 훈련할 수 없다는 것이다. 평가의 정의가 제시된다. 평가란 당신의 시스템이 그 일을 잘 할 수 있는지 측정하는 과제 집합이라는 것이다. 구성 요소도 셋으로 정리된다. 모든 과제는 프롬프트와 모델이 사용할 수 있는 맥락, 그리고 채점자를 담고 있다는 것이다. 현실의 출발점도 솔직하다. 대부분의 평가는 창업자가 출력물을 눈을 찡그리고 보면서 옳게 느껴지는지 감으로 확인하는 것에서 시작한다는 것이다. 그래서 목표가 규정된다. 그 판단을 반복 가능한 것으로 바꾸는 것이라는 것이다.

하비의 사례가 수치로 제시된다. 실제 법률 업무를 모델이 시험받을 수 있는 개별 과제로 바꿔 리걸 에이전트 벤치마크를 구축했다는 것이다. 규모가 구체적이다. 첫 번째 이터레이션이 24개 법률 실무 영역에 걸친 1,200개 이상의 에이전트 과제를 포함하며 75,000개 이상의 전문가 작성 루브릭 기준으로 평가된다는 것이다. 순서에 대한 지침도 명확하다. 자체 지능 소유를 결정하기 전에 평가를 갖는 것이 중요하다는 것이다. 그리고 효과가 명시된다. 모든 순전파에 평가가 붙으면 어떤 모델을 쓸지 결정하는 일이 추측이 아니라 측정된 결정이 될 수 있다는 것이다.

2단계 하네스와 맥락 엔지니어링

에이전트가 세 부분으로 나뉜다고 제시된다. 모델과 맥락, 그리고 하네스다. 하네스의 역할이 정의된다. 하네스는 모델 주변의 제품 로직을 관장하는데 라우팅과 검색, 도구, 메모리, 폴백, 트레이스라는 것이다. 해리슨 체이스의 단순한 정리가 인용된다. 하네스의 주된 일은 올바른 시점에 모델에게 맥락을 가져다주는 것이라는 것이다. 그리고 상관관계가 지목된다. 과제가 모델에게 분포 밖일수록 기성 하네스는 더 나빠진다는 것이다.

좋은 하네스가 주는 것이 셋으로 열거된다. 당신의 특정 작업에 가장 좋은 모델로 과제를 라우팅하게 하고 같은 평가를 여러 모델에 재사용하게 하며 에이전트가 어떤 맥락과 도구를 받을지 결정하게 한다는 것이다. 그리고 부수 효과가 붙는다. 에이전트를 검사 가능하게도 만드는데, 어떤 맥락이 들어갔고 어떤 도구가 호출됐으며 어디서 막혔는지 추적할 수 있다는 것이다.

3단계 사후훈련 — 가장 가벼운 방법을 고른다

사후훈련이 여러 기법을 포괄한다고 전제한다. 올바른 기법은 무엇을 개선하려는지에 달려 있다는 것이다. 린 치아오가 정리한 판단 규칙이 인용된다. 모델이 사실을 놓치고 있다면 사후훈련이 필요 없고 그냥 맥락이나 RAG를 쓰라는 것이다. 출력 형식이나 행동이 잘못되었다면 지도 파인튜닝을 쓰라는 것이다. 문제가 제품 취향이라면 선호 튜닝을 쓰라는 것이다. 모델이 전문화된 과제에서 개선되어야 한다면 RL을 쓰라는 것이다. 그리고 모델이 너무 느리거나 비싸면 증류하라는 것이다.

목표가 한 문장으로 정리된다. 당신의 평가를 움직이는 가장 가벼운 방법을 고르는 것이라는 것이다. 그다음 절차도 명시된다. 그리고 같은 하네스를 통해 모델을 서빙하며 돌아가는 동안 품질과 지연, 비용을 측정하라는 것이다.

4단계 온라인 학습 — 부족한 것은 경험이다

시스템이 평가와 하네스, 모델이라는 조각을 갖추면 마지막 단계는 프로덕션에서 그 시스템을 개선하는 것이라고 한다. 아르준 카라남의 지적이 인용된다. 모델은 계속 더 똑똑해지지만 모든 세션이 첫 출근일처럼 느껴진다는 것이다. 비유가 인상적이다. 테런스 타오를 회계 법인에 데려다 놓을 수 있지만 최소한 첫날에는 그가 거기서 최고의 회계사가 되지 못할 가능성이 크다는 것이다. 그래서 진단이 명확하다. 부족한 것은 지능이 아니라 경험이라는 것이며 에이전트는 돌아가면서 그 경험을 만든다는 것이다.

트래젝토리의 정의가 제시된다. 트래젝토리는 과제를 통과하는 경로인데, 모델이 본 맥락과 호출한 도구 및 서브에이전트, 산출한 답, 그리고 사용자가 편집하거나 되돌리거나 재시도한 것이라는 것이다. 그리고 도구가 언급된다. 랭체인의 랭스미스 같은 도구로 그 트래젝토리를 포착하는 것이 지속적인 프로덕션 루프를 구축하는 데 필요하다는 것이다. 루프의 작동 방식이 셋으로 정리된다. 실패한 과제는 평가가 되고 누락된 정보는 맥락이나 메모리로 들어가며 나쁜 도구 응답은 하네스 수정이 된다는 것이다.

판도라의 상자와 작은 천재들

경고가 먼저 온다. 구매자는 주의하라는 것이고 자체 지능 소유는 판도라의 상자를 연다는 것이다. 닫힌 모델 스택의 단순함이 대비된다. 프런티어 모델을 호출하고 기성 하네스를 쓰고 프롬프트와 맥락을 더해 출시하는 것이라는 것이다. 클로드 코드나 코덱스가 예로 언급된다. 그리고 평가가 붙는다. 그것은 높은 바닥을 주지만 낮은 천장도 준다는 것이다. 소유의 대가가 구체적으로 나뉜다. 자체 스택을 소유하면 시스템을 더 많이 스스로 감당한다는 것이다. 프로덕션 스택은 당신의 오픈소스 모델과 커스텀 하네스, 도구, 맥락이 되고 개발 스택은 당신의 독점 평가와 도메인 데이터, 온라인 학습 루프가 된다는 것이다.

그리고 정직한 결론이 온다. 확실히 더 많은 일이며 잠재적으로 더 낮은 바닥을 주지만 천장도 높인다는 것이다. 마지막 그림이 제시된다. 랩들은 거대한 뇌를 계속 만들 것이고 우리 모두 그것을 써야 한다는 것이다. 그런데 병행하는 흐름이 있다. 최고의 제품 기업들은 자기만의 작은 천재들을 키우고 있는데, 빠르고 의견이 강하며 도메인에 집착하고 자기가 보는 일에 맞춰 튜닝된 존재라는 것이다. 그래서 전망이 붙는다. 더 많은 기업이 자기 지능의 소유권을 갖는 세상에서는 생태계가 번성하고 개별성이 승리한다는 것이다. 그것이 기업들이 자기 지능을 소유하는 세상의 약속이며 그 세상을 존재하게 만들려는 스타트업들과 작은 이들의 진전을 보게 되어 기쁘다고 마무리된다.

더 생각해보기

  • 두 번 지불한다는 나델라의 규정은 어떤 조건에서 실제로 비용으로 환산되는가.
  • 오픈웨이트가 프런티어에 가까워졌다는 판단은 어떤 벤치마크로 검증해야 신뢰할 수 있는가.
  • 하비가 일곱 명으로 가능했던 이유는 팀 구성인가, 여섯 곳의 생태계 파트너인가.
  • 1,200개 과제와 75,000개 루브릭 기준을 만드는 비용은 어느 규모의 기업부터 감당 가능한가.
  • 평가를 먼저 만들라는 순서는 제품 방향이 아직 불확실한 초기 기업에도 적용되는가.
  • 가장 가벼운 사후훈련 방법을 고르라는 규칙에서, 제품 취향과 전문화된 과제를 구별하는 기준은 무엇인가.
  • 모든 세션이 첫 출근일 같다는 문제는 온라인 학습으로 어디까지 해소되는가.
  • 낮은 바닥을 감수하고 높은 천장을 택하는 결정은 어떤 지표로 사후 검증할 수 있는가.
  • 앱 계층과 지능 계층이 합쳐진다면, 최종적으로 누가 어느 쪽을 흡수하는가.
  • 벤처 캐피털이 이 플레이북을 제시하는 것에는 어떤 이해관계가 반영되어 있는가.
원문 출처는 본문의 Source에서 확인할 수 있습니다.