DeepSeek의 KV 캐시 압축과 서구 연구소의 캐시 가격 인하, 우연인가 채택인가
DeepSeek V4.1 Flash의 KV 캐시 압축 수치와 서구 연구소 신모델의 캐시 가격 인하를 연결한 글의 주장을 확인된 사실과 추론으로 나눠 정리한다.
TL;DR
- 글쓴이는 서구 연구소가 중국 연구소를 증류로 비난하는 동안, 실제로는 DeepSeek이 공개한 KV 캐시 최적화를 조용히 채택했다고 주장한다. 근거는 신모델의 캐시 가격이 급락했다는 점이다.
- DeepSeek V4.1 Flash의 전역 KV 캐시는 토큰당 890바이트로, 모델 카드에 따르면 V4 Flash의 약 4분의 1이며, 글은 V1 대비 약 437배 작다고 계산한다. 이 수치 자체는 DeepSeek의 공개 자료로 확인된다.
- 글이 제시한 가격 비교에서 Opus 5에서 5.5로 캐시 읽기가 0.50달러에서 0.20달러로, GPT-5.6 Sol에서 6.1 Sol로 캐시 입력이 0.50달러에서 0.10달러로 내렸다. 각각 60%와 80% 하락이다.
- 가격 인하와 DeepSeek 기법의 채택을 잇는 고리는 정황이다. 서구 연구소가 그 기법을 썼다는 직접 증거는 글에 없으며, 마진 개선이라는 결론도 글쓴이의 추측이다.
증류 공방 뒤에서 벌어진 일이라는 주장
글은 서방 연구소가 중국 연구소에 밀리고 있다는 헤드라인에서 출발한다. 글쓴이가 보기에 Anthropic이 중국 연구소의 증류를 고발하는 글을 자주 내는 것은 모델에 대한 법적, 규제적 제한의 근거를 깔기 위한 일이다. 그는 무턱대고 증류하던 시대가 끝났고 이제는 중국 연구소의 성과를 채택하는 국면이라고 본다. 서구 기업이 쓰는 도용이라는 격한 말 대신 채택이라고 부르는 이유는 중국 쪽이 사실상 자신들의 레시피를 공개하고 있기 때문이라고 설명한다.
이 부분은 글쓴이의 해석이다. 글이 링크한 TechCrunch와 Anthropic의 증류 관련 글, AP 기사는 이 노트에서 읽지 않았고 글쓴이의 의도 추정이 사실이라는 증거도 제시되지 않았다.
437배라는 숫자가 가리키는 것
글이 근거로 드는 기술적 사건은 DeepSeek의 KV 캐시 최적화다. 글에 따르면 MLA 구조가 캐시를 약 15배 줄였고 이어 압축 희소 어텐션과 고압축 어텐션이 나왔으며 최신 V4.1 Flash는 CSA2와 계층 간 캐시 재사용, 인과적 인코더-디코더 구조, FP4 캐싱을 더해 전역 KV 캐시를 토큰당 890바이트까지 낮췄다. 이렇게 하면 코딩처럼 긴 세션 문맥을 다루는 용도에서 V1 대비 약 437배 작아진다.
이 수치는 DeepSeek의 모델 카드와 논문 초록 요약으로 교차 확인된다. 모델 카드는 전역 KV 캐시가 토큰당 890바이트이고 이것이 V4 Flash의 약 4분의 1이라고 적는다. 글의 그림 설명에는 백만 토큰당 V1 389.12GB, V3.2 48.07GB, V4 Flash 3.51GB, V4.1 Flash 890MB가 나온다. 이것이 중요한 까닭은 긴 문맥 모델을 서빙할 때 가장 큰 비용 중 하나가 캐시를 GPU 메모리에 올려 두는 데 드는 VRAM이기 때문이다.
캐시 가격 하락을 채택의 증거로 읽는 논리
글쓴이는 서구 두 연구소의 신모델 가격 변화를 채택의 증거로 든다. 글의 비교 그림에 따르면 Anthropic의 Opus 5에서 5.5로 입력이 5달러에서 4달러로, 캐시 쓰기가 6.25달러에서 5달러로, 캐시 읽기가 0.50달러에서 0.20달러로 바뀌었다. OpenAI의 GPT-5.6 Sol에서 GPT-6.1 Sol로는 입력이 5달러에서 2달러로, 캐시 쓰기가 6.25달러에서 2.50달러로, 캐시 입력이 0.50달러에서 0.10달러로 바뀌었다. 모두 백만 토큰당 가격이다. 글은 이를 캐시 읽기 60% 인하와 80% 인하로 요약한다.
여기서 확인된 사실과 추론을 나눠 봐야 한다. 가격표의 변화는 글의 그림에 적힌 수치이고 이 노트는 그 가격을 각 회사의 공개 가격표와 대조하지 않았다. 캐시 읽기 가격이 함께 내렸다는 관찰은 사실일 수 있어도, 그 원인이 DeepSeek의 기법을 가져다 썼기 때문이라는 결론은 정황에서 나온 추측이다. 두 모델이 조용히 출시된 것을 부끄러움의 표시로 읽는 대목과 서구 연구소가 이제 추론 마진이 크게 흑자일 것이라는 대목 역시 같은 수준의 추측이다.
글은 마지막에 중국 연구소가 적자를 내는 서구 연구소에 구명줄을 던졌는데 그 이유를 모르겠다고 끝낸다. 글쓴이 스스로도 왜 그런 기술을 공개하는지 모른다고 인정한다. 결국 이 글이 확실하게 전달하는 것은 KV 캐시 압축이 비용 구조를 바꾸는 큰 기술적 진전이라는 점이고 그것이 서구 연구소의 가격 인하로 이어졌다는 연결은 검증이 더 필요한 가설로 남는다.
참고 자료
insufferable.dev — The AI Race Just Got Awkward
DeepSeek-V4.1-Flash 모델 카드 (Hugging Face) — 토큰당 890바이트와 V4 Flash의 약 4분의 1이라는 수치를 대조했다. 논문 본문은 읽지 않았다.
