Jungseob's Note
포스트

지능이 싸질 때 바뀌는 소프트웨어, 토큰 가격과 작업 비용부터 구분하기

작업당 AI 비용을 낮추는 모델·추론 엔진·하드웨어·특화 모델의 변화를 살펴보고 서로 다른 효율 지표의 합산과 미래 수요 전망을 구분한다.

지능이 싸질 때 바뀌는 소프트웨어, 토큰 가격과 작업 비용부터 구분하기

TL;DR

  • jyn은 저렴한 지능이 독립 제품을 넘어 컴퓨팅 기반에 들어갈 것이라고 전망한다. 핵심 지표는 최신 모델의 토큰 단가보다 같은 품질의 작업을 끝내는 비용이다. 3~6년 안에 현재 최전선 수준의 모델을 범용 기기에서 실행하리라는 예상은 확정된 일정이 아니다.
  • 모델과 하드웨어, 추론 엔진의 개선은 서로 다른 비용을 줄인다. 같은 하드웨어를 쓴 ML.ENERGY 비교에서는 처리량이 3~5배 늘었지만 출력 토큰당 에너지는 15~41% 줄었다. 처리량과 전력, 에너지와 API 가격을 같은 배율로 취급하면 절감 효과를 잘못 계산한다.
  • MoE는 활성 계산량을 줄이고 Mamba 혼합 모델은 긴 문맥의 메모리 부담을 낮춘다. Jev처럼 답의 형태를 제한한 모델은 작은 의미 판단을 일반 코드 안에 넣는 비용도 낮춘다. 각 개선에는 가중치 저장 공간과 양자화, 문맥 길이와 작업 범위라는 조건이 붙는다.
  • 원문이 합산한 100배·1.3배·1.4배의 단순 곱은 182배로 약 2.26자릿수다. 글의 약 2.5자릿수라는 표현과 산술적으로 다르며 가격과 물리적 효율을 독립 항목처럼 곱하는 문제도 있다. 정확한 산업 전체 절감률보다 여러 층에서 개선이 진행된다는 주장으로 읽는 편이 맞다.
  • 싸진 추론이 전체 지출과 전력 사용을 반드시 줄이지는 않는다. 사용량이 늘면 인프라 수요가 커지고 소프트웨어의 경쟁력도 코드 자체에서 운영·보안·사용자 경험으로 옮겨 갈 수 있다. 직접 맞춤 소프트웨어를 만들 선택지가 늘어도 품질과 전환 비용, 규제의 제약은 남는다.

토큰이 아니라 같은 일을 끝내는 비용

jyn은 최신 대형 모델의 토큰 가격이 언제나 하락하는 것은 아니라고 구분한다. 작은 모델은 토큰이 싸더라도 더 오래 추론하거나 초안을 여러 번 고쳐야 할 수 있다. 비교하려는 것은 동일한 수준의 일을 끝내는 데 드는 전체 비용이다. 이 관점에서는 특정 토큰 단가만 낮아진 것과 같은 예산으로 더 어려운 작업을 해결하게 된 것이 서로 다른 변화다.

원문은 Artificial Analysis의 품질·비용 파레토 곡선으로 이 주장을 설명한다. 연결된 2025년 말 보고서 역시 같은 지능 수준의 비용 하락과 최전선 모델 가격의 변화를 구분한다. 보고서에는 o1 수준 지능의 혼합 입력·출력 토큰 가격이 128배 하락했다는 지표가 있지만 이것이 모든 작업의 완료 비용이 128배 줄었다는 뜻은 아니다. 작업 구성과 평가 지표, 모델의 추론량을 같게 놓지 않으면 서로 다른 그래프에서 하나의 보편적인 하락률을 뽑기 어렵다.

더 많은 토큰과 더 적은 에너지는 다른 지표다

원문은 GPU 세대교체와 추론 소프트웨어 개선을 비용 하락의 별도 요인으로 다룬다. 추론 엔진은 학습된 모델을 실제 하드웨어에서 실행하는 소프트웨어이며 대규모 배치를 한꺼번에 처리하는 조건과 사용자 요청에 빠르게 응답하는 조건의 효율이 다르다. NVIDIA와 Intel의 소프트웨어 개선 사례도 들지만 처리량 증가가 곧 같은 비율의 전력 절감을 뜻하지는 않는다고 단서를 붙인다. 칩의 연산당 에너지 효율도 서비스 사업자가 청구하는 토큰 가격과는 다른 지표다.

연결된 ML.ENERGY 분석은 Llama 3.1 계열과 H100 하드웨어를 기준으로 vLLM 0.5.4와 0.11.1을 비교한다. 처리량은 3~5배 증가했지만 출력 토큰당 에너지 감소는 15~41%였다. GPU를 더 바쁘게 쓰면서 처리량과 소비 전력이 함께 늘었기 때문이다. 8B와 70B 모델은 동일 조건 비교지만 405B 비교에는 FP8 양자화 변경도 포함돼 있으며 작은 배치에서 개선 폭이 컸다. 측정 구간에 따른 전력 집계 차이도 원자료가 밝힌 한계다.

원문은 작업 비용 100배와 하드웨어 효율 1.3배, 엔진 효율 1.4배를 묶어 약 2.5자릿수의 개선으로 요약한다. 제시된 배율만 곱하면 182배이고 상용로그로 약 2.26자릿수다. 더 중요한 문제는 이미 하드웨어·소프트웨어 개선이 반영된 서비스 가격에 같은 효과를 다시 곱할 수 있다는 점이다. 작업당 비용과 토큰당 에너지의 분모도 다르다. 여러 발전이 함께 일어난다는 설명은 가능하지만 이 곱을 독립적으로 측정된 산업 전체 비용 하락률로 보기는 어렵다.

계산량과 저장 공간을 다르게 줄이는 모델

MoE는 전체 가중치 중 일부 전문가만 활성화해 한 번의 추론에 필요한 계산을 줄인다. 연결된 ICLR 논문 초록은 활성 파라미터 0.85B인 MoE-mini와 6.1B 밀집 모델을 같은 1T 토큰 데이터로 학습해 비교했다고 설명한다. 여기서 작은 수치는 전체 가중치가 모두 그 크기로 줄었다는 뜻이 아니다. 로컬 기기에서는 사용하지 않는 전문가도 저장하거나 필요할 때 불러와야 하므로 계산 절감과 메모리 절감이 똑같이 따라오지 않는다.

긴 문맥에서는 가중치 외에 이전 토큰의 정보를 보관하는 KV 캐시도 부담이 된다. NVIDIA의 Nemotron-H는 많은 자기어텐션 층을 Mamba 층으로 바꿔 생성 중 상태 유지 비용을 줄이는 혼합 구조다. 공식 설명은 Nemotron-H-47B-Base를 FP4로 사용할 때 32GB RTX 5090에서 약 100만 토큰 문맥을 수용하도록 압축했다고 밝힌다. 이는 특정 모델·정밀도·하드웨어의 수용 능력이며 긴 문맥 전체를 정확하게 기억하거나 빠르게 처리한다는 보장은 아니다.

이 대목에서 원문은 비교 모델을 Llama-3.1 60B라고 적지만 연결된 NVIDIA 설명의 비교 대상은 Llama-3.1-70B다. 표기를 조용히 바꾸어 같은 실험으로 취급할 수는 없다. 원문의 메모리 비교 수치를 그대로 일반화하기보다 가중치와 KV 캐시, 양자화 조건을 분리해서 확인할 필요가 있다. 이런 구조 개선은 로컬 실행의 가능성을 넓히지만 현재 최전선 품질이 범용 기기에 언제 도달할지는 별도의 전망이다.

의미 판단이 명령줄 도구 안에 들어갈 때

Jev는 문장을 생성하는 대신 미리 정한 선택지와 확률을 돌려주는 특화 모델의 사례다. TypeSafe의 발표 가격은 입력 100만 토큰당 0.042달러이며 출력은 무료다. 원문은 이 낮은 가격 덕분에 의미 기반 검색을 셸 파이프에 넣는 jgrep이나 댓글을 읽고 PR 우선순위를 정하는 도구가 등장한다고 설명한다. 다만 TypeSafe도 가격에 보조금이 없는지는 장기적인 사업 지속으로 입증해야 한다고 밝힌 만큼 출시 가격을 추론 원가와 동일시할 수 없다.

jyn은 공개 가중치인 Laya를 로컬 특화 판단의 다른 선택지로 소개한다. 직접 구성과 미세조정이 필요하고 짧은 입력에 제약이 있다는 조건도 함께 둔다. 특화 모델이 싸다는 사실은 자유로운 생성과 다단계 추론까지 같은 가격에 해결한다는 뜻은 아니다. 여기서 중요한 변화는 별도 챗봇을 열지 않고도 기존 도구의 한 분기에 의미 판단을 넣을 수 있다는 데 있다.

저자는 모델 호출과 로컬 도구 실행의 전기료를 비교하는 거친 추산도 한다. 100만 토큰당 0.30달러와 턴당 1만 토큰을 가정하면 모델 턴은 0.003달러다. 30W로 30초 실행하는 빌드에 전력 단가 0.25달러/kWh를 적용하면 전기료는 0.00625센트로 계산된다. 이 비교는 실제 기기 측정이나 전체 운영비 산정이 아니며 하드웨어 구입과 유휴 자원, 서비스 운영 비용도 담지 않는다. 모델이 충분히 싸지면 빌드 스케줄러 같은 도구 안에 더 쉽게 들어갈 수 있다는 가능성을 설명하는 사고실험이다.

저렴한 지능이 늘리는 수요와 선택지

jyn은 효율이 높아지면 사용량도 늘어나는 제번스 역설로 다음 변화를 예상한다. 공급자는 같은 투자로 더 많은 추론을 제공할 수 있고 사용자는 이전에 비용 때문에 포기했던 작업에도 모델을 호출하게 된다. 그 결과 토큰이 싸져도 총컴퓨트 수요나 공급자의 매출이 반드시 줄지는 않는다. 어려운 작업은 최전선 연구소의 모델에 비용을 지불하고 일반 작업은 공개 가중치나 저가 서비스로 옮겨 가는 시장도 그의 예상에 포함된다.

수요 증가가 어느 기업의 성공을 보장하는 것은 아니다. 공개 가중치가 최전선 모델의 품질을 따라잡는지에 따라 수익 배분은 달라질 수 있다. 원문은 사이버 공격의 증가와 관리형 보안 서비스의 확대, 알고리즘보다 제품 요구와 테스트·UI 설계가 중요해지는 변화도 가능성으로 든다. 코드베이스만으로 경쟁 우위를 지키기 어려워지고 운영과 보안의 비중이 커질 수 있다는 해석이다. 이런 시장과 일자리의 변화는 관찰이 끝난 결과가 아닌 저자의 시나리오다.

소프트웨어 선택에도 변화가 생긴다. 기존 제품을 쓰거나 포기하거나 경쟁 제품을 고르는 데 더해 AI로 필요한 기능을 직접 만들도록 요청할 수 있다. 사용자가 자신에게 맞게 고치는 소프트웨어의 가능성이 커지지만 만들어진 코드의 품질과 유지보수까지 해결되는 것은 아니다. 규제와 높은 전환 비용이 있는 시장에서는 기존 사업자가 계속 유리할 수 있다는 원문의 단서도 남는다. 싼 지능을 준비한다는 것은 토큰을 많이 쓰는 계획보다 어디에 품질·접근권·운영 부담이 남는지 다시 따지는 일에 가깝다.

참고 자료

jyn — tokens too cheap to meter

Artificial Analysis — State of AI 2025 Year-End Highlights

ML.ENERGY — LLM Inference Energy: A Longitudinal Analysis

NVIDIA — Nemotron-H

ICLR 2026 — Towards Greater Leverage, 논문 초록

TypeSafe — Introducing System One Models & Jev

원문 출처는 본문의 Source에서 확인할 수 있습니다.