Jungseob's Note
포스트
원문 대표 이미지 · Mistral Large 4 발표

1조 파라미터 오픈 웨이트를 유럽에서 처음부터 학습했다, Mistral Large 4 공개 프리뷰가 내세우는 것과 아직 검증할 수 없는 것

Mistral이 공개 프리뷰로 내놓은 Mistral Large 4(ML4)의 규모, 사이버보안·코딩·에이전트·멀티모달 벤치마크 주장, RL 학습 설명, 가격을 정리하고 자사 발표라는 한계와 문서 간 표기 차이를 짚는다.

1조 파라미터 오픈 웨이트를 유럽에서 처음부터 학습했다, Mistral Large 4 공개 프리뷰가 내세우는 것과 아직 검증할 수 없는 것

TL;DR

  • Mistral은 10월 6일 Mistral Large 4(ML4)를 공개 프리뷰로 내놓았고 가중치는 이달 말에 공개한다고 밝혔다. 발표문은 1조 파라미터, 활성 490억의 멀티모달 전문가 혼합(MoE) 모델이며 유럽 자체 데이터센터의 NVIDIA GPU 3,800장으로 처음부터 학습했다고 설명한다.
  • 강조점은 사이버보안이다. Artificial Analysis Cyber Index 상위 5위, 취약점 재현 후 패치 테스트 82%, Cybench 93%를 내세우고 일부 폐쇄형 모델은 거절 탓에 0점에 가깝다고 주장한다.
  • 코딩은 DeepSWE v1.1 61.7%, Terminal-Bench 4 28.3%이고, 사람 평가에서 5개 모델 중 2위(3.74점)로 Claude Opus 5(4.22)에 뒤진다.
  • 가격은 입력 100만 토큰당 1.36달러, 출력 4.18달러이고 컨텍스트는 1M이다.
  • 모든 수치는 Mistral 자사 발표이고 대부분 차트 이미지로 제시되어 이 노트에서 재현하지 못했다.

무엇이 공개되었나

발표문에 따르면 ML4의 비공식 이름은 “le Chonk”이다. 오늘 공개된 것은 공개 프리뷰이고 Mistral Studio에서 프리뷰 API를 쓸 수 있으며 가중치는 이달 말에 풀린다. 그때까지 사이버보안 리더와 검증된 파트너, 정부 기관이 완화된 중재와 확장된 사이버 기능을 가진 같은 모델로 레드팀 검증을 하고 있다고 한다. 아키텍처와 추가 벤치마크, 후학습 방법론도 가중치 공개 때 함께 밝히겠다고 약속한다.

규모 표기는 두 문서가 다르다. 발표문은 1조 파라미터에 활성 490억이라 하고 공식 모델 문서는 총 1.05T, 활성 52B에 1.6B 비전 인코더를 별도로 적는다. 비전 인코더 등을 합친 수치일 가능성이 있지만 어느 쪽이 기준인지 문서는 설명하지 않는다. 이 문서는 컨텍스트 1M, 구조화 출력과 함수 호출, 문서 QnA, 배치 API, 내장 도구를 지원한다고 표시한다.

학습 인프라에 대한 주장은 분명하다. NVIDIA Grace Blackwell GPU 3,800장을 쓴 Mistral 자체 유럽 데이터센터에서 처음부터 학습했고 프리뷰도 같은 인프라에서 서비스한다. 학습 데이터의 상당 부분은 다국어이며 EU 공식 언어를 모두 포함한 160개 이상 언어를 다룬다고 한다. 회사는 이를 AI 주권과 연결해, 다른 디지털 서비스 제공자와 무관하게 유럽 법 아래에서 Mistral이 끝까지 운영하는 유럽 배포가 제공된다고 소개한다.

사이버보안, 발표의 중심축

발표문이 가장 길게 다루는 영역이다. 주장은 세 가지다. Artificial Analysis Cyber Index에서 전 세계 상위 5위이고 중국 밖에서 개발된 오픈 웨이트 모델 중에서는 큰 차이로 1위라는 것, 실제 오픈소스 취약점을 재현한 뒤 패치하는 테스트에서 82%로 모든 모델 중 최고라는 것, 보안 대회 문제 40개로 이뤄진 Cybench에서 93%를 풀어 오픈 웨이트 모델로는 손꼽히는 점수라는 것이다.

여기서 눈여겨볼 대목은 비교의 성격이다. 발표문은 Claude Opus 5.5와 GPT-6 Astra 같은 폐쇄형 모델이 같은 테스트에서 0에 가까운 점수를 받은 이유가 능력이 아니라 작업 거절이라고 설명한다. 방어는 취약점이 실제임을 증명하는 데서 시작하는데 안전 필터가 그 작업을 막는다는 논리다. 위협 행위자가 같은 폐쇄형 모델을 탈옥해 공격에 쓴다는 점도 근거로 든다. 이 논리는 그럴듯하지만 두 가지는 분리해서 읽어야 한다. 거절이 점수를 깎았다는 설명은 Mistral의 해석이고 공격 능력이 큰 모델을 오픈 웨이트로 푸는 것의 위험에 대한 논의는 발표문에 없다.

같은 발표문이 안전성 지표도 내놓는다. Lakera의 B3 AI 보안 벤치마크에서 공격의 93.3%를 막아 경쟁 모델 중 더 높은 점수가 없다고 하고 KORA 벤치마크에서는 Mistral이 측정한 오픈 웨이트 최고인 1.691점(만점 2)이라고 한다. 사이버 프롬프트에 대한 평균 거절률도 JailbreakBench, StrongREJECT, AgentHarm 기준으로 모든 오픈 웨이트 모델보다 높다고 밝힌다. 능력은 높이고 악의적 요청은 거절한다는 양쪽 주장이 함께 나오는데, 두 주장을 어떻게 양립시켰는지는 설명되지 않는다.

코딩, 에이전트, 멀티모달, 지식 노동

코딩에서는 DeepSWE v1.1 61.7%, SWE-Atlas-QnA 59.4%, Terminal-Bench 4 28.3%를 제시하고 종합 Coding Agent Index 49.8%가 DeepSeek V4 Pro 0813과 Qwen3.8 Max를 앞선다고 말한다. Surge AI와 한 블라인드 사람 평가에서는 전문 평가자가 1~5점으로 매긴 결과 5개 모델 중 2위(3.74)였다. Kimi K3(3.59), GLM-5.3(3.60), GLM-5.2(3.40)를 앞서고 Claude Opus 5(4.22)에게만 밀렸다. 자기 모델이 1위가 아니라는 사실을 숨기지 않은 대목이다.

에이전트 업무로는 Gmail, Google Sheets, Slack, Salesforce 같은 앱의 비즈니스 워크플로 657개로 이뤄진 AutomationBench에서 59.9%를 얻어 Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro를 앞선다고 한다. 장기 지식 노동을 재는 AA-Briefcase는 1,393 Elo로 DeepSeek V4 Pro보다 높다. 멀티모달은 복잡한 문서와 차트, 자연 이미지를 이해하는 능력이 크게 올랐다고 하며 시각적 위치 지정(grounding)의 Dense 200에서 GPT-6-Astra를 42% 대 41%로 근소하게 앞선다. 그 밖에 기가픽셀 위성 영상 탐색이나 공학 도면 검증 같은 에이전트형 시각 작업을 데모로 든다.

지식 노동에서는 vals.ai 같은 제3자 평가로 법률과 금융 과제에서 GPT-6-Astra를 넘었다고 말하고 HarveyAI의 Legal Agent 벤치마크에서는 모든 오픈소스 모델보다 낫다고 한다. 과학과 수학은 SciCode-Verified에서 오픈 웨이트 최고 수준이라 하고 하트리-폭 시뮬레이션을 한 번에 생성한 사례를 든다. 내부 전문가 평가에서는 GLM-5.3과 비교해 CAD와 STEM에서 선호되었고 금융과 코딩에서는 비슷했다. 이 비교는 내부 평가이므로 평가자 구성이나 표본 규모가 공개되지 않은 점을 감안해야 한다.

강화학습 설명

후학습 부분은 기술 설명이 가장 구체적이다. 기본 모델이 빠르게 좋아지면 어제 맞춘 레시피가 오늘 모델의 능력을 남기므로, 모델 자신의 시도 결과로 학습하고 과제 난도를 올릴 수 있는 RL을 택했다고 설명한다. RL 라이브러리는 환경을 쉽게 추가하도록 설계되어, 단일 턴 대화부터 과학 문제 풀이, 안전 정렬, 사실성, 장기 도구 사용까지 한 번의 학습에 섞는다. 검증도 보상 모델, 단위 테스트, LLM 판정자, 정적 검사를 과제별로 조합한다.

운영 규모로는 자동 확장되는 액터 군이 수만 개의 롤아웃을 병렬로 생성하고 학습이 비동기로 진행되며 여러 번의 압축을 거쳐 수백만 토큰 규모의 롤아웃 예산을 지원한다고 한다. 현재 규모(GPU 약 3,000장)에서 학습 한 번이 하루 약 330억 토큰을 만들고 필터링과 마스킹 뒤 학습 가능한 완성 토큰은 약 160억이라고 밝힌다. 학습 보상 곡선이 오르고 그 개선이 학습하지 않은 평가로 이전된다는 차트도 있으나 이 노트에서는 차트 수치를 읽지 못했다.

가격과 로드맵

공식 문서의 가격은 입력 100만 토큰당 1.36달러, 캐시 입력 0.14달러, 출력 4.18달러이다. 표에는 이 절반 값(0.68, 0.07, 2.09달러)이 함께 나오는데 열 제목이 잘려 있어 배치 할인 가격으로 보이지만 문서가 명시하지는 않는다. 발표문은 ML4가 유럽 기업 사상 최대 규모라는 30억 유로 시리즈 D로 조달한 자금의 첫 결과물이라고 밝히고 유럽 데이터센터의 컴퓨트를 크게 늘리는 중이라고 한다. RL 학습이 아직 진행 중이고 포화 신호가 없어 몇 주에서 몇 달 안에 큰 개선이 있을 것이라는 전망도 적었다. ML4는 산업별로 특화한 새 세대 모델의 기반이 된다고도 한다.

읽을 때 유의할 점

첫째, 모든 수치는 Mistral이 자기 발표문에서 선택해 보여 준 것이다. 벤치마크 대부분이 차트 이미지로만 제시되어 이 노트에서 숫자를 재현하지 못했고 가중치가 아직 공개되지 않아 제3자가 직접 검증할 수도 없다. 둘째, “미국이나 유럽의 어떤 오픈 웨이트 모델보다 크게 앞선다”는 표현은 비교 대상이 오픈 웨이트로 한정되고 폐쇄형 모델과의 비교는 사이버 거절 테스트와 시각 grounding 일부에 국한된다. 셋째, 사이버 테스트에서 경쟁 모델이 0점에 가까운 이유는 거절로 설명되는데, 같은 조건의 비거절 성능 비교는 없다. 넷째, 프리뷰이므로 가중치 공개 시점의 모델과 같다는 보장은 없다.

그럼에도 발표가 던지는 질문은 분명하다. 방어 측에 더 자유로운 모델이 필요하다는 주장과, 그 자유가 공격에도 열린다는 우려 사이에서 오픈 웨이트는 어디까지 허용되어야 하는가. 가중치가 이달 말 실제로 풀린 뒤 독립 벤치마크가 나오면 이 글의 주장 중 어느 부분이 유지되는지 다시 확인해야 한다.

참고 자료

Mistral AI — Introducing Mistral Large 4 — 발표문 본문 전체를 읽고 정리했다. 차트와 데모는 이미지라 본문에 적힌 수치만 옮겼다.

Mistral Docs — Mistral Large 4 — 규모, 컨텍스트, 가격, 지원 기능을 대조했다. 발표문과 파라미터 표기가 다르다.

원문 출처는 본문의 Source에서 확인할 수 있습니다.