Jungseob's Note
포스트
원문 대표 이미지 · Introducing Muse Voice Transcribe

모델이 언제 들을지 스스로 정한다 - 뮤즈 보이스 트랜스크라이브의 적응형 지연

80밀리초 청크마다 계속 들을지 텍스트를 낼지 모델이 스스로 결정하는 스트리밍 음성 인식 구조. 강화학습으로 단어마다 지연을 조절하는 적응형 지연과, 특수 토큰만 더해 화자 분리와 종점 검출을 얹은 설계를 정리했다.

모델이 언제 들을지 스스로 정한다 - 뮤즈 보이스 트랜스크라이브의 적응형 지연

모델이 언제 들을지 스스로 정한다

TL;DR

  • 발표의 위치가 먼저 규정되는데 메타 초지능 연구소가 개발한 첫 실시간 오디오 지각 모델이고 실시간 음성 모델을 사용자에게 가져오는 첫 이정표라는 것이다. 기능도 한 문장에 담긴다. 스트리밍 음성 인식과 화자 20명 이상 분리, 종점 검출을 제공하며, 매끄러운 코드 스위칭이 되는 다국어이고 언어와 키워드, 맥락 바이어싱으로 정확도를 높인다.
  • 구조의 핵심은 결정권이 모델에 있다는 점인데 오디오가 80밀리초 청크로 처리되어 각각 하나의 소프트 토큰이 되고, 매 청크에서 모델이 다음 청크를 계속 들을지 텍스트 토큰을 낼지 결정한다. 계속 듣기로 하면 특수 토큰을 예측하고 그 자리를 다음 청크로 대체하며, 스트림이 끝나면 빈 오디오 토큰을 넣어 더 이상 청크가 없음을 알린다.
  • 정확도와 지연의 거래가 명시되는데 모델이 언제 들을지 완전히 통제하므로 단어를 전사하기 전 오디오 맥락의 양을 스스로 정하고 이것을 지연이라 부르며 오래 기다릴수록 전사는 정확해지지만 지연은 커진다. 그래서 해법이 나온다. 적응형 지연으로 단어마다 난이도에 따라 지연을 동적으로 바꾸며, 단어 오류율 보상과 지연 보상을 곱셈으로 결합한 강화학습으로 구현했다.
  • 확장 방식이 놀랍도록 단순한데 스트리밍 음성 인식을 기반으로 두면 특수 토큰을 추가하는 것만으로 다른 오디오 지각 과제를 쉽게 지원할 수 있다는 것이다. 화자 분리는 턴 시작 토큰으로 화자 전환 지점을 표시하고 화자 태그로 구분하며 종점 검출은 발화 시작 토큰과 발화 종점 토큰을 쓰는데, 세 과제를 함께 훈련하고 각각에 보상을 더한다.
  • 성능과 범위가 수치로 제시되는데 70개 이상 언어로 훈련했고 그중 25개를 광범위하게 검증했으며 한 시간을 넘는 긴 오디오와 화자 20명 이상을 후처리 없이 기본 지원한다. 순위 주장도 붙는다. 스트리밍 음성 텍스트 변환과 공개 화자 분리 벤치마크에서 1위이고 적응형 지연으로 최종 전사까지의 시간으로 측정한 속도와 정확도 거래의 파레토 프런티어를 달성한다.

Source

Introducing Muse Voice Transcribe — Meta Superintelligence Labs, 2026년 9월 1일, 4분 분량

[research.meta.ai/blog/introducing-muse-voice-transcribe](https://research.meta.ai/blog/introducing-muse-voice-transcribe)

Knowledge

첫 실시간 오디오 지각 모델

발표는 위치 규정으로 시작한다. 뮤즈 보이스 트랜스크라이브가 메타 초지능 연구소가 개발한 첫 실시간 오디오 지각 모델이라는 것이다. 그리고 성격이 이정표로 표현된다. 실시간 음성 모델을 사용자에게 가져오는 첫 이정표를 표시한다는 것이다.

기능이 한 문단에 압축된다. 실시간 스트리밍 음성 인식과 화자 20명 이상의 분리, 종점 검출을 제공한다. 다국어이며 매끄러운 코드 스위칭이 되고 언어와 키워드, 맥락 바이어싱으로 정확도를 개선한다.

순위 주장도 명시된다. 스트리밍 음성 텍스트 변환에서 아티피셜 어낼리시스 순위와 공개 화자 분리 벤치마크에서 1위라는 것이다. 다만 조건을 단다. 모델 포함 범위와 순위는 2026년 9월 1일 기준이라는 것이다.

발표 형식 자체가 시연을 겸한다. 페이지 상단에 마이크로 말한 것을 실시간으로 전사하는 데모가 걸려 있고 전사본이 AI로 생성돼 부정확할 수 있다는 안내와 함께 오디오가 전사본 생성에만 처리되고 저장되지 않는다는 설명이 붙는다.

그리고 도입부 자체가 여덟 명이 한 방에서 나눈 실제 대화의 전사본으로 제시된다. 화면에 보이는 것이 실시간이고 여덟 명이 한 방에서 이야기하는데 누가 무엇을 말했는지 정확히 안다는 발언이 그 안에 들어 있다. 화자 분리에 여덟 명이 가장 어려운 시험인데 모두를 실시간으로 추적한다는 언급도 나온다.

이 대화가 제품의 명분도 함께 전달한다. 저커버그가 쓴 글에서 AI 미래는 모두를 위한 것이라는 문장을 인용하며 초지능이 존재할지가 아니라 누가 그것에 접근할지가 문제라고 말한다. 그리고 논지가 이어진다. 모두에게 동시에 정렬되려 하는 단일 중앙집중 초지능일 수 없고 모든 사람을 위한 개인 초지능이어야 한다는 것이다. 그래서 조건이 도출된다. 개인적인 것이 되려면 음성 명령이 아니라 실제 대화에서 AI 안경 위에서 사람처럼 들어야 한다는 것이다. 그리고 실제 대화의 성질이 지목된다. 겹침과 끼어들기, 억양이 있어 지저분하고 그래서 스트리밍 종점 검출과 화자 분리가 그토록 중요하다는 것이다.

명분이 세 아이디어로 정리되기도 한다. 개인의 역량 강화가 번영을 이끌고 발명이 주된 목적이며 힘의 균형이 안전의 기초라는 것이다. 그리고 음성 인식이 그 셋 모두의 기초라고 말한다.

다국어 필요성도 대화 안에서 논증된다. 영어만 알아들으면 어떻게 모두를 위한 것이라 하겠느냐는 것이고 자기 어머니가 평소 중국어와 영어를 섞어 쓰며 내일 아침 아홉 시에 진료 예약이 있으니 깨워 달라는 식으로 말한다는 예가 붙는다. 그래서 한 문장 안의 매끄러운 코드 스위칭이 타협 불가라는 결론이 나온다. 그리고 맥락 바이어싱의 역할도 설명된다. 메타나 뮤즈, 멘로파크라고 말할 때 그것이 사용자의 세계를 알기 때문에 제대로 알아듣는다는 것이다. 연락처와 키워드, 장소를 알아야 자기 것이 된다는 발언이 이어진다.

80밀리초마다 내리는 결정

기술 설명은 계보부터 시작한다. 뮤즈 보이스 트랜스크라이브가 뮤즈 스파크 계열의 자기회귀 멀티모달 모델이라는 것이다.

처리 단위가 구체적이다. 오디오가 80밀리초 청크로 처리되고 이것은 12.5헤르츠에 해당하며 각 청크가 하나의 소프트 토큰으로 변환된다는 것이다.

그리고 이 모델의 핵심 설계가 나온다. 매 오디오 청크에서 모델이 다음 오디오 청크를 계속 들을지, 아니면 텍스트 토큰을 낼지 결정한다는 것이다. 계속 듣기로 결정하면 다음 오디오 특수 토큰을 예측하고 그 특수 토큰을 다음 입력을 위한 실제 오디오 청크로 대체한다.

종료 처리도 특수 토큰으로 한다. 오디오 스트림이 멈추면 빈 오디오 특수 토큰을 넣어 더 이상 오디오 청크가 없음을 모델에 알린다는 것이다. 그러면 모델은 빈 오디오 토큰을 본 뒤에 다음 오디오 토큰을 더 만들지 않고 남은 텍스트 토큰을 전부 내보낸다.

지연을 단어마다 다르게 준다

이 구조에서 따라 나오는 성질이 지연이다. 모델이 언제 들을지 완전히 통제하므로, 단어를 전사하기 전에 오디오 맥락을 얼마나 쓸지 스스로 결정한다는 것이고 이것을 지연이라고 부른다.

거래 관계가 명확하게 서술된다. 정확도와 지연 사이에 거래가 있고 모델이 예측하기까지 오래 기다릴수록 전사는 더 정확해지지만 지연은 더 커진다는 것이다.

그래서 해법이 적응형 지연이다. 단어마다 난이도에 기반해 지연을 동적으로 바꾼다는 것이다. 구현 방법도 밝힌다. 강화학습으로 가능해졌고 단어 오류율 보상과 지연 보상을 곱셈으로 결합했다는 것이다.

결과가 파레토 프런티어로 제시된다. 적응형 지연으로 최종 전사까지의 시간으로 측정한 속도와 정확도 거래에서 파레토 프런티어를 달성한다는 것이다.

특수 토큰만 더해 과제를 얹는다

확장 방식이 이 발표에서 가장 인상적인 부분이다. 스트리밍 음성 인식을 기반으로 두면 특수 토큰을 도입하는 것만으로 다른 오디오 지각 과제를 쉽게 지원할 수 있다는 것이다.

화자 분리의 방식이 구체적이다. 잠재적 화자 전환을 표시하는 턴 시작 토큰과 화자를 구분하는 A부터 Z까지의 화자 태그를 도입한다. 타이밍이 다르다는 점이 중요하다. 턴 시작 토큰은 화자가 전환되는 즉시 예측되고 화자 태그 예측은 청크 끝으로 지연된다는 것이다. 그리고 같은 화자의 오디오도 턴 시작 토큰으로 분할될 수 있지만 그 분절들의 화자 태그는 모두 같다고 설명한다.

예시 토큰 시퀀스가 그대로 제시된다. 안녕, 어떻게 지내는지 묻는 발화에 화자 A 태그가 붙고 주말에 재미있는 일이 있었는지 묻는 발화에도 화자 A가 붙고 잘 지낸다는 응답에 화자 B가 붙는 식이다. 설명 편의를 위해 다음 오디오 토큰은 생략했다고 밝힌다.

종점 검출도 같은 방식이다. 발화의 시작을 표시하는 발화 시작 토큰과 사용자가 말을 마쳤을 때를 표시하는 발화 종점 토큰을 도입한다는 것이다. 예시도 나온다. 메타야, 멘로파크 날씨가 어떠냐는 발화가 시작 토큰과 종점 토큰으로 감싸이고 침묵 뒤에 오늘 무엇을 입어야 하느냐는 발화가 다시 같은 방식으로 감싸인다.

훈련 방식도 명시된다. 두 과제를 스트리밍 음성 인식과 함께 훈련하고 음성 인식 보상 위에 화자 분리와 종점 검출 각각에 대한 추가 보상을 더한다는 것이다.

언어와 코드 스위칭, 그리고 한 시간

언어 범위가 수치로 제시된다. 70개 이상 언어로 훈련했고 그중 25개를 광범위하게 검증했다는 것이다. 그래서 초기 배포에서는 검증된 25개 언어를 시험해 보기를 권하며 추가 언어 지원도 가능하다고 밝힌다. 예시로 든 언어는 중국어와 프랑스어, 힌디어, 일본어, 스페인어, 베트남어다.

데모 문장이 실제로 어려운 것들이다. 중국어 예시는 이번 달에 헬스장을 열두 번 갔고 체중이 78.5킬로그램에서 75킬로그램으로 떨어졌으며 체지방률도 2.5퍼센트 줄었다는 내용이다. 오늘 아침 5킬로미터를 28분에 뛰었고 평균 심박수가 145였다는 숫자들이 이어진다. 프랑스어 예시는 미국 50개 주를 알파벳 순서로 외우는 중이고 A로 시작하는 주가 넷, C로 시작하는 주가 셋이라는 내용이다.

코드 스위칭에 대한 설명은 전제부터 시작한다. 코드 스위칭이 이중 언어 사용자에게 매우 흔하다는 것이다. 그리고 지원 범위가 규정된다. 문장 안이든 문장 사이든 임의의 코드 스위칭을 기본으로 지원한다는 것이고 해당 오디오 클립에서는 맥락 바이어싱도 함께 써서 인식 정확도를 더 높였다고 밝힌다.

코드 스위칭 데모가 특히 까다로운 예시다. 어제 로컬 데스크톱에서 올라마로 메타의 뮤즈 글리머를 돌려 엔비디아 RTX 3090에 바로 배포했고 설정이 매끄러웠다는 내용으로 시작한다. 양자화한 4비트 GGUF를 24기가바이트 GDDR6X VRAM에 적재하는 데 전혀 무리가 없었고 DFlash와 함께 추측 디코딩을 돌리니 토큰 생성 처리량이 매끄러웠다는 것이다. 그런데 유일한 걱정이 전력 소비였다고 이어진다. 다중 턴 에이전틱 워크플로를 돌릴 때 보드 전력이 거의 350와트 열설계전력을 꽉 채워 돌았고 와트와 열이 좀 높이 치솟았으며 장기간 데몬으로 돌리면 전기료와 발열이 만만치 않게 느껴진다는 것이다. 중국어 문장 안에 영어 기술 용어가 촘촘히 박힌 구성이다.

긴 맥락 처리도 수치로 제시된다. 한 시간을 넘는 긴 오디오 입력과 화자 20명 이상을 기본으로 지원하며 후처리가 필요하지 않다는 것이다. 데모로 걸린 장시간 대화는 1시간 52초 길이이고 화자 A부터 K까지 열한 명이 표시된다.

그 장시간 데모의 내용 자체가 이 모델이 다루려는 문제를 보여 준다. 로스앤젤레스의 러니언 캐니언 화장실이 얼마나 좋은지, 국립공원 같다는 이야기, 뉴스에서 큰돈을 썼다고 들었다는 이야기, 개를 매일 산책시키는 곳이라는 이야기가 여러 사람이 겹쳐 말하는 형태로 이어진다. 스키의 난이도 코스에 비유하는 대목과 포장된 길에서 하이힐을 신고 걷는 사람을 봤다는 대목처럼, 짧은 맞장구와 끼어들기가 촘촘히 섞인다.

어디서 쓸 수 있는가

적용 범위가 마지막에 정리된다. 클릭 한 번으로 메타 AI와 뮤즈 코드 전반의 음성 받아쓰기가 이제 뮤즈 보이스 트랜스크라이브로 구동된다는 것이다. 그리고 사용 방식이 구체적이다. 어떤 애플리케이션과도 쓸 수 있고 메타 AI와 화면의 어떤 창에서든 작업을 처리할 수 있으며 Fn 키를 누르고 있으면 시험해 볼 수 있다는 것이다.

가용 경로는 셋으로 제시된다. 메타 모델 API와 맥용 메타 AI, 그리고 뮤즈 코드에서 오늘부터 쓸 수 있다는 것이다.

더 생각해보기

  • 모델이 언제 들을지 스스로 결정하는 구조는 기존 고정 청크 스트리밍 방식과 비교해 어떤 실패 양상을 새로 만드는가.
  • 단어 오류율 보상과 지연 보상을 곱셈으로 결합한 선택은 덧셈 결합과 어떻게 다른 행동을 낳는가.
  • 특수 토큰 추가만으로 화자 분리와 종점 검출을 얹을 수 있다면, 다른 오디오 지각 과제는 어디까지 같은 방식으로 확장되는가.
  • 화자 태그 예측을 청크 끝으로 지연시키는 설계는 실시간성 체감에 어떤 영향을 주는가.
  • 70개 언어로 훈련하고 25개만 검증했다는 구분은 나머지 언어 사용자에게 실제로 무엇을 뜻하는가.
  • 맥락 바이어싱이 사용자의 연락처와 장소를 알아야 작동한다면, 프라이버시 경계는 어디에 그어져야 하는가.
  • 한 시간 넘는 오디오와 화자 20명을 후처리 없이 처리한다는 주장은 실제 회의록 작성 워크플로를 어떻게 바꾸는가.
  • 개인 초지능이라는 명분과 실시간 음성 인식이라는 기술 사이의 연결은 필연적인가, 아니면 사후 정당화인가.
  • AI 안경에서 상시 듣는 형태가 전제라면, 대화 상대의 동의는 어떤 방식으로 처리돼야 하는가.
원문 출처는 본문의 Source에서 확인할 수 있습니다.