Mistral Voxtral vs GPT-4o | 음성 AI 벤치마크

2025년 8월 2일
·
8 min read
·Whisper Notes Team

Mistral이 텍스트 변환과 오디오 이해를 위한 첫 오픈 웨이트 모델 패밀리인 Voxtral을 공개했습니다. 공식 벤치마크는 강력한 다국어 음성 인식과 오디오 Q&A 성능을 보여주지만, 두 모델 크기의 하드웨어 요구사항은 크게 다릅니다. 이번 릴리스가 실제로 지원하는 것이 무엇인지, 그리고 Whisper Notes가 왜 여전히 일반 소비자용 Apple 하드웨어에서 더 작은 텍스트 변환 특화 모델을 사용하는지 살펴봅니다.

Mistral Voxtral 성능 벤치마크

두 가지 모델

Mistral은 2025년 7월에 두 가지 Apache 2.0 체크포인트를 공개했습니다:

Voxtral Small 24B

  • 240억 파라미터
  • 텍스트 변환, 번역, 오디오 Q&A, 요약
  • 32k 컨텍스트 윈도우
  • bf16/fp16 기준 약 55GB의 GPU RAM 필요

Voxtral Mini 3B

  • 30억 파라미터
  • 동일한 오디오+텍스트 작업군을 지원하는 더 작은 체크포인트
  • 공식적으로 로컬 및 엣지 배포용으로 포지셔닝
  • bf16/fp16 기준 약 9.5GB의 GPU RAM 필요

오픈 웨이트와 라이선스

2025년에 공개된 두 체크포인트 모두 Apache 2.0 라이선스의 오픈 웨이트입니다. 직접 다운로드하여 실행할 수 있습니다:

  • 전체 모델 가중치 이용 가능
  • Apache 2.0 라이선스 범위 내에서 자체 호스팅 및 수정 가능
  • 자체 호스팅 시 Mistral API 요금 없음; 컴퓨팅 비용은 직접 부담
  • 자체 서버에서 오디오 처리 가능

출처: Mistral의 Voxtral 릴리스, 공식 Voxtral Small 모델 카드, 공식 Voxtral Mini 모델 카드.

벤치마크

Mistral의 릴리스는 영어 단문·장문 세트, Mozilla Common Voice, FLEURS, Multilingual LibriSpeech에 걸친 매크로 평균 단어 오류율(WER)을 비교합니다. Mistral이 보고한 FLEURS 결과에서 Voxtral Small은 평가된 모든 작업에서 Whisper를 앞섭니다. WER은 낮을수록 좋습니다:

전체 모델에 걸친 Voxtral WER 벤치마크 비교

Mistral의 출시 벤치마크 FLEURS WER을 추정 API 가격과 함께 표시한 그래프; 벤치마크 결과와 가격은 모두 변동될 수 있습니다

FLEURS는 텍스트 변환 품질의 한 단면일 뿐입니다. 이는 벤더가 자체 보고한 결과이므로, 모델을 선택하기 전에 공개된 벤치마크 정의를 비교하고 직접 사용하는 언어, 마이크, 녹음 환경에서 테스트해 보세요.

Voxtral vs Whisper: 무엇을 써야 할까?

벤치마크는 이야기의 일부일 뿐입니다. 실제로 직접 실행하고자 할 때 중요한 요소를 기준으로 두 모델 패밀리를 비교하면 다음과 같습니다:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
언어 주요 8개 언어 주요 8개 언어 100개 이상 100개 이상
오픈소스
모델 크기 24B 파라미터; bf16/fp16 기준 GPU RAM 약 55GB 3B 파라미터; bf16/fp16 기준 GPU RAM 약 9.5GB 1.55B 파라미터 809M 파라미터 (~1.6GB)
일반 소비자용 Mac에서의 실용성 일반적인 하드웨어에서 풀 정밀도로는 불가 호환 런타임이 있으면 가능하나 Turbo보다 무거움

결론: Voxtral Small은 강력한 WER 결과를 보고하며, Whisper가 시도하지 않는 오디오 이해 기능을 더합니다. Voxtral Mini는 Mistral이 로컬 및 엣지 배포용으로 포지셔닝한 체크포인트이지만, 공식 모델 카드에는 여전히 bf16/fp16 기준 약 9.5GB의 GPU RAM이 명시되어 있습니다. 일반 소비자용 텍스트 변환 앱에서는 Whisper Large-v3 Turbo가 여전히 배포하기 쉽고 훨씬 더 많은 언어를 지원합니다. 그래서 Whisper Notes는 현재 Voxtral 대신 Whisper Turbo를 Parakeet V3, SenseVoice와 함께 사용합니다.

API 및 자체 호스팅 비용

2026년 7월 10일 확인 기준, Mistral의 모델 카드에는 Voxtral Small의 오디오 입력이 분당 $0.004로 명시되어 있습니다. 오디오 이해 요청의 경우 텍스트 입력과 생성된 텍스트는 별도로 과금됩니다. Apache 2.0 가중치를 자체 호스팅하면 Mistral API 요금은 없지만, 하드웨어와 운영 비용은 직접 부담합니다.

Mistral API

$0.004
Voxtral Small 오디오 1분당

자체 호스팅 가중치

Apache 2.0
API 요금 없음; 컴퓨팅은 직접 부담

작동 방식

공식 모델 카드는 Voxtral을 오디오 인코더와 전용 텍스트 변환 모드를 갖춘 언어 모델 백본으로 설명합니다. 제품 측면에서 중요한 제한은 다음과 같이 구체적입니다:

1. 멀티모달 아키텍처

Voxtral은 단순한 음성-텍스트 디코더가 아니라, 하나의 대화 안에서 오디오와 텍스트를 함께 받아들입니다:

  • 직접 텍스트 변환을 위한 전용 모드
  • 오디오 Q&A 및 구조화된 요약
  • 다중 오디오 입력과 멀티턴 오디오 대화

장시간 오디오 제한

32k 컨텍스트 윈도우는 텍스트 변환의 경우 최대 30분, 더 넓은 오디오 이해의 경우 최대 40분의 오디오를 지원합니다.

2. 언어와 평가

Mistral은 자동 감지를 지원하는 주요 8개 언어를 명시합니다:

  • 영어, 스페인어, 프랑스어, 포르투갈어, 힌디어, 독일어, 네덜란드어, 이탈리아어
  • 벤치마크에는 FLEURS, Mozilla Common Voice, Multilingual LibriSpeech 포함
  • 릴리스는 영어 단문 및 장문 오디오도 별도로 평가

3. 배포 요구사항

오픈 웨이트라고 해서 모든 체크포인트가 모든 기기에 들어갈 만큼 작은 것은 아닙니다:

  • Voxtral Small은 모델 카드 기준 bf16/fp16에서 약 55GB의 GPU RAM 필요
  • Voxtral Mini는 로컬 및 엣지 배포를 위한 3B 체크포인트
  • Mistral은 공개된 체크포인트 서빙에 vLLM을 권장

4. 주요 기능

맥락 이해

32k 컨텍스트 제한 내에서 오디오로부터 직접 질문에 답하고 요약을 생성할 수 있습니다.

다국어

주요 8개 언어를 자동 감지하고 변환합니다: 영어, 스페인어, 프랑스어, 포르투갈어, 힌디어, 독일어, 네덜란드어, 이탈리아어.

소음 처리

공식 평가에는 다양한 음성 데이터셋이 포함되지만, Mistral은 모든 소음 환경 녹음에 대한 일괄 보증을 공표하지 않습니다.

엣지 배포

Voxtral Mini가 로컬 및 엣지 옵션입니다. 공식 모델 카드에는 bf16/fp16 기준 약 9.5GB의 GPU RAM이 명시되어 있습니다.

5. 아키텍처

세 가지 주요 구성 요소:

  1. 1. 오디오 인코더: 파형을 학습된 오디오 표현으로 변환
  2. 2. 프로젝터: 오디오 표현을 언어 모델의 히든 스페이스로 매핑
  3. 3. 언어 모델 백본: 변환 텍스트, 답변, 요약 또는 도구 호출을 생성

이 설계는 Voxtral이 텍스트 변환 이상의 작업을 할 수 있는 이유를 설명하지만, 동시에 Whisper Turbo 같은 변환 전용 모델보다 훨씬 큰 언어 모델 가중치를 지니게 됩니다.

왜 Whisper Notes가 여전히 합리적인가

Voxtral과 Whisper Notes는 서로 다른 문제를 풉니다. Voxtral은 텍스트 변환에 오디오 이해를 결합하고, Whisper Notes는 일반 소비자용 Apple 하드웨어에서 쉽게 실행되는 프라이빗한 텍스트 변환에 집중합니다.

Whisper Notes가 제공하는 것

프라이버시

성능

  • 검증된 정확도의 Whisper 기술
  • Apple Silicon에 최적화
  • 신뢰할 수 있는 결과

비용

  • 플랫폼당 $6.99 일회성; Mac은 10,000단어 무료 체험 포함
  • 분당 요금 없음
  • 무제한 텍스트 변환

사용자 경험

  • 단순한 인터페이스
  • 정기 업데이트
  • 지속적인 개선

저장 공간 요구사항

Voxtral Small은 풀 정밀도 기준으로 서버급 모델입니다: 공식 카드에는 약 55GB의 GPU RAM이 명시되어 있습니다. Voxtral Mini는 로컬 및 엣지 사용을 위해 설계되었지만, 카드에는 여전히 bf16/fp16 기준 약 9.5GB의 GPU RAM이 명시되어 있습니다. Whisper Turbo의 앱 내 다운로드 용량은 약 1.6GB로, 현재의 Whisper Notes 제품에 더 잘 맞습니다.

Whisper Notes는 Whisper Large-v3 Turbo를 사용합니다—일상적인 사용에 맞춰 성능, 속도, VRAM 요구사항의 균형을 잡은 모델입니다. 합리적인 리소스 요구사항의 더 나은 모델이 나오면 업그레이드할 예정입니다.

오디오 Q&A, 요약, 자체 호스팅 서버 배포가 중요하다면 Voxtral이 매력적입니다. Whisper Notes는 프라이빗한 텍스트 변환과 반복 구독 없는 가격을 원하는 개인 사용자를 위한 앱입니다.

이것이 의미하는 것

Voxtral은 오디오를 변환하는 것을 넘어 오디오에 대해 추론할 수 있다는 점에서, 단순 음성 인식을 넘어선 중요한 오픈 웨이트 진전입니다.

Mac과 iPhone에서의 프라이빗 오프라인 텍스트 변환에는, 더 작은 특화 엔진이 여전히 패키징하기 쉽고 일관되게 실행됩니다.

로컬 옵션을 전부 비교해 보고 싶으신가요? Whisper 계열, Parakeet V3, SenseVoice, Voxtral 등 모든 온디바이스 음성-텍스트 모델을 Whisper 모델 비교 페이지에서 나란히 비교할 수 있습니다.

자주 묻는 질문

Mistral Voxtral이란 무엇인가요?

Voxtral은 음성 텍스트 변환과 오디오 이해를 위한 Mistral의 오픈 웨이트 모델 패밀리입니다. 2025년 7월 릴리스에는 서버급 워크로드용 Voxtral Small 24B와 로컬 및 엣지 배포용 Voxtral Mini 3B가 포함됩니다. 두 체크포인트 모두 Apache 2.0 라이선스입니다.

Voxtral을 Mac에서 로컬로 실행할 수 있나요?

다운로드 가능한 가중치를 자체 호스팅할 수 있지만, 두 크기의 요구사항은 다릅니다. Voxtral Small은 bf16/fp16 기준 약 55GB의 GPU RAM이 필요하므로 서버급 선택지입니다. Voxtral Mini는 로컬 및 엣지용 체크포인트로, 모델 카드에는 bf16/fp16 기준 약 9.5GB가 명시되어 있으며, 실제 Mac에서의 속도와 메모리 사용량은 런타임과 양자화에 따라 달라집니다.

Whisper Notes는 Voxtral을 사용하나요?

아니요. Whisper Notes는 Parakeet V3(Mac 기본), Whisper Large-v3 Turbo, SenseVoice를 실행합니다 — Apple Silicon에서의 일상적인 사용에 맞춰 성능, 속도, VRAM 요구사항의 균형을 이유로 선택된 모델들입니다. 일반 소비자용 하드웨어에서 실용적으로 실행할 수 있는 더 나은 모델이 나오면 언제든 도입할 예정입니다.

Voxtral은 몇 개 언어를 지원하나요?

공식 모델 카드에는 자동 감지를 지원하는 주요 8개 언어가 명시되어 있습니다: 영어, 스페인어, 프랑스어, 포르투갈어, 힌디어, 독일어, 네덜란드어, 이탈리아어. Mistral은 FLEURS에서 아랍어도 평가하지만, 모델 카드의 주요 언어 목록에는 포함되어 있지 않습니다.

Mistral Voxtral은 언제 출시되었나요?

Mistral은 2025년 7월 15일에 Voxtral을 출시했습니다. 최초의 Apache 2.0 체크포인트는 Voxtral Small 24B와 Voxtral Mini 3B였습니다.