Mistral Voxtral vs GPT-4o | Benchmark d'IA de Veu

2 d’agost de 2025
·
8 min read
·Whisper Notes Team

Mistral ha publicat Voxtral, la seva primera família de models de pesos oberts per a la transcripció i la comprensió d'àudio. Els benchmarks oficials mostren un reconeixement de veu multilingüe potent i bones capacitats de preguntes i respostes sobre àudio, però les dues mides del model tenen requisits de maquinari molt diferents. Això és el que realment ofereix aquest llançament i per què Whisper Notes continua fent servir models més petits, centrats en la transcripció, en maquinari Apple de consum.

Benchmarks de rendiment de Mistral Voxtral

Dos models

El juliol de 2025, Mistral va publicar dos checkpoints amb llicència Apache 2.0:

Voxtral Small 24B

  • 24.000 milions de paràmetres
  • Transcripció, traducció, preguntes i respostes sobre àudio i resums
  • Finestra de context de 32k
  • Uns 55 GB de RAM de GPU en bf16/fp16

Voxtral Mini 3B

  • 3.000 milions de paràmetres
  • La mateixa família de tasques d'àudio i text en un checkpoint més petit
  • Posicionat oficialment per al desplegament local i a l'edge
  • Uns 9,5 GB de RAM de GPU en bf16/fp16

Pesos oberts i llicència

Tots dos checkpoints del 2025 són de pesos oberts amb llicència Apache 2.0. Podeu descarregar-los i executar-los pel vostre compte:

  • Pesos complets del model disponibles
  • Podeu allotjar-los o adaptar-los dins dels termes de la llicència Apache 2.0
  • Cap quota de l'API de Mistral si els allotgeu vosaltres; el còmput continua anant al vostre càrrec
  • Processeu l'àudio als vostres propis servidors

Fonts: l'anunci de Voxtral de Mistral, la model card oficial de Voxtral Small i la model card oficial de Voxtral Mini.

Benchmarks

El llançament de Mistral compara la taxa d'error de paraula (WER) en macromitjana en conjunts anglesos de format curt i llarg, Mozilla Common Voice, FLEURS i Multilingual LibriSpeech. En els resultats de FLEURS que reporta Mistral, Voxtral Small supera Whisper en totes les tasques avaluades. Com més baix és el WER, millor:

Comparació de benchmarks WER de Voxtral amb tots els models

WER de FLEURS dels benchmarks de llançament de Mistral, representat en funció del preu estimat de l'API; tant els resultats dels benchmarks com els preus poden canviar

FLEURS només és una part de la qualitat de transcripció. Són resultats reportats pel mateix proveïdor: compareu les definicions publicades dels benchmarks i proveu les vostres llengües, micròfons i condicions d'enregistrament abans de triar un model.

Voxtral o Whisper: quin hauríeu de fer servir?

Els benchmarks només expliquen una part de la història. Així es comparen les dues famílies de models en els factors que compten si realment en voleu executar un pel vostre compte:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
Llengües 8 llengües principals 8 llengües principals Més de 100 Més de 100
Codi obert
Mida del model 24B de paràmetres; ~55 GB de RAM de GPU en bf16/fp16 3B de paràmetres; ~9,5 GB de RAM de GPU en bf16/fp16 1,55B de paràmetres 809M de paràmetres (~1,6 GB)
Pràctic en un Mac de consum No en precisió completa en maquinari típic Possible amb un runtime compatible; més pesant que Turbo

El veredicte: Voxtral Small reporta uns resultats de WER molt bons i afegeix una comprensió d'àudio que Whisper ni tan sols intenta. Voxtral Mini és el checkpoint que Mistral posiciona per al desplegament local i a l'edge, però la seva model card oficial encara indica uns 9,5 GB de RAM de GPU en bf16/fp16. Per a una app de transcripció de consum, Whisper Large-v3 Turbo continua sent més fàcil de distribuir i cobreix moltes més llengües. Per això Whisper Notes actualment combina Whisper Turbo amb Parakeet V3 i SenseVoice en lloc de Voxtral.

Cost de l'API i de l'autoallotjament

Segons la comprovació feta el 10 de juliol de 2026, la model card de Mistral indica per a Voxtral Small una entrada d'àudio a $0.004 per minut. En les peticions de comprensió d'àudio, l'entrada de text i el text generat es facturen per separat. Si allotgeu vosaltres mateixos els pesos Apache 2.0, no hi ha cap càrrec de l'API de Mistral, però pagueu el maquinari i les operacions.

API de Mistral

$0.004
per minut d'àudio amb Voxtral Small

Pesos autoallotjats

Apache 2.0
sense quota d'API; el còmput va al vostre càrrec

Com funciona

La model card oficial descriu Voxtral com un model de llenguatge de base amb un codificador d'àudio i un mode de transcripció dedicat. Els límits de producte que importen són concrets:

1. Arquitectura multimodal

Voxtral accepta àudio i text dins la mateixa conversa, en lloc d'actuar només com un descodificador de veu a text:

  • Mode dedicat per a la transcripció directa
  • Preguntes i respostes sobre àudio i resums estructurats
  • Diverses entrades d'àudio i converses d'àudio amb múltiples torns

Límit de format llarg

La finestra de context de 32k admet fins a 30 minuts d'àudio per a la transcripció o 40 minuts per a la comprensió d'àudio més àmplia.

2. Llengües i avaluació

Mistral enumera vuit llengües principals amb detecció automàtica:

  • Anglès, espanyol, francès, portuguès, hindi, alemany, neerlandès i italià
  • Els benchmarks inclouen FLEURS, Mozilla Common Voice i Multilingual LibriSpeech
  • El llançament també avalua per separat l'àudio anglès de format curt i de format llarg

3. Requisits de desplegament

Que els pesos siguin oberts no vol dir que cada checkpoint sigui prou petit per a qualsevol dispositiu:

  • Voxtral Small requereix uns 55 GB de RAM de GPU en bf16/fp16 segons la seva model card
  • Voxtral Mini és el checkpoint de 3B pensat per al desplegament local i a l'edge
  • Mistral recomana vLLM per servir els checkpoints publicats

4. Característiques principals

Comprensió contextual

Pot respondre preguntes i generar resums directament a partir de l'àudio, dins del límit de context de 32k.

Multilingüe

Detecta i transcriu automàticament vuit llengües principals: anglès, espanyol, francès, portuguès, hindi, alemany, neerlandès i italià.

Gestió del soroll

L'avaluació oficial inclou conjunts de dades de veu variats, però Mistral no publica cap garantia general per a qualsevol enregistrament amb soroll.

Desplegament a l'edge

Voxtral Mini és l'opció local i d'edge. La seva model card oficial indica uns 9,5 GB de RAM de GPU en bf16/fp16.

5. Arquitectura

Tres components principals:

  1. 1. Codificador d'àudio: converteix la forma d'ona en representacions d'àudio apreses
  2. 2. Projector: projecta les representacions d'àudio a l'espai ocult del model de llenguatge
  3. 3. Model de llenguatge de base: genera transcripcions, respostes, resums o crides a eines

Aquest disseny explica per què Voxtral pot fer més coses que transcriure, però també implica uns pesos de model de llenguatge molt més grans que un model dedicat només a la transcripció com Whisper Turbo.

Per què Whisper Notes continua tenint sentit

Voxtral i Whisper Notes resolen problemes diferents. Voxtral combina la transcripció amb la comprensió d'àudio; Whisper Notes se centra en la transcripció privada, fàcil d'executar en maquinari Apple de consum.

Què ofereix Whisper Notes

Privadesa

Rendiment

  • Tecnologia Whisper, precisió provada
  • Optimitzat per a Apple Silicon
  • Resultats fiables

Cost

  • $6.99 un sol pagament per plataforma; el Mac inclou una prova gratuïta de 10.000 paraules
  • Sense càrrecs per minut
  • Transcripció il·limitada

Experiència d'ús

  • Interfície senzilla
  • Actualitzacions regulars
  • Millores contínues

Requisits d'emmagatzematge

Voxtral Small en precisió completa és un model de classe servidor: la seva fitxa oficial indica uns 55 GB de RAM de GPU. Voxtral Mini està pensat específicament per a l'ús local i a l'edge, però la seva fitxa encara indica uns 9,5 GB de RAM de GPU en bf16/fp16. La descàrrega de Whisper Turbo dins l'app és d'aproximadament 1,6 GB, una mida que s'ajusta millor al producte actual de Whisper Notes.

Whisper Notes fa servir Whisper Large-v3 Turbo: equilibra rendiment, velocitat i requisits de VRAM per a l'ús quotidià. Passarem a models millors quan estiguin disponibles amb uns requisits de recursos raonables.

Voxtral és atractiu quan importen les preguntes i respostes sobre àudio, els resums o el desplegament autoallotjat en servidors. Whisper Notes s'adreça a usuaris individuals que volen transcripció privada i cap subscripció recurrent.

Què significa tot això

Voxtral és un pas important en el món dels pesos oberts més enllà del simple reconeixement de veu, perquè pot raonar sobre l'àudio a més de transcriure'l.

Per a la transcripció privada sense connexió al Mac i a l'iPhone, els motors especialitzats més petits continuen sent més fàcils d'empaquetar i d'executar de manera consistent.

Voleu comparar totes les opcions locals? Tots els models de veu a text en dispositiu — les variants de Whisper, Parakeet V3, SenseVoice i Voxtral — es comparen costat a costat a la nostra pàgina de comparació de models Whisper.

Preguntes freqüents

Què és Mistral Voxtral?

Voxtral és la família de pesos oberts de Mistral per a la transcripció de veu i la comprensió d'àudio. El llançament del juliol de 2025 inclou Voxtral Small 24B per a càrregues de treball de classe servidor i Voxtral Mini 3B per al desplegament local i a l'edge. Tots dos checkpoints fan servir la llicència Apache 2.0.

Pot funcionar Voxtral localment en un Mac?

Els pesos descarregables es poden autoallotjar, però les dues mides tenen requisits diferents. Voxtral Small necessita uns 55 GB de RAM de GPU en bf16/fp16, així que és una opció de classe servidor. Voxtral Mini és el checkpoint local i d'edge; la seva model card indica uns 9,5 GB en bf16/fp16, i la velocitat i l'ús de memòria reals en un Mac depenen del runtime i de la quantització.

Whisper Notes fa servir Voxtral?

No. Whisper Notes executa Parakeet V3 (el model per defecte al Mac), Whisper Large-v3 Turbo i SenseVoice — models escollits perquè equilibren rendiment, velocitat i requisits de VRAM per a l'ús quotidià en Apple Silicon. Adoptarem models millors quan sigui pràctic executar-los en maquinari de consum.

Quantes llengües admet Voxtral?

Les model cards oficials enumeren vuit llengües principals amb detecció automàtica: anglès, espanyol, francès, portuguès, hindi, alemany, neerlandès i italià. Mistral també avalua l'àrab a FLEURS, però no figura a la llista de llengües principals de la model card.

Quan es va publicar Mistral Voxtral?

Mistral va publicar Voxtral el 15 de juliol de 2025. Els checkpoints inicials amb llicència Apache 2.0 van ser Voxtral Small 24B i Voxtral Mini 3B.