Mistral Voxtral vs GPT-4o | Benchmark IA Vocale

2 agosto 2025
·
8 min read
·Whisper Notes Team

Mistral ha rilasciato Voxtral, la sua prima famiglia di modelli open-weight per la trascrizione e la comprensione dell'audio. I benchmark ufficiali mostrano un ottimo riconoscimento vocale multilingue e buone capacità di Q&A sull'audio, ma le due taglie del modello hanno requisiti hardware molto diversi. Ecco cosa supporta davvero questo rilascio e perché Whisper Notes continua a usare modelli più piccoli e specializzati nella trascrizione sull'hardware Apple consumer.

Benchmark delle prestazioni di Mistral Voxtral

Due modelli

A luglio 2025 Mistral ha pubblicato due checkpoint con licenza Apache 2.0:

Voxtral Small 24B

  • 24 miliardi di parametri
  • Trascrizione, traduzione, Q&A sull'audio e riassunti
  • Finestra di contesto da 32k
  • Circa 55 GB di RAM GPU in bf16/fp16

Voxtral Mini 3B

  • 3 miliardi di parametri
  • La stessa famiglia di task audio e testo in un checkpoint più piccolo
  • Posizionato ufficialmente per il deployment locale ed edge
  • Circa 9,5 GB di RAM GPU in bf16/fp16

Pesi aperti e licenza

Entrambi i checkpoint del 2025 sono open weight con licenza Apache 2.0. Puoi scaricarli ed eseguirli in autonomia:

  • Pesi completi del modello disponibili
  • Self-hosting e adattamento consentiti nei limiti della licenza Apache 2.0
  • Nessun costo API Mistral in self-hosting; il calcolo resta comunque a tuo carico
  • Elaborazione dell'audio sui tuoi server

Fonti: l'annuncio di Voxtral di Mistral, la model card ufficiale di Voxtral Small e la model card ufficiale di Voxtral Mini.

I benchmark

Il rilascio di Mistral confronta il word error rate in macro-media su set inglesi short-form e long-form, Mozilla Common Voice, FLEURS e Multilingual LibriSpeech. Nei risultati FLEURS riportati da Mistral, Voxtral Small batte Whisper in ogni task valutato. Un WER più basso è migliore:

Confronto dei benchmark WER di Voxtral con tutti i modelli

WER su FLEURS dai benchmark di lancio di Mistral, messo in relazione con il prezzo API stimato; sia i risultati dei benchmark sia i prezzi possono cambiare

FLEURS è solo una fetta della qualità di trascrizione. Si tratta di risultati dichiarati dal produttore: confronta le definizioni dei benchmark pubblicati e prova le tue lingue, i tuoi microfoni e le tue condizioni di registrazione prima di scegliere un modello.

Voxtral vs Whisper: quale scegliere?

I benchmark raccontano solo una parte della storia. Ecco come le due famiglie di modelli si confrontano sui fattori che contano davvero se vuoi eseguirne uno tu stesso:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
Lingue 8 lingue principali 8 lingue principali Oltre 100 Oltre 100
Open source
Dimensione del modello 24B parametri; ~55 GB di RAM GPU in bf16/fp16 3B parametri; ~9,5 GB di RAM GPU in bf16/fp16 1,55B parametri 809M parametri (~1,6 GB)
Pratico su un Mac consumer Non in piena precisione su hardware tipico Possibile con un runtime compatibile; più pesante di Turbo

Il verdetto: Voxtral Small dichiara ottimi risultati di WER e aggiunge una comprensione dell'audio che Whisper nemmeno tenta. Voxtral Mini è il checkpoint che Mistral posiziona per il deployment locale ed edge, ma la sua model card ufficiale indica comunque circa 9,5 GB di RAM GPU in bf16/fp16. Per un'app di trascrizione consumer, Whisper Large-v3 Turbo resta più facile da distribuire e copre molte più lingue. Ecco perché Whisper Notes oggi combina Whisper Turbo con Parakeet V3 e SenseVoice invece di Voxtral.

Costi: API e self-hosting

Come verificato il 10 luglio 2026, la model card di Mistral indica per Voxtral Small un input audio a $0.004 al minuto. Per le richieste di comprensione dell'audio, l'input di testo e il testo generato vengono fatturati separatamente. Se fai self-hosting dei pesi Apache 2.0 non c'è alcun costo API Mistral, ma paghi hardware e gestione operativa.

API Mistral

$0.004
per minuto di audio con Voxtral Small

Pesi in self-hosting

Apache 2.0
nessun costo API; il calcolo è a tuo carico

Come funziona

La model card ufficiale descrive Voxtral come un backbone di language model con un encoder audio e una modalità di trascrizione dedicata. I limiti di prodotto che contano sono concreti:

1. Architettura multimodale

Voxtral accetta audio e testo nella stessa conversazione, invece di comportarsi solo da decoder speech-to-text:

  • Modalità dedicata per la trascrizione diretta
  • Q&A sull'audio e riassunti strutturati
  • Più input audio e conversazioni audio multi-turno

Limite sul long-form

La finestra di contesto da 32k supporta fino a 30 minuti di audio per la trascrizione o 40 minuti per la comprensione audio più ampia.

2. Lingue e valutazione

Mistral elenca otto lingue principali con rilevamento automatico:

  • Inglese, spagnolo, francese, portoghese, hindi, tedesco, olandese e italiano
  • I benchmark includono FLEURS, Mozilla Common Voice e Multilingual LibriSpeech
  • Il rilascio valuta inoltre separatamente l'audio inglese short-form e long-form

3. Requisiti di deployment

Pesi aperti non significa che ogni checkpoint sia abbastanza piccolo per ogni dispositivo:

  • Voxtral Small richiede circa 55 GB di RAM GPU in bf16/fp16 secondo la sua model card
  • Voxtral Mini è il checkpoint 3B pensato per il deployment locale ed edge
  • Mistral raccomanda vLLM per servire i checkpoint rilasciati

4. Caratteristiche principali

Comprensione contestuale

Può rispondere a domande e produrre riassunti direttamente dall'audio, entro il limite di contesto di 32k.

Multilingue

Rileva e trascrive automaticamente otto lingue principali: inglese, spagnolo, francese, portoghese, hindi, tedesco, olandese e italiano.

Gestione del rumore

La valutazione ufficiale include dataset vocali eterogenei, ma Mistral non pubblica alcuna garanzia generale per ogni registrazione rumorosa.

Deployment edge

Voxtral Mini è l'opzione locale ed edge. La sua model card ufficiale indica circa 9,5 GB di RAM GPU in bf16/fp16.

5. Architettura

Tre componenti principali:

  1. 1. Encoder audio: converte la forma d'onda in rappresentazioni audio apprese
  2. 2. Projector: mappa le rappresentazioni audio nello spazio nascosto del language model
  3. 3. Backbone language model: genera trascrizioni, risposte, riassunti o chiamate a strumenti

Questo design spiega perché Voxtral sa fare più della sola trascrizione, ma comporta anche pesi di language model molto più grandi rispetto a un modello dedicato solo alla trascrizione come Whisper Turbo.

Perché Whisper Notes ha ancora senso

Voxtral e Whisper Notes risolvono problemi diversi. Voxtral unisce trascrizione e comprensione dell'audio; Whisper Notes punta sulla trascrizione privata, facile da eseguire sull'hardware Apple consumer.

Cosa offre Whisper Notes

Privacy

Prestazioni

  • Tecnologia Whisper, accuratezza comprovata
  • Ottimizzato per Apple Silicon
  • Risultati affidabili

Costo

  • acquisto una tantum; prezzo indicato nel canale di acquisto; su Mac è inclusa una prova gratuita di 10.000 parole
  • Nessun costo al minuto
  • Trascrizione illimitata

Esperienza d'uso

  • Interfaccia semplice
  • Aggiornamenti regolari
  • Miglioramenti continui

Requisiti di memoria

Voxtral Small in piena precisione è un modello da server: la sua scheda ufficiale indica circa 55 GB di RAM GPU. Voxtral Mini è pensato espressamente per l'uso locale ed edge, ma la sua scheda indica comunque circa 9,5 GB di RAM GPU in bf16/fp16. Il download di Whisper Turbo nell'app è di circa 1,6 GB, una misura più adatta all'attuale prodotto Whisper Notes.

Whisper Notes usa Whisper Large-v3 Turbo: bilancia prestazioni, velocità e requisiti di VRAM per l'uso quotidiano. Passeremo a modelli migliori quando saranno disponibili con requisiti di risorse ragionevoli.

Voxtral è interessante quando contano il Q&A sull'audio, i riassunti o il deployment self-hosted su server. Whisper Notes si rivolge agli utenti individuali che vogliono trascrizione privata e nessun abbonamento ricorrente.

Cosa significa tutto questo

Voxtral è un passo importante nel mondo open-weight oltre il semplice riconoscimento vocale, perché sa ragionare sull'audio oltre a trascriverlo.

Per la trascrizione privata offline su Mac e iPhone, i motori specializzati più piccoli restano più facili da impacchettare e da far girare in modo costante.

Vuoi confrontare tutte le opzioni locali? Ogni modello speech-to-text on-device — le varianti di Whisper, Parakeet V3, SenseVoice e Voxtral — è messo a confronto nella nostra pagina di confronto dei modelli Whisper.

Domande frequenti

Che cos'è Mistral Voxtral?

Voxtral è la famiglia open-weight di Mistral per la trascrizione vocale e la comprensione dell'audio. Il rilascio di luglio 2025 include Voxtral Small 24B per carichi di lavoro da server e Voxtral Mini 3B per il deployment locale ed edge. Entrambi i checkpoint usano la licenza Apache 2.0.

Voxtral può girare in locale su un Mac?

I pesi scaricabili si possono ospitare in autonomia, ma le due taglie hanno requisiti diversi. Voxtral Small richiede circa 55 GB di RAM GPU in bf16/fp16, quindi è una scelta da server. Voxtral Mini è il checkpoint locale ed edge; la sua model card indica circa 9,5 GB in bf16/fp16, e la velocità e la memoria effettive su Mac dipendono dal runtime e dalla quantizzazione.

Whisper Notes usa Voxtral?

No. Whisper Notes esegue Parakeet V3 (il modello predefinito su Mac), Whisper Large-v3 Turbo e SenseVoice — modelli scelti perché bilanciano prestazioni, velocità e requisiti di VRAM per l'uso quotidiano su Apple Silicon. Adotteremo modelli migliori non appena diventeranno pratici da eseguire su hardware consumer.

Quante lingue supporta Voxtral?

Le model card ufficiali elencano otto lingue principali con rilevamento automatico: inglese, spagnolo, francese, portoghese, hindi, tedesco, olandese e italiano. Mistral valuta anche l'arabo in FLEURS, ma non è incluso nell'elenco delle lingue principali della model card.

Quando è stato rilasciato Mistral Voxtral?

Mistral ha rilasciato Voxtral il 15 luglio 2025. I checkpoint iniziali con licenza Apache 2.0 erano Voxtral Small 24B e Voxtral Mini 3B.