Mistral ha rilasciato Voxtral, la sua prima famiglia di modelli open-weight per la trascrizione e la comprensione dell'audio. I benchmark ufficiali mostrano un ottimo riconoscimento vocale multilingue e buone capacità di Q&A sull'audio, ma le due taglie del modello hanno requisiti hardware molto diversi. Ecco cosa supporta davvero questo rilascio e perché Whisper Notes continua a usare modelli più piccoli e specializzati nella trascrizione sull'hardware Apple consumer.
Due modelli
A luglio 2025 Mistral ha pubblicato due checkpoint con licenza Apache 2.0:
Voxtral Small 24B
- •24 miliardi di parametri
- •Trascrizione, traduzione, Q&A sull'audio e riassunti
- •Finestra di contesto da 32k
- •Circa 55 GB di RAM GPU in bf16/fp16
Voxtral Mini 3B
- •3 miliardi di parametri
- •La stessa famiglia di task audio e testo in un checkpoint più piccolo
- •Posizionato ufficialmente per il deployment locale ed edge
- •Circa 9,5 GB di RAM GPU in bf16/fp16
Pesi aperti e licenza
Entrambi i checkpoint del 2025 sono open weight con licenza Apache 2.0. Puoi scaricarli ed eseguirli in autonomia:
- ✓ Pesi completi del modello disponibili
- ✓ Self-hosting e adattamento consentiti nei limiti della licenza Apache 2.0
- ✓ Nessun costo API Mistral in self-hosting; il calcolo resta comunque a tuo carico
- ✓ Elaborazione dell'audio sui tuoi server
Fonti: l'annuncio di Voxtral di Mistral, la model card ufficiale di Voxtral Small e la model card ufficiale di Voxtral Mini.
I benchmark
Il rilascio di Mistral confronta il word error rate in macro-media su set inglesi short-form e long-form, Mozilla Common Voice, FLEURS e Multilingual LibriSpeech. Nei risultati FLEURS riportati da Mistral, Voxtral Small batte Whisper in ogni task valutato. Un WER più basso è migliore:
WER su FLEURS dai benchmark di lancio di Mistral, messo in relazione con il prezzo API stimato; sia i risultati dei benchmark sia i prezzi possono cambiare
FLEURS è solo una fetta della qualità di trascrizione. Si tratta di risultati dichiarati dal produttore: confronta le definizioni dei benchmark pubblicati e prova le tue lingue, i tuoi microfoni e le tue condizioni di registrazione prima di scegliere un modello.
Voxtral vs Whisper: quale scegliere?
I benchmark raccontano solo una parte della storia. Ecco come le due famiglie di modelli si confrontano sui fattori che contano davvero se vuoi eseguirne uno tu stesso:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Lingue | 8 lingue principali | 8 lingue principali | Oltre 100 | Oltre 100 |
| Open source | Sì | Sì | Sì | Sì |
| Dimensione del modello | 24B parametri; ~55 GB di RAM GPU in bf16/fp16 | 3B parametri; ~9,5 GB di RAM GPU in bf16/fp16 | 1,55B parametri | 809M parametri (~1,6 GB) |
| Pratico su un Mac consumer | Non in piena precisione su hardware tipico | Possibile con un runtime compatibile; più pesante di Turbo | Sì | Sì |
Il verdetto: Voxtral Small dichiara ottimi risultati di WER e aggiunge una comprensione dell'audio che Whisper nemmeno tenta. Voxtral Mini è il checkpoint che Mistral posiziona per il deployment locale ed edge, ma la sua model card ufficiale indica comunque circa 9,5 GB di RAM GPU in bf16/fp16. Per un'app di trascrizione consumer, Whisper Large-v3 Turbo resta più facile da distribuire e copre molte più lingue. Ecco perché Whisper Notes oggi combina Whisper Turbo con Parakeet V3 e SenseVoice invece di Voxtral.
Costi: API e self-hosting
Come verificato il 10 luglio 2026, la model card di Mistral indica per Voxtral Small un input audio a $0.004 al minuto. Per le richieste di comprensione dell'audio, l'input di testo e il testo generato vengono fatturati separatamente. Se fai self-hosting dei pesi Apache 2.0 non c'è alcun costo API Mistral, ma paghi hardware e gestione operativa.
API Mistral
Pesi in self-hosting
Come funziona
La model card ufficiale descrive Voxtral come un backbone di language model con un encoder audio e una modalità di trascrizione dedicata. I limiti di prodotto che contano sono concreti:
1. Architettura multimodale
Voxtral accetta audio e testo nella stessa conversazione, invece di comportarsi solo da decoder speech-to-text:
- •Modalità dedicata per la trascrizione diretta
- •Q&A sull'audio e riassunti strutturati
- •Più input audio e conversazioni audio multi-turno
Limite sul long-form
La finestra di contesto da 32k supporta fino a 30 minuti di audio per la trascrizione o 40 minuti per la comprensione audio più ampia.
2. Lingue e valutazione
Mistral elenca otto lingue principali con rilevamento automatico:
- •Inglese, spagnolo, francese, portoghese, hindi, tedesco, olandese e italiano
- •I benchmark includono FLEURS, Mozilla Common Voice e Multilingual LibriSpeech
- •Il rilascio valuta inoltre separatamente l'audio inglese short-form e long-form
3. Requisiti di deployment
Pesi aperti non significa che ogni checkpoint sia abbastanza piccolo per ogni dispositivo:
- •Voxtral Small richiede circa 55 GB di RAM GPU in bf16/fp16 secondo la sua model card
- •Voxtral Mini è il checkpoint 3B pensato per il deployment locale ed edge
- •Mistral raccomanda vLLM per servire i checkpoint rilasciati
4. Caratteristiche principali
Comprensione contestuale
Può rispondere a domande e produrre riassunti direttamente dall'audio, entro il limite di contesto di 32k.
Multilingue
Rileva e trascrive automaticamente otto lingue principali: inglese, spagnolo, francese, portoghese, hindi, tedesco, olandese e italiano.
Gestione del rumore
La valutazione ufficiale include dataset vocali eterogenei, ma Mistral non pubblica alcuna garanzia generale per ogni registrazione rumorosa.
Deployment edge
Voxtral Mini è l'opzione locale ed edge. La sua model card ufficiale indica circa 9,5 GB di RAM GPU in bf16/fp16.
5. Architettura
Tre componenti principali:
- 1. Encoder audio: converte la forma d'onda in rappresentazioni audio apprese
- 2. Projector: mappa le rappresentazioni audio nello spazio nascosto del language model
- 3. Backbone language model: genera trascrizioni, risposte, riassunti o chiamate a strumenti
Questo design spiega perché Voxtral sa fare più della sola trascrizione, ma comporta anche pesi di language model molto più grandi rispetto a un modello dedicato solo alla trascrizione come Whisper Turbo.
Perché Whisper Notes ha ancora senso
Voxtral e Whisper Notes risolvono problemi diversi. Voxtral unisce trascrizione e comprensione dell'audio; Whisper Notes punta sulla trascrizione privata, facile da eseguire sull'hardware Apple consumer.
Cosa offre Whisper Notes
Privacy
- •Elaborazione 100% offline
- •Nessuna trasmissione di dati
- •Nessuna dipendenza dal cloud
Prestazioni
- •Tecnologia Whisper, accuratezza comprovata
- •Ottimizzato per Apple Silicon
- •Risultati affidabili
Costo
- •acquisto una tantum; prezzo indicato nel canale di acquisto; su Mac è inclusa una prova gratuita di 10.000 parole
- •Nessun costo al minuto
- •Trascrizione illimitata
Esperienza d'uso
- •Interfaccia semplice
- •Aggiornamenti regolari
- •Miglioramenti continui
Requisiti di memoria
Voxtral Small in piena precisione è un modello da server: la sua scheda ufficiale indica circa 55 GB di RAM GPU. Voxtral Mini è pensato espressamente per l'uso locale ed edge, ma la sua scheda indica comunque circa 9,5 GB di RAM GPU in bf16/fp16. Il download di Whisper Turbo nell'app è di circa 1,6 GB, una misura più adatta all'attuale prodotto Whisper Notes.
Whisper Notes usa Whisper Large-v3 Turbo: bilancia prestazioni, velocità e requisiti di VRAM per l'uso quotidiano. Passeremo a modelli migliori quando saranno disponibili con requisiti di risorse ragionevoli.
Voxtral è interessante quando contano il Q&A sull'audio, i riassunti o il deployment self-hosted su server. Whisper Notes si rivolge agli utenti individuali che vogliono trascrizione privata e nessun abbonamento ricorrente.
Cosa significa tutto questo
Voxtral è un passo importante nel mondo open-weight oltre il semplice riconoscimento vocale, perché sa ragionare sull'audio oltre a trascriverlo.
Per la trascrizione privata offline su Mac e iPhone, i motori specializzati più piccoli restano più facili da impacchettare e da far girare in modo costante.
Vuoi confrontare tutte le opzioni locali? Ogni modello speech-to-text on-device — le varianti di Whisper, Parakeet V3, SenseVoice e Voxtral — è messo a confronto nella nostra pagina di confronto dei modelli Whisper.
Domande frequenti
Che cos'è Mistral Voxtral?
Voxtral è la famiglia open-weight di Mistral per la trascrizione vocale e la comprensione dell'audio. Il rilascio di luglio 2025 include Voxtral Small 24B per carichi di lavoro da server e Voxtral Mini 3B per il deployment locale ed edge. Entrambi i checkpoint usano la licenza Apache 2.0.
Voxtral può girare in locale su un Mac?
I pesi scaricabili si possono ospitare in autonomia, ma le due taglie hanno requisiti diversi. Voxtral Small richiede circa 55 GB di RAM GPU in bf16/fp16, quindi è una scelta da server. Voxtral Mini è il checkpoint locale ed edge; la sua model card indica circa 9,5 GB in bf16/fp16, e la velocità e la memoria effettive su Mac dipendono dal runtime e dalla quantizzazione.
Whisper Notes usa Voxtral?
No. Whisper Notes esegue Parakeet V3 (il modello predefinito su Mac), Whisper Large-v3 Turbo e SenseVoice — modelli scelti perché bilanciano prestazioni, velocità e requisiti di VRAM per l'uso quotidiano su Apple Silicon. Adotteremo modelli migliori non appena diventeranno pratici da eseguire su hardware consumer.
Quante lingue supporta Voxtral?
Le model card ufficiali elencano otto lingue principali con rilevamento automatico: inglese, spagnolo, francese, portoghese, hindi, tedesco, olandese e italiano. Mistral valuta anche l'arabo in FLEURS, ma non è incluso nell'elenco delle lingue principali della model card.
Quando è stato rilasciato Mistral Voxtral?
Mistral ha rilasciato Voxtral il 15 luglio 2025. I checkpoint iniziali con licenza Apache 2.0 erano Voxtral Small 24B e Voxtral Mini 3B.