Volevamo rispondere a una domanda: esiste un modello locale che trascriva la tua lingua meglio di Whisper Large V3? Per scoprirlo abbiamo messo alla prova questi modelli sul dataset FLEURS.
FLEURS è un dataset di Google con parlato letto in 102 lingue. Da ogni lingua abbiamo preso circa 75 frasi e abbiamo fatto ascoltare le stesse clip, nello stesso ordine, a cinque modelli:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
I risultati sono questi.
Qwen3-ASR 1.7B contro Whisper Large V3 Turbo — il nostro test FLEURS, un solo MacBook Air M5, parlato letto, clip brevi.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| Lingue supportate | 30 | 101 |
| Vantaggi netti | Cantonese, hindi, tailandese, vietnamita, francese (5) | Finlandese, ungherese, greco e altre 8 lingue (11) |
| Velocità | 8,7× il tempo reale | 2,4× il tempo reale |
| Memoria di picco | 2,43 GiB | 1,87 GiB |
| Download | circa 2,5 GB | circa 1,6 GB |
Fuori dalle lingue forti di ciascun modello, la differenza di accuratezza è piccola.
Whisper Large V3 vs Qwen3-ASR: il confronto lingua per lingua
Tutte e 30 le lingue, ordinate dal vantaggio più ampio di Qwen al suo distacco più netto. In entrambe le colonne, più basso è meglio.
Il nostro test FLEURS, un solo MacBook Air M5, parlato letto. CER per cinese, cantonese, giapponese, coreano e tailandese, WER per le altre; il verde segnala un vantaggio più ampio delle barre d’errore appaiate al 95%.
| Lingua | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| Cantonese | 6,00 | 37,97 |
| Hindi | 13,67 | 30,42 |
| Tailandese | 5,92 | 12,95 |
| Vietnamita | 5,07 | 9,79 |
| Persiano | 26,98 | 30,03 |
| Arabo | 14,14 | 15,75 |
| Indonesiano | 4,97 | 6,50 |
| Francese | 3,98 | 5,39 |
| Cinese | 5,69 | 6,88 |
| Inglese | 5,07 | 5,92 |
| Tedesco | 3,51 | 4,10 |
| Giapponese | 5,39 | 5,71 |
| Coreano | 3,51 | 3,70 |
| Spagnolo | 3,60 | 3,76 |
| Italiano | 2,98 | 3,05 |
| Russo | 5,98 | 5,51 |
| Portoghese | 5,64 | 4,91 |
| Macedone | 17,81 | 16,64 |
| Malese | 11,60 | 10,18 |
| Olandese | 7,65 | 5,63 |
| Turco | 8,34 | 5,53 |
| Danese | 20,12 | 14,92 |
| Polacco | 12,78 | 5,32 |
| Rumeno | 18,97 | 8,22 |
| Filippino | 20,44 | 9,37 |
| Svedese | 20,04 | 8,72 |
| Ceco | 23,92 | 11,15 |
| Greco | 30,20 | 12,97 |
| Finlandese | 26,08 | 6,54 |
| Ungherese | 36,35 | 13,66 |
Il nostro test appaiato sullo split di test FLEURS, revisione 70bb2e84, circa 75 frasi per lingua, un solo MacBook Air M5.
Le cinque lingue in cui Qwen3-ASR 1.7B prevale nettamente. Tasso di errore in percentuale, Qwen contro Turbo: cantonese (6,0 contro 38,0), hindi (13,7 contro 30,4), tailandese (5,9 contro 13,0), vietnamita (5,1 contro 9,8), francese (4,0 contro 5,4). Cantonese e tailandese sono valutati per carattere, gli altri per parola. Il suo vantaggio sta nelle lingue valutate per carattere: su cinese, cantonese, giapponese, coreano e tailandese ha ottenuto in media 5,3% contro il 13,4% di Turbo, mentre sulle altre venticinque, valutate per parola, ha ottenuto in media 14,0% contro il 10,2% di Turbo.
Le undici lingue in cui Whisper Large V3 Turbo prevale nettamente. Tasso di errore in percentuale, Qwen contro Turbo, tutte valutate per parola: ungherese (36,4 contro 13,7), greco (30,2 contro 13,0), finlandese (26,1 contro 6,5), ceco (23,9 contro 11,2), filippino (20,4 contro 9,4), danese (20,1 contro 14,9), svedese (20,0 contro 8,7), rumeno (19,0 contro 8,2), polacco (12,8 contro 5,3), turco (8,3 contro 5,5), olandese (7,7 contro 5,6).
Le quattordici vicine o in parità. Inglese (5,1 contro 5,9), tedesco (3,5 contro 4,1), spagnolo (3,6 contro 3,8), italiano (3,0 contro 3,1), russo (6,0 contro 5,5), portoghese (5,6 contro 4,9); cinese (5,7 contro 6,9), giapponese (5,4 contro 5,7) e coreano (3,5 contro 3,7) sono valutati per carattere. Poi arabo, indonesiano, persiano, malese e macedone. Qui ogni scarto è piccolo e cade dentro la fascia del 95%, quindi questo test non riesce a separare i due modelli.
Il cantonese è l’unica riga che cambia una decisione: 6,00% contro 37,97%, e SenseVoice Small — che avevamo indicato come la risposta per il cantonese — ha totalizzato 36,71% di CER sulle stesse clip. Su questo insieme di parlato letto nessuno dei due supera l’asticella, quindi il vecchio consiglio da ora porta con sé quella precisazione.
Quanto è veloce Qwen3-ASR 1.7B?
Tutti e cinque i motori, misurati con lo stesso banco di prova sulla stessa macchina (MacBook Air M5), così almeno sono confrontabili tra loro.
Fattore di tempo reale mediano sulle lingue di ciascun motore nello stesso test FLEURS, un solo MacBook Air M5, parlato letto.
| Motore | Lingue | Velocità mediana in questo test (clip brevi) |
|---|---|---|
| SenseVoice Small | 6 opzioni | 161,0× |
| Parakeet TDT 0.6B v3 | 25 | 82,9× |
| Qwen3-ASR 1.7B | 30 dichiarate | 8,7× |
| Whisper Small | 101 | 6,4× |
| Whisper Large V3 Turbo | 101 | 2,4× |
Sono cifre da banco di prova su clip brevi e sono più basse di quelle che gli stessi motori raggiungono su una registrazione lunga. Usa questa colonna per confrontare i motori tra loro dentro questo unico test, e per nient’altro.
Parakeet V3 e SenseVoice Small sono circa un ordine di grandezza più rapidi di Qwen3-ASR nello stesso banco di prova. Su file lunghi invece che su clip brevi, Parakeet ha raggiunto 103× il tempo reale su un M4 Pro e SenseVoice 52× o più — una misurazione diversa su audio diverso, che punta nella stessa direzione.
Qwen3-ASR sta nel mezzo. In questo test su clip brevi non è stato il motore più lento — lo è stato Whisper Large V3 Turbo — ma varia da lingua a lingua più degli altri, da 2,7× sul greco a 12,4× sul giapponese.
Quanta memoria e quanto disco costa Qwen3-ASR?
La memoria di picco è l’occupazione massima del processo osservata sui singoli elementi dello stesso test FLEURS, un solo MacBook Air M5, parlato letto, clip brevi.
| Motore | Download | Memoria di picco in questo test |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0,09 GiB |
| Whisper Small | 600 MB | 0,87 GiB |
| SenseVoice Small | 827 MB | 0,95 GiB |
| Whisper Large V3 Turbo | circa 1,6 GB | 1,87 GiB |
| Qwen3-ASR 1.7B | circa 2,5 GB | 2,43 GiB |
Su entrambi gli assi Qwen3-ASR è il più pesante dei cinque: circa 2,5 GB da scaricare e 2,43 GiB di memoria di picco del processo in questo test, contro circa 1,6 GB e 1,87 GiB di Whisper Large V3 Turbo.
Su una macchina da 8 GB c’è una strada più leggera. Parakeet V3 copre 25 lingue in 465 MB e 0,09 GiB, e Whisper Small ne copre 101 in 600 MB e 0,87 GiB.
Come abbiamo misurato: FLEURS, 30 lingue, un Mac
Qwen3-ASR 1.7B ha girato come build MLX a 8 bit, Whisper Large V3 Turbo come build ggml di whisper.cpp su Metal. I dati sono lo split di test di Google FLEURS alla revisione 70bb2e84 (CC-BY-4.0): 83 delle sue 102 lingue, circa 75 frasi e 15 minuti ciascuna, le stesse clip nello stesso ordine per ogni modello; il confronto appaiato riguarda le 30 lingue di Qwen. WER per le lingue che separano le parole con spazi, CER per cinese, cantonese, giapponese, coreano e tailandese, mai fusi in un unico numero; le barre d’errore vengono da un bootstrap sui singoli elementi con 10.000 ricampionamenti. Un solo MacBook Air M5, 32 GB, macOS 26.5, nessun output vuoto e nessun errore da parte dei due modelli.
FLEURS è parlato letto, non una riunione e non una dettatura. Nei nostri test le classifiche del parlato letto non hanno retto all’audio reale già due volte, quindi non le estendiamo alle registrazioni lunghe: queste tabelle dicono se un modello è plausibile per la tua lingua, non l’accuratezza che otterrai. La valutazione di Qwen3-ASR 1.7B su riunioni reali sarà un articolo a parte.
Conviene usare Qwen3-ASR al posto di Whisper Large V3?
Lingua per lingua, dentro Whisper Notes per Mac risponderemmo così.
- Se trascrivi cantonese, hindi, tailandese, vietnamita o francese: scegli Qwen3-ASR 1.7B.
- Se trascrivi cinese, giapponese, coreano, inglese, tedesco, spagnolo o italiano: era avanti di un soffio, e di un soffio soltanto. Vanno bene entrambi i modelli, come per persiano, arabo, indonesiano, russo, portoghese, macedone e malese.
- Se trascrivi finlandese, ungherese, greco, ceco, svedese, danese, polacco, rumeno, filippino, turco o olandese: resta su Whisper Large V3 Turbo. Ha prevalso nettamente in tutte e undici.
- Se quello che ti interessa è la velocità o lo spazio su disco: non è questo il motore giusto. Parakeet V3 e SenseVoice Small sono stati un ordine di grandezza più rapidi, con una frazione del download, e Whisper Small copre 101 lingue in 600 MB a 6,4×.
- Se usi iPhone o la versione del Mac App Store: il motore lì non c’è ancora. Su quei canali la scelta per il cantonese è SenseVoice.
Questo è il port sul dispositivo del Qwen3-ASR aperto di Alibaba realizzato da Whisper Notes per Mac: i pesi aperti convertiti in Apple MLX a 8 bit, in esecuzione sulla GPU del tuo Mac, senza che l’audio finisca sui server di Alibaba. Non è lo stesso modello da 0.6B che SenseVoice ha sostituito nella versione con download diretto (DMG) 1.5.0.
Come si usa (Mac con download diretto, DMG 1.6.0 e successivi): Impostazioni, poi Modello di trascrizione, poi Qwen3-ASR 1.7B. Il modello si scarica dentro l’app al primo utilizzo e occupa circa 2,5 GB. Richiede macOS 15 o successivo su Apple silicon, con 16 GB di memoria consigliati; il resto dell’app gira su macOS 14. L’elenco delle lingue di ogni motore è sulla nostra pagina sul supporto linguistico. La CLI locale e il server MCP accettano «qwen», «qwen3» e «qwen3-asr».
Se preferisci non cambiare, non devi toccare niente: Parakeet V3 resta il modello predefinito.
Domande frequenti
Qwen3-ASR è più accurato di Whisper Large V3 Turbo?
Dipende dalla lingua, e il conto è quasi in pari. Nel nostro test FLEURS dentro Whisper Notes per Mac, sulle 30 lingue coperte da entrambi i modelli, Qwen3-ASR 1.7B è stato avanti in 15 e Whisper Large V3 Turbo in 15. Qwen è stato nettamente in testa sul cantonese (6,00% contro 37,97% di CER), sull’hindi (13,67% contro 30,42% di WER), sul tailandese, sul vietnamita e sul francese. Turbo è stato nettamente in testa sul finlandese (6,54% contro 26,08% di WER), sull’ungherese, sul greco, sul ceco, sullo svedese, sul danese, sul polacco, sul rumeno, sul filippino, sul turco e sull’olandese. Quattordici dei trenta scarti cadono dentro le barre d’errore e vanno letti come pareggi. Scegli Qwen3-ASR se la tua lingua è nella sua colonna vincente e usi la versione Mac di Whisper Notes con download diretto (DMG); scegli Whisper Large V3 Turbo per tutto il resto e per ogni lingua fuori dalle 30 di Qwen, visto che Whisper arriva a tutte e 101 le opzioni.
Posso usare Qwen3-ASR su iPhone o dal Mac App Store?
Oggi è nella versione Mac di Whisper Notes con download diretto (DMG), dalla 1.6.0 in poi. La versione del Mac App Store dovrebbe ricevere i motori più recenti in aggiornamenti successivi, e non abbiamo una data. Nel frattempo l’app per iPhone e la versione del Mac App Store hanno tre famiglie di motori — Whisper, Parakeet V3 e SenseVoice — e ogni lingua riconosciuta da Qwen è coperta lì anche da Whisper. Contati come modelli, oggi la versione del Mac App Store ne offre quattro e quella con download diretto cinque, perché Whisper arriva sia come Small sia come Large V3 Turbo. Se ti serve il cantonese su iPhone, lì il motore da usare è SenseVoice.
Qwen3-ASR o SenseVoice per cinese, giapponese e coreano?
Sull’accuratezza sono vicini, sulla velocità lontanissimi. Nel nostro test FLEURS, Qwen3-ASR ha registrato 5,69% di CER sul cinese, 5,39% sul giapponese e 3,51% sul coreano; SenseVoice Small ha registrato 7,06%, 6,85% e 7,82% sulle stesse clip. In quel test SenseVoice è andato a una mediana di 161× il tempo reale contro gli 8,7× di Qwen, scarica 827 MB invece di circa 2,5 GB ed è disponibile su iPhone e su entrambe le versioni per Mac. Scegli SenseVoice, a meno che tu non trascriva cantonese: lì Qwen3-ASR ha registrato 6,00% di CER contro il 36,71% di SenseVoice, e lo scarto è abbastanza ampio da valere l’attesa.
Quali sono i requisiti di sistema di Qwen3-ASR 1.7B?
Un Mac con Apple silicon su macOS 15 o successivo, con 16 GB di memoria consigliati, più circa 2,5 GB di disco per il modello. È più di quanto chiede il resto di Whisper Notes per Mac, che gira su macOS 14 e successivi. Nel nostro test il modello ha toccato un picco di 2,43 GiB di memoria di processo, il più alto dei cinque motori. Su un Mac da 8 GB, Whisper Small copre lo stesso elenco di 101 lingue in 600 MB e Parakeet V3 copre 25 lingue europee in 465 MB.
Quando uso Qwen3-ASR, l’audio esce dal mio Mac?
No. Alibaba offre Qwen3-ASR anche come servizio cloud, attraverso le API DashScope Real-time e FileTrans, dove l’audio viene caricato sui loro server. Whisper Notes non le usa. Esegue i pesi aperti in locale come modello MLX a 8 bit sulla GPU del tuo Mac, senza account e senza chiave API, e la trascrizione funziona anche con la rete spenta. Vale per tutte le famiglie di motori dell’app, su ogni canale.
Perché questi numeri non corrispondono all’accuratezza che ottengo sulle mie registrazioni?
Perché FLEURS è parlato letto, breve e pulito, e le tue registrazioni non lo sono. Il nostro test è una taratura su un dataset pubblico: circa 75 frasi per lingua, un solo MacBook Air M5, le stesse clip per ogni modello. Serve a chiedersi se un modello è plausibile per una lingua, e non è una previsione della tua accuratezza su una riunione, su audio rumoroso, su parlato con accento o su un file di due ore.
Provalo
Qwen3-ASR 1.7B è in Whisper Notes per Mac dalla 1.6.0 in poi, solo con download diretto (DMG). Impostazioni, poi Modello di trascrizione. La prova gratuita copre 10.000 parole, abbastanza per far passare la tua lingua da questo modello e contestare le tabelle qui sopra.
Se trovi una lingua in cui i nostri numeri non corrispondono alla tua esperienza, scrivi a mac@whispernotes.app. Note di rilascio complete: whispernotes.app/changelog.
Le fonti di tutto quanto sopra: il nostro test sullo split di test di Google FLEURS alla revisione 70bb2e84, la scheda del modello Qwen3-ASR 1.7B e la tabella delle lingue di ogni motore sulla nostra pagina sul supporto linguistico, generata dal codice sorgente dell’app.