Con macOS 26 e iOS 26, Apple offre una nuova generazione di riconoscimento vocale sul dispositivo: SpeechAnalyzer e SpeechTranscriber, che di seguito chiameremo in breve Apple Speech. È nettamente più accurata del vecchio motore di dettatura. Volevamo quindi sapere: il riconoscimento vocale integrato di Apple è ormai abbastanza valido da poter fare del tutto a meno di un’app di trascrizione? E quanto è distante dai modelli aperti sul dispositivo disponibili in Whisper Notes: Whisper, Parakeet, SenseVoice e Qwen3-ASR? Abbiamo eseguito un test rigoroso. Ecco i risultati. Nelle dieci lingue che abbiamo testato Apple Speech non ha mai avuto il tasso di errore più basso, è rimasto entro 1,5 punti dal primo in coreano, giapponese e cinese e non ha alcun modello per olandese, russo e polacco.
Quanto è distante Apple Speech dai modelli che scarichi?
| Lingua | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Inglese | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Tedesco | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Olandese | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Russo | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Polacco | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Giapponese | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Coreano | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Francese | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Cinese | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Spagnolo (America Latina) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Dieci delle lingue più usate, un motore per colonna. Ogni cella indica il tasso di errore del motore: più basso è meglio; il verde segna il valore più basso della riga, il bianco il secondo. CER per giapponese, coreano e cinese, WER per le altre, mai riuniti in un unico numero. Il nostro test FLEURS, condotto dal team di Whisper Notes, su un solo M5 MacBook Air, parlato letto.
Nomi abbreviati: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Un trattino indica che il motore non dispone di un modello per quella lingua.
Qwen3-ASR 1.7B ha il tasso di errore più basso in sei delle dieci lingue, Whisper Large V3 Turbo nelle altre quattro. Apple Speech è indietro di 0,77 punti rispetto al primo della riga in coreano, di 1,06 in giapponese e di 1,48 in cinese, dove è alla pari con Whisper Large V3 Turbo a 7,97. Nelle sette lingue che supporta resta indietro rispetto al primo della riga da 0,8 a 4,3 punti; il divario massimo è in inglese, 8,80 contro 4,49. Per olandese, polacco e russo non c’è un risultato di Apple Speech.
Quali lingue supporta Apple Speech?
Apple Speech ha restituito risultati per 21 delle 83 configurazioni linguistiche di questo test. Entrambi i modelli Whisper le coprono tutte e 83, Qwen3-ASR 1.7B ne copre 30 e Parakeet V3 25. Fra le dieci lingue sopra, non dispone di un modello per olandese, polacco o russo. Non esiste un elenco fisso da citare: le risorse linguistiche appartengono a macOS, quindi un’app chiede in fase di esecuzione quali siano presenti su una determinata macchina.
| Lingua | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Italiano | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Cantonese | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Portoghese (Brasile) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Hindi | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Telugu | 101,63 | — | 81,74 | 103,19 | — | — |
| Urdu | 101,69 | — | 23,39 | 38,83 | — | — |
| Punjabi | 101,75 | — | 92,05 | 103,40 | — | — |
| Bengalese | 102,00 | — | 83,52 | 117,37 | — | — |
| Nepalese | 102,13 | — | 88,59 | 118,84 | — | — |
| Malayalam | 102,18 | — | 107,34 | 167,16 | — | — |
| Marathi | 102,23 | — | 82,69 | 109,95 | — | — |
| Kannada | 103,83 | — | 72,07 | 116,10 | — | — |
| Gujarati | 104,52 | — | 75,31 | 108,91 | — | — |
| Tamil | 113,01 | — | 71,28 | 79,77 | — | — |
Le altre quattordici lingue per cui Apple Speech ha restituito un risultato, ordinate secondo il suo tasso di errore. Stesse colonne, colori e abbreviazioni della tabella precedente; CER per il cantonese, WER per le altre. Un tasso di errore può superare il 100% perché anche gli inserimenti contano al numeratore.
Nelle ultime undici righe, dall’hindi al tamil, Apple Speech ha risposto con una traslitterazione in caratteri latini invece che nella scrittura nativa. Il suo tasso di errore misura quindi una mancata corrispondenza fra sistemi di scrittura, non l’accuratezza del riconoscimento, e quelle celle sono escluse dalla classifica della riga; i valori degli altri motori nelle stesse righe sono misurazioni ordinarie.
Come funziona SpeechAnalyzer
Apple dispone di un’API di riconoscimento vocale fin da iOS 10. Quella API, SFSpeechRecognizer, è il motore alla base del vecchio percorso di dettatura. SpeechAnalyzer la sostituisce: è stato introdotto in macOS 26 e iOS 26 ed è disponibile su ogni piattaforma Apple tranne watchOS.
L’API ruota attorno a una sessione. Crei uno SpeechAnalyzer, gli assegni uno o più moduli e gli fornisci l’audio; SpeechTranscriber è il modulo che trasforma il parlato in testo. L’audio entra come una sequenza asincrona che alimenti tu, i risultati tornano come una seconda sequenza e le due operazioni vengono in genere eseguite in task diversi. L’analizzatore accetta una sequenza di input alla volta. Ogni buffer e ogni risultato sono associati a un codice temporale sulla timeline dell’audio, così il risultato può essere ricollocato nel punto da cui proviene.
Una sessione, tre task: l’audio entra come AsyncSequence, SpeechAnalyzer e SpeechTranscriber lo analizzano e i risultati tornano come una seconda AsyncSequence che l’interfaccia può leggere. Fonte: Apple, sessione WWDC25 277.
I risultati arrivano due volte. Qualsiasi elemento all’interno di ciò che Apple chiama intervallo volatile può ancora essere sostituito da un risultato migliore; ciò che si trova all’esterno è definitivo. È così che un’app mostra una trascrizione provvisoria mentre stai ancora parlando e la corregge in seguito.
Apple indica cinque obiettivi di progettazione per il modello SpeechTranscriber: audio lungo, parlato conversazionale, voci distanti, bassa latenza e privacy, ossia elaborazione sul dispositivo. Note, Memo Vocali, Diario e il riepilogo delle chiamate si basano su questo modello.
I cinque obiettivi di progettazione dichiarati da Apple per il modello SpeechTranscriber. Fonte: Apple, sessione WWDC25 277.
I modelli non fanno parte di alcuna app. Vengono scaricati dai server di Apple tramite AssetInventory, archiviati e aggiornati dal sistema e condivisi fra le app. Non aggiungono nulla alle dimensioni di download di un’app né allo spazio di memoria dell’app, e la decodifica avviene fuori dal processo chiamante. Quando SpeechTranscriber non dispone di un modello per una lingua o un dispositivo, subentra DictationTranscriber con gli stessi modelli della dettatura di sistema.
Come abbiamo effettuato le misurazioni
Ogni motore di questo articolo ha trascritto le stesse clip, nello stesso ordine e una alla volta, su un M5 MacBook Air (32 GB, macOS 27.0). L’audio è quello dello split di test di Google FLEURS alla revisione 70bb2e84, circa 150 frasi e 30 minuti per lingua. Un hash fisso degli ID degli elementi del dataset determina l’ordine, e prendiamo la sequenza più breve di elementi interi che supera i trenta minuti; nessun output dei modelli ha influito su questa scelta. Ogni cella è stata ricostruita dalla propria ricevuta e verificata di nuovo, e tutte e 285 hanno superato il controllo.
I punteggi sono il WER per le lingue in cui le parole sono separate da spazi e il CER per giapponese, coreano, cinese e cantonese. FLEURS è parlato letto, non una riunione né una dettatura. Queste tabelle indicano se un motore è plausibile per la tua lingua, non il risultato che otterrai sulle tue registrazioni.
Quanto migliora rispetto alla vecchia dettatura Apple?
Apple offre due modalità operative di trascrizione e le abbiamo misurate entrambe. SpeechTranscriber è quella nuova, che in questo articolo chiamiamo Apple Speech. DictationTranscriber è quella di compatibilità, il percorso di dettatura di cui disponeva prima un Mac.
| Lingua | Dettatura Apple | Apple Speech |
|---|---|---|
| Coreano | 7,11 | 4,31 |
| Italiano | 6,93 | 4,39 |
| Spagnolo (America Latina) | 8,43 | 5,41 |
| Tedesco | 12,69 | 6,26 |
| Giapponese | 9,37 | 6,36 |
| Francese | 17,10 | 7,61 |
| Cinese | 10,28 | 7,97 |
| Cantonese | 10,18 | 8,69 |
| Inglese | 13,83 | 8,80 |
| Portoghese (Brasile) | 10,85 | 9,35 |
Tutte le lingue misurate correttamente da entrambe le modalità operative Apple, ordinate secondo il tasso di errore di Apple Speech; il verde segna il valore migliore della riga. Stesso test, stesse clip, stesso Mac. CER per giapponese, coreano, cinese e cantonese, WER per le altre.
Apple Speech è più accurato in tutte e dieci. Nella lingua mediana gli errori si riducono di circa un terzo, in francese e tedesco di oltre la metà, in portoghese brasiliano e cantonese di circa uno su sette.
Questo è un confronto con il passato della stessa Apple. Rispetto ai modelli che scarichi, il suo miglior piazzamento in una lingua misurata correttamente è il secondo posto, in cantonese. La dettatura copre più lingue: 33 configurazioni contro 21 in questo test, comprese tutte e tre quelle che qui mancano al nuovo motore.
Quali vantaggi offre il motore integrato?
| Motore | Velocità | Memoria di picco | Download |
|---|---|---|---|
| SenseVoice Small | 162,3× il tempo reale | 0,95 GiB | 827 MB |
| Parakeet V3 | 75,6× il tempo reale | 0,09 GiB | 465 MB |
| Apple Speech | 30,8× il tempo reale | non indicata | pacchetto lingua scaricato da macOS, non dall’app |
| Qwen3-ASR 1.7B | 11,1× il tempo reale | 2,43 GiB | circa 2,5 GB |
| Whisper Small | 7,9× il tempo reale | 0,87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3,0× il tempo reale | 1,87 GiB | circa 1,6 GB |
La velocità è la mediana di ciascun motore sulle tredici lingue misurate correttamente in questo articolo, contando solo quelle su cui è stato eseguito: è il throughput dell’elaborazione di elementi isolati, una misura diagnostica, non la latenza del prodotto. La memoria di picco è il massimo del gruppo di processi in questo test. Apple Speech decodifica all’interno di un servizio macOS che non appartiene all’app chiamante, quindi nessun valore sarebbe confrontabile con quello degli altri cinque.
Le risorse linguistiche di Apple Speech vengono scaricate una volta dal sistema e condivise fra tutte le app. Nulla è incluso nell’app e nulla viene allocato nel processo dell’app stessa. Il servizio di sistema usa comunque memoria mentre lavora, ma non possiamo attribuirla con precisione: per questo non indichiamo alcun valore, invece di riportare uno zero. Ha operato a 30,8× il tempo reale, dietro Parakeet V3 e SenseVoice Small.
Whisper Large V3 Turbo vince quattro delle dieci righe ed è il motore più lento qui, circa dieci volte più lento di Apple Speech, con circa 1,6 GB su disco. Qwen3-ASR 1.7B vince le altre sei, con circa 2,5 GB e 2,43 GiB di memoria. Parakeet V3 occupa 465 MB e 0,09 GiB, supera Turbo in francese, gli resta dietro in polacco e non dispone di giapponese, coreano, cinese o cantonese. Whisper Small è il confronto più vicino con 600 MB, e Apple Speech è stato più accurato in otto delle dieci lingue misurate correttamente da entrambi.
Dovresti usare Apple Speech invece di un modello scaricato?
Lingua per lingua:
- Inglese: non è una buona scelta. Apple Speech ha ottenuto 8,80; Qwen3-ASR 1.7B (4,49) o Whisper Large V3 Turbo (5,49) è chiaramente più accurato.
- Tedesco: non è una buona scelta. Apple Speech ha ottenuto 6,26; Qwen3-ASR 1.7B (2,85) o Whisper Large V3 Turbo (4,05) è chiaramente più accurato.
- Olandese, russo e polacco: Apple Speech non dispone di un modello per queste tre lingue. Whisper Large V3 Turbo è stato il più accurato in ognuna, con 5,69, 5,13 e 5,45.
- Giapponese: utilizzabile. Apple Speech ha ottenuto 6,36, dietro a Whisper Large V3 Turbo con 5,30.
- Coreano: utilizzabile. Apple Speech ha ottenuto 4,31, dietro a Qwen3-ASR 1.7B con 3,54.
- Francese: non è una buona scelta. Apple Speech ha ottenuto 7,61; Qwen3-ASR 1.7B (4,57) o Parakeet V3 (5,83) è chiaramente più accurato.
- Cinese: utilizzabile. Apple Speech ha ottenuto 7,97, alla pari con Whisper Large V3 Turbo; il più accurato è stato Qwen3-ASR 1.7B con 6,49.
- Spagnolo: non è una buona scelta. Apple Speech ha ottenuto 5,41; Qwen3-ASR 1.7B (3,38) o Whisper Large V3 Turbo (3,62) è chiaramente più accurato.
In questo articolo Apple Speech è il nome abbreviato dello SpeechTranscriber di Apple, l’API sul dispositivo che qualsiasi app per Mac può richiamare da macOS 26 in poi. Non è uno dei modelli che Whisper Notes per Mac scarica: nella versione Mac con download diretto (DMG) sono Whisper, Parakeet V3, SenseVoice e Qwen3-ASR, mentre su iPhone e nella versione del Mac App Store sono Whisper, Parakeet V3 e SenseVoice. La tabella per motore è sulla nostra pagina sul supporto linguistico.
Nulla di tutto questo cambia ciò che fa oggi Whisper Notes per Mac: Parakeet V3 resta il modello predefinito.
Domande frequenti
Apple Speech è accurato quanto Whisper?
Non nella maggior parte delle lingue coperte da entrambi. Nel nostro test FLEURS, fra le sette di queste dieci lingue supportate da Apple Speech, Whisper Large V3 Turbo è stato più accurato in sei e i due hanno ottenuto esattamente lo stesso risultato in cinese, 7,97% di CER ciascuno. Rispetto a Whisper Small l’ordine si inverte: Apple Speech è stato avanti in sei lingue su sette e ha perso solo in inglese, 8,80% contro 7,04% di WER. In questo test non è in testa in nessuna lingua misurata correttamente, e si avvicina di più in coreano, 4,31% di CER contro il 3,54% del primo della riga. Il cantonese è l’unica lingua misurata correttamente in cui ha superato Whisper Large V3 Turbo, 8,69% contro 36,75% di CER. Usa il motore integrato se copre la tua lingua e preferisci lasciare che macOS gestisca il pacchetto lingua; usa Whisper Large V3 Turbo per il risultato più accurato, oppure se la tua lingua è una delle tre che qui mancano ad Apple Speech.
Quali lingue supporta Apple Speech?
L’elenco è deciso da macOS, non da un’app. In questo test Apple Speech ha prodotto risultati in 21 delle 83 configurazioni linguistiche provate, contro 83 per entrambe le versioni di Whisper, 30 per Qwen3-ASR 1.7B e 25 per Parakeet V3. Fra le dieci lingue più usate nella tabella principale dispone di inglese, tedesco, giapponese, coreano, francese, cinese e spagnolo, ma non di olandese, polacco o russo. La seconda tabella contiene le altre quattordici configurazioni: italiano, cantonese, portoghese brasiliano e undici lingue in cui ha risposto con una traslitterazione latina anziché nella scrittura nativa. Un’app deve chiedere a macOS in fase di esecuzione quali lingue siano presenti su una determinata macchina. Se manca la tua lingua, Whisper raggiunge ogni lingua nell’elenco dell’app su tutti i canali.
Apple Speech o Parakeet V3: quale scegliere?
Parakeet V3, in ogni lingua europea coperta da entrambi. Ha ottenuto 6,89 contro 8,80 in inglese, 5,83 contro 7,61 in francese, 4,86 contro 5,41 in spagnolo, 3,43 contro 4,39 in italiano e 6,49 contro 9,35 in portoghese brasiliano; in tedesco i due sono alla pari a 6,26. Parakeet V3 non dispone di giapponese, coreano, cinese o cantonese, quindi lì Apple Speech è l’unico dei due disponibile, entro 1,5 punti dal primo della riga in giapponese, coreano e cinese. Parakeet V3 richiede un download di 465 MB e ha operato a 75,6× il tempo reale con un picco di 0,09 GiB; il pacchetto lingua di Apple Speech viene scaricato da macOS e ha operato a 30,8×, con una memoria che non riportiamo.
Che cos’è SpeechAnalyzer, ed è lo stesso della dettatura Apple?
SpeechAnalyzer è l’API ombrello che Apple ha presentato alla WWDC 2025 e distribuito in macOS 26 e iOS 26. SpeechTranscriber è la modalità operativa di trascrizione al suo interno, quella che abbiamo misurato e che in questo articolo chiamiamo Apple Speech. La dettatura è la modalità di compatibilità e abbiamo eseguito anche quella: Apple Speech è stato più accurato in tutte le dieci lingue gestite correttamente da entrambi, eliminando circa un terzo degli errori nella lingua mediana e oltre la metà in francese e tedesco. La dettatura copre più lingue, 33 configurazioni contro 21, quindi è il motore di sistema per olandese, polacco o russo, se puoi accettare un WER del 17,34%, 13,50% e 13,13%. Whisper Large V3 Turbo ha ottenuto 5,69%, 5,45% e 5,13% sulle stesse clip.
Quando uso Apple Speech, l’audio esce dal mio Mac?
Apple descrive SpeechTranscriber come riconoscimento vocale sul dispositivo: macOS scarica una volta le risorse linguistiche e il riconoscimento viene eseguito in locale. Abbiamo misurato accuratezza e velocità, non il comportamento della rete, quindi riportiamo questo aspetto come lo descrive Apple. I motori scaricati direttamente da Whisper Notes — Whisper, Parakeet V3, SenseVoice e Qwen3-ASR — girano sulla GPU o sul Neural Engine del tuo Mac senza account né API key, e la trascrizione funziona anche con la rete spenta, su ogni canale.
Perché questi numeri non corrispondono all’accuratezza che ottengo sulle mie registrazioni?
Perché FLEURS è parlato letto, breve e pulito, mentre le tue registrazioni non lo sono. Il nostro test è una calibrazione su un dataset pubblico: circa 150 frasi e 30 minuti di audio per lingua, un solo M5 MacBook Air e le stesse clip per ogni motore. Indica se un motore è plausibile per una lingua, non ciò che otterrai in una riunione, con audio rumoroso, con parlato accentato o su un file di due ore.
Perché altri benchmark dicono che Apple Speech batte Whisper?
Perché lo confrontano con Whisper Small, e solo in inglese. Su Whisper Small il nostro test concorda: fra le dieci lingue misurate correttamente da entrambi, Apple Speech ha vinto in otto. L’inglese è una delle due che ha perso, 8,80 contro 7,04. Con Whisper Large V3 Turbo il risultato non vale più: lì Apple Speech è rimasto indietro in otto di quelle dieci lingue, è arrivato alla pari in cinese a 7,97 ed è stato davanti solo in cantonese. Quale Whisper entra nel confronto decide il titolo.
Provalo
I cinque modelli scaricabili qui — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small e Qwen3-ASR 1.7B — sono tutti disponibili in Whisper Notes per Mac, versione con download diretto (DMG), in Impostazioni, poi Modello di trascrizione.
Se i nostri numeri non corrispondono alla tua esperienza in una lingua, scrivi a mac@whispernotes.app. Note di rilascio complete: whispernotes.app/changelog.
Fonti: il nostro test sullo split di test di Google FLEURS alla revisione 70bb2e84, la documentazione di Apple su SpeechAnalyzer, e il test di Qwen3-ASR su trenta lingue che lo ha preceduto.