IN BREVE — Tre modelli on-device a confronto
| Parakeet V3 | SenseVoice Small | Whisper Large V3 Turbo | |
|---|---|---|---|
| 5 min inglese | 2,91s (103×) | 5,8s (52×) | 20,92s (14,3×) |
| 27 min cinese | Nessun supporto cinese | 13,83s (118×) | 2 min 4s (13,1×) |
| Lingue | 25 (europee) | 5 (zh, en, ja, ko, yue) | 100+ |
| Download | 465 MB | 827 MB | ~1,6 GB |
| Ideale per | Inglese e lingue europee | Cinese, giapponese, coreano, cantonese | Tutto il resto (100+ lingue) |
* Benchmark di velocità su Apple M4 Pro, 32 GB. Podcast in inglese di 5 minuti e podcast in cinese di 27 minuti. Fattore tempo reale = durata dell'audio ÷ tempo di elaborazione (più alto = più veloce). I benchmark si riferiscono alla versione Mac; SenseVoice è disponibile anche su iPhone.
A partire dalla versione 1.5.0 (Direct Download / DMG), Whisper Notes per Mac include SenseVoice Small come motore dedicato per la trascrizione di cinese, giapponese, coreano e cantonese. Sostituisce Qwen3-ASR e funziona sulla GPU di Apple tramite MLX invece che sulla CPU — elaborando un podcast cinese di 27 minuti in 13,83 secondi anziché 3 minuti e 44 secondi.
Perché abbiamo sostituito Qwen3-ASR
Qwen3-ASR era un modello solido. Supportava 30 lingue più 22 dialetti cinesi, e la sua accuratezza per il cinese era vicina allo stato dell'arte. Ma aveva un problema che peggiorava con la durata dell'audio: la velocità.
Qwen3 utilizzava un'architettura autoregressiva — lo stesso approccio di Whisper, che elabora l'audio fotogramma per fotogramma, senza mai saltare avanti. Su un podcast cinese di 27 minuti, impiegava 224 secondi. Utilizzabile, ma non l'esperienza di risultato istantaneo che Parakeet V3 offre per l'inglese.
Il problema più profondo era la nostra infrastruttura. La nostra integrazione Qwen3 utilizzava sherpa-onnx, una libreria C con un wrapper Swift di 2.249 righe che instradava tutto attraverso i core della CPU. La GPU restava inattiva mentre la CPU del tuo Mac faceva tutto il lavoro.
SenseVoice ha risolto entrambi i problemi. Architettura non autoregressiva per la velocità. Apple MLX per l'accelerazione GPU. Il risultato: un miglioramento di velocità di 16,2× sullo stesso hardware, con un codice ridotto da 2.249 a 288 righe.
Il benchmark
Tutti e tre i modelli eseguiti sullo stesso Apple M4 Pro, stessi file audio, stesse condizioni. Nessun cloud. Nessun internet. Solo silicio.
| Modello | 5 min inglese | 27 min cinese | Velocità (RTFx) |
|---|---|---|---|
| Parakeet V3 | 2,91s | Nessun supporto cinese | 103× |
| SenseVoice Small | 5,8s | 13,83s | 52–118× |
| Whisper Large V3 Turbo | 20,92s | 2 min 4s | 13–14× |
| Qwen3-ASR (rimosso) | — | 224s | 7,2× |
In inglese SenseVoice va a circa metà della velocità di Parakeet — e resta comunque straordinariamente veloce. In cinese Parakeet non è nemmeno un'opzione, e SenseVoice completa un podcast di 27 minuti in meno di 14 secondi. Premi trascrivi, aspetti un respiro, e il testo è lì.
Confrontalo con Whisper a 2 minuti e 4 secondi, o con il vecchio Qwen3 a 3 minuti e 44 secondi. L'architettura conta più del numero di parametri.
Benchmark ufficiale di inferenza dal paper FunAudioLLM: SenseVoice-Small elabora 10s di audio in 70ms (GPU A800). Whisper-Large-V3 impiega 1.281ms sullo stesso hardware. Da notare: questa è latenza di inferenza su GPU da datacenter, non i numeri su dispositivo qui sopra.
| Modello | Tempo di caricamento | Dimensione download |
|---|---|---|
| Parakeet V3 | 0,77s | 465 MB |
| SenseVoice Small | 0,81s | 827 MB |
| Whisper Small | 1,03s | 600 MB |
| Whisper Large V3 Turbo | 3,18s | ~1,6 GB |
* Tempo di caricamento misurato su Apple M4 Pro, 32 GB.
SenseVoice si carica in meno di un secondo. Su un Mac da 8 GB, funziona comodamente insieme alle altre applicazioni.
Perché SenseVoice è più veloce: architettura + runtime
Il divario di velocità tra Qwen3-ASR e SenseVoice deriva da due fattori indipendenti.
Fattore 1: Architettura del modello. Qwen3-ASR è autoregressivo — genera testo token per token, ciascuno dipendente dal precedente. SenseVoice utilizza un encoder non autoregressivo (NAR) che elabora l'intero audio in parallelo. Questa differenza architetturale da sola rende SenseVoice fondamentalmente più veloce, indipendentemente dall'hardware utilizzato.
Fattore 2: Runtime. La nostra integrazione Qwen3-ASR utilizzava sherpa-onnx, che funzionava su CPU. SenseVoice funziona tramite Apple MLX, indirizzando i calcoli alla GPU. Qwen3 potrebbe funzionare anche su MLX? Sì — ma sarebbe comunque più lento di SenseVoice perché il collo di bottiglia autoregressivo è nell'architettura, non nel runtime.
| Qwen3-ASR (vecchio) | SenseVoice (nuovo) | |
|---|---|---|
| Architettura | Autoregressiva (token per token) | Non autoregressiva (parallela) |
| Runtime | sherpa-onnx (CPU) | Apple MLX (GPU) |
| 27 min cinese | 224 secondi | 13,83 secondi |
| Accelerazione combinata | riferimento | 16,2× più veloce |
| Codice sorgente | Framework C da 168 MB + 2.249 righe Swift | 288 righe Swift Actor |
* Stesso podcast cinese di 27 minuti, Apple M4 Pro. L'accelerazione di 16,2× combina miglioramenti sia architetturali (NAR vs AR) che di runtime (GPU vs CPU).
Anche il codice è diventato più semplice. La nuova implementazione SenseVoice è un singolo Swift Actor di 288 righe che comunica direttamente con MLX, sostituendo un framework C da 168 MB. Meno codice, meno bug, app più leggera.
Cinque lingue, fatte bene
SenseVoice non cerca di fare tutto. Gestisce cinque lingue:
| Lingua | SenseVoice-Small | Whisper-Large-V3 | Vincitore |
|---|---|---|---|
| Cinese (zh-CN) | 10,78% CER | 12,55% CER | SenseVoice (-14%) |
| Cantonese (yue) | 7,09% CER | 10,41% CER | SenseVoice (-32%) |
| Giapponese (ja) | 11,96% CER | 10,34% CER | Whisper (di poco) |
| Coreano (ko) | 8,28% CER | 5,59% CER | Whisper |
| Inglese (en) | 14,71% WER | 9,39% WER | Whisper (usa Parakeet) |
* Benchmark CommonVoice, CER = tasso di errore per carattere, WER = tasso di errore per parola. Più basso è meglio. Fonte: paper FunAudioLLM (2024). Latenza di inferenza SenseVoice-Small: 70ms per 10s di audio su una GPU A800, contro 1.281ms di Whisper-Large-V3 sullo stesso hardware.
Benchmark CommonVoice: SenseVoice-Small (giallo) vs Whisper-Small (blu) vs Whisper-Large-V3 (arancione). Più basso è meglio. Fonte: paper FunAudioLLM
I numeri raccontano una storia onesta. SenseVoice batte Whisper nell'accuratezza per cinese e cantonese con un margine significativo, mentre Whisper è più preciso per giapponese, coreano e inglese. Ma SenseVoice gira a 52× il tempo reale o più su Apple Silicon. Per la maggior parte degli usi reali, la differenza di velocità conta più di qualche punto percentuale di accuratezza.
Il risultato per il cantonese merita di essere evidenziato separatamente. Whisper-Small ottiene il 38,97% di CER sul cantonese — quasi inutilizzabile. Anche Whisper-Large-V3 raggiunge solo il 10,41%. SenseVoice arriva al 7,09%. Prima di SenseVoice, non esisteva un buon modo per trascrivere il cantonese localmente su un Mac. Se parli cantonese, questo modello è stato creato per te.
Trascrizione coreana con SenseVoice: importazione video con sottotitoli temporizzati
Test nel mondo reale: podcast cinese di 27 minuti
Abbiamo trascritto un episodio di 27 minuti di Thirteen Invitations (十三邀), un podcast cinese di interviste, con SenseVoice e Whisper Large V3 Turbo sullo stesso M4 Pro. ElevenLabs Scribe (cloud) è servito come riferimento. Entrambi i modelli on-device commettono circa lo stesso numero di errori, ma di tipi diversi:
| SenseVoice | Whisper Large V3 | |
|---|---|---|
| Tempo | 13,83s | 2 min 4s |
| Errori (campione di 5 min) | ~15–20 | ~12–15 |
| Errore peggiore | 时差→食堂 (fuso orario→mensa) | 西昌→西藏 (città di Xichang→Tibet, 4.000 km di errore) |
| Schema degli errori | Scambio di omofoni | Errori geografici/fattuali |
* Confronto manuale con ElevenLabs Scribe (riferimento cloud, anch'esso imperfetto). Entrambi i modelli on-device hanno scritto correttamente «根深蒂固» dove Scribe ha sbagliato.
Accuratezza comparabile, e la trascrizione è pronta in 13,83 secondi invece che in due minuti. Per la trascrizione cinese nel mondo reale, SenseVoice ti fornisce un trascritto utilizzabile prima che Whisper abbia finito di caricarsi.
Quando usare quale modello
Whisper Notes per Mac ora include quattro modelli vocali in entrambe le versioni per Mac, e la versione a download diretto (DMG) ne aggiunge un quinto dalla 1.6.0: Qwen3-ASR 1.7B (Beta). Ognuno dei quattro qui sotto è ottimizzato per uno scenario diverso:
| Hai bisogno di... | Usa questo modello | Perché |
|---|---|---|
| Inglese o lingue europee, massima velocità | Parakeet V3 | 103× tempo reale, tasso di errore più basso. Il predefinito. |
| Cinese, giapponese, coreano o cantonese | SenseVoice Small | 52–118× tempo reale. Unico modello con supporto cantonese su iPhone e nella versione Mac App Store. |
| Qualsiasi delle 100+ lingue (arabo, thai, russo, ecc.) | Whisper Large V3 Turbo | Supporto linguistico più ampio. Più lento ma universale. |
| Tutte le 101 lingue su un Mac meno recente | Whisper Small | 600 MB, il più leggero dei modelli Whisper, e copre comunque 101 lingue. |
Impostazioni → Modello di trascrizione: scegli il motore giusto per la tua lingua
Il selettore modelli nelle Impostazioni mostra tutti i modelli disponibili nella tua versione, con dimensioni di download, numero di lingue e requisiti di memoria. SenseVoice viene scaricato al primo utilizzo (~827 MB) e resta sul tuo dispositivo.
I compromessi
SenseVoice non è un modello universale. Ecco cosa non può fare:
• Solo 5 lingue. Se ti servono thai, russo, arabo, hindi o un'altra lingua al di fuori del focus CJK di SenseVoice, resta con Whisper.
• Aggiornamento: SenseVoice è arrivato inizialmente solo su Mac tramite Apple MLX, ma ora è disponibile anche su iPhone — iOS supporta la stessa gamma di modelli del Mac: Parakeet V3, Whisper e SenseVoice.
• Particolarità con audio silenzioso. Durante segmenti molto brevi o molto silenziosi, SenseVoice può talvolta produrre testo in cinese indipendentemente dalla lingua selezionata. Impostare la lingua manualmente (invece di «Auto») riduce questo comportamento.
• Nessuno streaming. A differenza della modalità streaming di Whisper, SenseVoice elabora l'audio completo dopo la registrazione. Per file lunghi, segmenta automaticamente nei punti di silenzio e mostra i risultati progressivamente.
Questi sono vincoli architetturali, non bug. Un modello addestrato su 5 lingue padroneggia quelle 5 lingue in modo eccellente. La copertura di 100+ lingue di Whisper si paga con una velocità inferiore e un'accuratezza disomogenea da lingua a lingua.
Vuoi confrontare tutte le opzioni locali? Ogni modello speech-to-text on-device — le varianti di Whisper, Parakeet V3, SenseVoice e Voxtral — è messo a confronto fianco a fianco nella nostra pagina di confronto dei modelli Whisper. Non conosci ancora Whisper? Parti dalla guida alla trascrizione con Whisper — che cos'è il modello, tutti i modi per eseguirlo e quanto costa.
Domande frequenti
Qual è l'alternativa a Whisper più veloce per trascrivere cinese, giapponese e coreano?
SenseVoice Small è disponibile in Whisper Notes sia su Mac che su iPhone. Nel nostro test su Mac con un M4 Pro ha trascritto un podcast cinese di 27 minuti in 13,83 secondi (52–118× il tempo reale), mentre Whisper Large V3 Turbo ha impiegato oltre 2 minuti per lo stesso file.
SenseVoice è migliore di Whisper per il cinese?
Per cinese e cantonese, sì. Sul benchmark CommonVoice, SenseVoice ottiene un CER del 10,78% sul cinese contro il 12,55% di Whisper-Large-V3, e sul nostro M4 Pro ha elaborato un podcast di 27 minuti in 13,83 secondi contro i 2 minuti e 4 secondi di Whisper. Whisper resta leggermente più preciso per giapponese e coreano: se sono le tue lingue principali, entrambi i motori restano una scelta sensata.
Posso trascrivere il cantonese localmente su un Mac?
Sì. SenseVoice ottiene un CER del 7,09% sul cantonese, contro il 10,41% di Whisper-Large-V3 e il 38,97%, quasi inutilizzabile, di Whisper-Small. Prima di SenseVoice non esisteva un buon modo per trascrivere il cantonese localmente su un Mac.
SenseVoice funziona su iPhone?
Sì. Whisper Notes su iPhone supporta la stessa gamma di modelli del Mac — Parakeet V3, Whisper e SenseVoice — quindi puoi trascrivere cinese, giapponese, coreano e cantonese localmente anche sul tuo iPhone.
Provalo
SenseVoice è disponibile in Whisper Notes per Mac dalla v1.5.0 (Direct Download / DMG) in poi e nell'attuale app per iPhone. Su Mac, scaricalo da Impostazioni → Modello di trascrizione → SenseVoice Small (~827 MB). La versione Mac richiede Apple Silicon (M1 o successivo).
Se usi Parakeet V3 e detti principalmente in inglese, non c'è bisogno di cambiare. SenseVoice è per quando hai bisogno di cinese, giapponese, coreano o cantonese — e lo vuoi veloce.
Registro completo delle modifiche: whispernotes.app/changelog
Domande o feedback: mac@whispernotes.app