Volíem respondre una pregunta: hi ha algun model local que transcrigui la teva llengua amb més precisió que Whisper Large V3? Per esbrinar-ho vam provar aquests models amb el conjunt de dades FLEURS.
FLEURS és un conjunt de dades de Google amb parla llegida en 102 llengües. De cada llengua en vam agafar unes 75 frases i vam fer passar els mateixos fragments, en el mateix ordre, per cinc models:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
Els resultats són aquests.
Qwen3-ASR 1.7B contra Whisper Large V3 Turbo — la nostra prova FLEURS, un sol MacBook Air M5, parla llegida, fragments curts.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| Llengües compatibles | 30 | 101 |
| Avantatges clars | Cantonès, hindi, tailandès, vietnamita, francès (5) | Finlandès, hongarès, grec i 8 llengües més (11) |
| Velocitat | 8,7× el temps real | 2,4× el temps real |
| Pic de memòria | 2,43 GiB | 1,87 GiB |
| Descàrrega | uns 2,5 GB | uns 1,6 GB |
Fora de les llengües fortes de cada model, la diferència de precisió és petita.
Whisper Large V3 vs Qwen3-ASR: la comparació llengua per llengua
Les 30 llengües, ordenades des del guany més gran de Qwen fins a la seva pèrdua més gran. A totes dues columnes, com més baix millor.
La nostra prova FLEURS, un sol MacBook Air M5, parla llegida. CER per al xinès, el cantonès, el japonès, el coreà i el tailandès, WER per a la resta; el verd marca un avantatge més ample que els marges d’error aparellats del 95%.
| Llengua | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| Cantonès | 6,00 | 37,97 |
| Hindi | 13,67 | 30,42 |
| Tailandès | 5,92 | 12,95 |
| Vietnamita | 5,07 | 9,79 |
| Persa | 26,98 | 30,03 |
| Àrab | 14,14 | 15,75 |
| Indonesi | 4,97 | 6,50 |
| Francès | 3,98 | 5,39 |
| Xinès | 5,69 | 6,88 |
| Anglès | 5,07 | 5,92 |
| Alemany | 3,51 | 4,10 |
| Japonès | 5,39 | 5,71 |
| Coreà | 3,51 | 3,70 |
| Espanyol | 3,60 | 3,76 |
| Italià | 2,98 | 3,05 |
| Rus | 5,98 | 5,51 |
| Portuguès | 5,64 | 4,91 |
| Macedoni | 17,81 | 16,64 |
| Malai | 11,60 | 10,18 |
| Neerlandès | 7,65 | 5,63 |
| Turc | 8,34 | 5,53 |
| Danès | 20,12 | 14,92 |
| Polonès | 12,78 | 5,32 |
| Romanès | 18,97 | 8,22 |
| Filipí | 20,44 | 9,37 |
| Suec | 20,04 | 8,72 |
| Txec | 23,92 | 11,15 |
| Grec | 30,20 | 12,97 |
| Finlandès | 26,08 | 6,54 |
| Hongarès | 36,35 | 13,66 |
La nostra prova aparellada sobre el conjunt de test de FLEURS, revisió 70bb2e84, unes 75 frases per llengua, un sol MacBook Air M5.
Les cinc llengües que Qwen3-ASR 1.7B guanya amb claredat. Taxa d’error en percentatge, Qwen contra Turbo: cantonès (6,0 contra 38,0), hindi (13,7 contra 30,4), tailandès (5,9 contra 13,0), vietnamita (5,1 contra 9,8), francès (4,0 contra 5,4). El cantonès i el tailandès es puntuen per caràcter, la resta per paraula. El seu avantatge és a les llengües puntuades per caràcter: en xinès, cantonès, japonès, coreà i tailandès va fer una mitjana del 5,3% contra el 13,4% de Turbo, mentre que a les altres vint-i-cinc, puntuades per paraula, va fer una mitjana del 14,0% contra el 10,2% de Turbo.
Les onze llengües que Whisper Large V3 Turbo guanya amb claredat. Taxa d’error en percentatge, Qwen contra Turbo, totes puntuades per paraula: hongarès (36,4 contra 13,7), grec (30,2 contra 13,0), finlandès (26,1 contra 6,5), txec (23,9 contra 11,2), filipí (20,4 contra 9,4), danès (20,1 contra 14,9), suec (20,0 contra 8,7), romanès (19,0 contra 8,2), polonès (12,8 contra 5,3), turc (8,3 contra 5,5), neerlandès (7,7 contra 5,6).
Les catorze que queden a prop o empatades. Anglès (5,1 contra 5,9), alemany (3,5 contra 4,1), espanyol (3,6 contra 3,8), italià (3,0 contra 3,1), rus (6,0 contra 5,5), portuguès (5,6 contra 4,9); el xinès (5,7 contra 6,9), el japonès (5,4 contra 5,7) i el coreà (3,5 contra 3,7) es puntuen per caràcter. Després, l’àrab, l’indonesi, el persa, el malai i el macedoni. Aquí totes les diferències són petites i cauen dins de la franja del 95%, o sigui que aquesta prova no pot separar els dos models.
El cantonès és l’única fila que canvia una decisió: 6,00% contra 37,97%, i SenseVoice Small — que havíem publicat com la resposta per al cantonès — va fer un 36,71% de CER amb els mateixos fragments. En aquest recull de parla llegida cap dels dos no arriba al llistó, o sigui que la recomanació antiga a partir d’ara porta aquest matís.
Com de ràpid és Qwen3-ASR 1.7B?
Els cinc motors, mesurats al mateix banc de proves i a la mateixa màquina (MacBook Air M5), de manera que com a mínim són comparables entre ells.
Factor de temps real medià a les llengües de cada motor dins de la mateixa prova FLEURS, un sol MacBook Air M5, parla llegida.
| Motor | Llengües | Velocitat mediana en aquesta prova (fragments curts) |
|---|---|---|
| SenseVoice Small | 6 opcions | 161,0× |
| Parakeet TDT 0.6B v3 | 25 | 82,9× |
| Qwen3-ASR 1.7B | 30 declarades | 8,7× |
| Whisper Small | 101 | 6,4× |
| Whisper Large V3 Turbo | 101 | 2,4× |
Són xifres de banc de proves amb fragments curts i queden per sota del que fan els mateixos motors amb una gravació llarga. Fes servir la columna per comparar els motors entre ells dins d’aquesta única prova, i per a res més.
Parakeet V3 i SenseVoice Small són aproximadament un ordre de magnitud més ràpids que Qwen3-ASR al mateix banc de proves. Amb fitxers llargs en comptes de fragments curts, Parakeet ha arribat a 103× el temps real en un M4 Pro i SenseVoice a 52× o més — una mesura diferent amb àudio diferent, que apunta cap al mateix lloc.
Qwen3-ASR queda al mig. En aquesta prova amb fragments curts no va ser el motor més lent — ho va ser Whisper Large V3 Turbo — però varia més d’una llengua a l’altra que la resta, de 2,7× en grec a 12,4× en japonès.
Quanta memòria i quant disc costa Qwen3-ASR?
El pic de memòria és l’ocupació màxima del procés observada element a element dins de la mateixa prova FLEURS, un sol MacBook Air M5, parla llegida, fragments curts.
| Motor | Descàrrega | Pic de memòria en aquesta prova |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0,09 GiB |
| Whisper Small | 600 MB | 0,87 GiB |
| SenseVoice Small | 827 MB | 0,95 GiB |
| Whisper Large V3 Turbo | uns 1,6 GB | 1,87 GiB |
| Qwen3-ASR 1.7B | uns 2,5 GB | 2,43 GiB |
En els dos eixos Qwen3-ASR és el més pesant dels cinc: uns 2,5 GB de descàrrega i 2,43 GiB de pic de memòria de procés en aquesta prova, contra uns 1,6 GB i 1,87 GiB de Whisper Large V3 Turbo.
En una màquina de 8 GB hi ha un camí més lleuger. Parakeet V3 cobreix 25 llengües amb 465 MB i 0,09 GiB, i Whisper Small en cobreix 101 amb 600 MB i 0,87 GiB.
Com ho vam mesurar: FLEURS, 30 llengües, un Mac
Qwen3-ASR 1.7B va funcionar com a build MLX de 8 bits i Whisper Large V3 Turbo com a build ggml de whisper.cpp sobre Metal. Les dades són el conjunt de test de Google FLEURS a la revisió 70bb2e84 (CC-BY-4.0): 83 de les seves 102 llengües, unes 75 frases i 15 minuts a cadascuna, els mateixos fragments en el mateix ordre per a tots els models; la comparació aparellada són les 30 llengües de Qwen. WER per a les llengües que separen les paraules amb espais, CER per al xinès, el cantonès, el japonès, el coreà i el tailandès, mai fosos en una sola xifra; els marges d’error surten d’un bootstrap element a element amb 10.000 remostreigs. Un sol MacBook Air M5, 32 GB, macOS 26.5, cap sortida buida ni cap error en cap dels dos models.
FLEURS és parla llegida, no és una reunió ni un dictat. A les nostres proves les classificacions de parla llegida ja han caigut dues vegades davant de l’àudio real, o sigui que no les extrapolem a les gravacions llargues: aquestes taules diuen si un model és plausible per a la teva llengua, no la precisió que obtindràs. L’avaluació de Qwen3-ASR 1.7B amb reunions reals serà un article a part.
Val la pena fer servir Qwen3-ASR en comptes de Whisper Large V3?
Llengua per llengua, dins de Whisper Notes per a Mac ho respondríem així.
- Si transcrius cantonès, hindi, tailandès, vietnamita o francès: tria Qwen3-ASR 1.7B.
- Si transcrius xinès, japonès, coreà, anglès, alemany, espanyol o italià: va anar al davant per un pèl, i és l’únic que en direm. Qualsevol dels dos models et va bé, igual que per al persa, l’àrab, l’indonesi, el rus, el portuguès, el macedoni i el malai.
- Si transcrius finlandès, hongarès, grec, txec, suec, danès, polonès, romanès, filipí, turc o neerlandès: queda’t amb Whisper Large V3 Turbo. Les va guanyar totes onze amb claredat.
- Si el que et preocupa és la velocitat o l’espai al disc: aquest motor no és el teu. Parakeet V3 i SenseVoice Small van ser un ordre de magnitud més ràpids amb una fracció de la descàrrega, i Whisper Small cobreix 101 llengües amb 600 MB a 6,4×.
- Si fas servir l’iPhone o la versió de la Mac App Store: allà el motor encara no hi és. En aquests canals l’opció per al cantonès és SenseVoice.
Així és com Whisper Notes per a Mac porta al dispositiu el Qwen3-ASR obert d’Alibaba: els pesos oberts convertits a Apple MLX a 8 bits, funcionant a la GPU del teu Mac, sense que cap àudio arribi als servidors d’Alibaba. No és el mateix model de 0.6B que SenseVoice va substituir a la versió de descàrrega directa (DMG) 1.5.0.
Com fer-lo servir (Mac de descàrrega directa, DMG 1.6.0 i posteriors): Configuració, després Model de transcripció, després Qwen3-ASR 1.7B. El model es baixa dins de l’app el primer cop que el fas servir i ocupa uns 2,5 GB. Demana macOS 15 o posterior en Apple silicon, amb 16 GB de memòria recomanats; la resta de l’app funciona en macOS 14. La llista de llengües de cada motor és a la nostra pàgina de suport de llengües. La CLI local i el servidor MCP accepten «qwen», «qwen3» i «qwen3-asr».
Si prefereixes no canviar, no cal que toquis res: Parakeet V3 continua sent el model per defecte.
Preguntes freqüents
Qwen3-ASR és més precís que Whisper Large V3 Turbo?
Depèn de la llengua, i el repartiment queda gairebé igualat. A la nostra prova FLEURS dins de Whisper Notes per a Mac, de les 30 llengües que cobreixen tots dos models, Qwen3-ASR 1.7B va anar al davant en 15 i Whisper Large V3 Turbo en 15. Qwen va liderar amb claredat el cantonès (6,00% contra 37,97% de CER), l’hindi (13,67% contra 30,42% de WER), el tailandès, el vietnamita i el francès. Turbo va liderar amb claredat el finlandès (6,54% contra 26,08% de WER), l’hongarès, el grec, el txec, el suec, el danès, el polonès, el romanès, el filipí, el turc i el neerlandès. Catorze de les trenta diferències cauen dins dels marges d’error i s’han de llegir com a empats. Tria Qwen3-ASR si la teva llengua és a la columna on ell guanya i fas servir la versió Mac de Whisper Notes de descàrrega directa (DMG); tria Whisper Large V3 Turbo per a tota la resta i per a qualsevol llengua fora de les 30 de Qwen, perquè Whisper arriba a les 101 opcions.
Puc fer servir Qwen3-ASR a l’iPhone o des de la Mac App Store?
Ara mateix és a la versió Mac de Whisper Notes de descàrrega directa (DMG), a partir de la 1.6.0. La versió de la Mac App Store hauria de rebre els motors més nous en versions posteriors, i no en tenim data. Mentrestant, l’app per a iPhone i la versió de la Mac App Store tenen tres famílies de motors — Whisper, Parakeet V3 i SenseVoice — i cada llengua que Qwen reconeix allà també la cobreix Whisper. Comptat en models, la versió de la Mac App Store n’ofereix quatre avui i la de descàrrega directa cinc, perquè Whisper arriba tant en Small com en Large V3 Turbo. Si necessites cantonès a l’iPhone, allà el motor que has de fer servir és SenseVoice.
Qwen3-ASR o SenseVoice per al xinès, el japonès i el coreà?
Van molt igualats en precisió i molt lluny en velocitat. A la nostra prova FLEURS, Qwen3-ASR va fer un 5,69% de CER en xinès, un 5,39% en japonès i un 3,51% en coreà; SenseVoice Small va fer un 7,06%, un 6,85% i un 7,82% amb els mateixos fragments. En aquella prova SenseVoice va anar a una mediana de 161× el temps real contra els 8,7× de Qwen, ocupa 827 MB de descàrrega en comptes d’uns 2,5 GB i està disponible a l’iPhone i a totes dues versions per a Mac. Tria SenseVoice, tret que transcriguis cantonès: allà Qwen3-ASR va fer un 6,00% de CER contra el 36,71% de SenseVoice, i la diferència és prou gran per compensar l’espera.
Quins són els requisits de sistema de Qwen3-ASR 1.7B?
Un Mac amb Apple silicon amb macOS 15 o posterior, amb 16 GB de memòria recomanats, més uns 2,5 GB de disc per al model. És més del que demana la resta de Whisper Notes per a Mac, que funciona amb macOS 14 i posteriors. A la nostra prova el model va arribar a un pic de 2,43 GiB de memòria de procés, el més alt dels cinc motors. En un Mac de 8 GB, Whisper Small cobreix la mateixa llista de 101 llengües amb 600 MB i Parakeet V3 cobreix 25 llengües europees amb 465 MB.
L’àudio surt del meu Mac quan faig servir Qwen3-ASR?
No. Alibaba també ofereix Qwen3-ASR com a servei al núvol, mitjançant les API DashScope Real-time i FileTrans, on l’àudio es puja als seus servidors. Whisper Notes no les fa servir. Executa els pesos oberts en local com a model MLX de 8 bits a la GPU del teu Mac, sense compte i sense clau d’API, i la transcripció funciona amb la xarxa apagada. Això val per a totes les famílies de motors de l’app, en tots els canals.
Per què aquests números no coincideixen amb la precisió que obtinc a les meves gravacions?
Perquè FLEURS és parla llegida, curta i neta, i les teves gravacions no ho són. La nostra prova és un calibratge sobre un conjunt de dades públic: unes 75 frases per llengua, un sol MacBook Air M5, els mateixos fragments per a tots els models. Serveix per preguntar-se si un model és plausible per a una llengua, i no és una predicció de la precisió que trauràs en una reunió, amb àudio sorollós, amb parla accentuada o en un fitxer de dues hores.
Prova-ho
Qwen3-ASR 1.7B és a Whisper Notes per a Mac a partir de la 1.6.0, només amb descàrrega directa (DMG). Configuració, després Model de transcripció. La prova gratuïta cobreix 10.000 paraules, prou per fer-hi passar la teva llengua i contradir les taules de més amunt.
Si trobes una llengua on els nostres números no coincideixen amb la teva experiència, escriu a mac@whispernotes.app. Notes de la versió completes: whispernotes.app/changelog.
Les fonts de tot això: la nostra prova sobre el conjunt de test de Google FLEURS a la revisió 70bb2e84, la fitxa del model Qwen3-ASR 1.7B i la taula de llengües de cada motor de la nostra pàgina de suport de llengües, que es genera a partir del codi de la mateixa app.