Des de macOS 26 i iOS 26, Apple ofereix una nova generació de reconeixement de veu al dispositiu: SpeechAnalyzer i SpeechTranscriber, que d’ara endavant anomenarem Apple Speech. És força més precís que l’antic motor de dictat. Per això volíem saber: el reconeixement de veu integrat d’Apple ja és prou bo per prescindir completament d’una app de transcripció? I a quina distància queda dels models oberts al dispositiu de Whisper Notes —Whisper, Parakeet, SenseVoice i Qwen3-ASR—? Vam fer una prova rigorosa. Aquests són els resultats. En les deu llengües que vam provar, Apple Speech no va tenir mai la taxa d’error més baixa, va quedar a menys d’1,5 punts del líder en coreà, japonès i xinès, i no té cap model per al neerlandès, el rus ni el polonès.
A quina distància queda Apple Speech dels models que descarregues?
| Llengua | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Anglès | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Alemany | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Neerlandès | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Rus | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Polonès | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Japonès | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Coreà | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Francès | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Xinès | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Espanyol (Llatinoamèrica) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Deu de les llengües més utilitzades, un motor per columna. Cada cel·la indica la taxa d’error del motor; com més baixa, millor. El verd assenyala la més baixa de la fila i el blanc la segona. CER per al japonès, el coreà i el xinès; WER per a la resta, sense combinar-los mai en una sola xifra. La nostra pròpia prova amb FLEURS, feta per l’equip de Whisper Notes, en un M5 MacBook Air i parla llegida.
Noms abreujats: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Un guió indica que el motor no té cap model per a aquella llengua.
Qwen3-ASR 1.7B obté la taxa d’error més baixa en sis de les deu llengües i Whisper Large V3 Turbo en les altres quatre. Apple Speech queda 0,77 punts per darrere del líder de la fila en coreà, 1,06 en japonès i 1,48 en xinès, on empata amb Whisper Large V3 Turbo en 7,97. En les set llengües que admet, queda entre 0,8 i 4,3 punts per darrere del líder de la fila; la distància més gran és en anglès, amb 8,80 contra 4,49. No hi ha resultats d’Apple Speech per al neerlandès, el polonès ni el rus.
Quines llengües admet Apple Speech?
Apple Speech va retornar resultats per a 21 de les 83 configuracions de llengua d’aquesta prova. Tots dos models Whisper cobreixen les 83; Qwen3-ASR 1.7B, 30; i Parakeet V3, 25. De les deu llengües anteriors, no té cap model per al neerlandès, el polonès ni el rus. No hi ha cap llista fixa per citar: els recursos de llengua pertanyen a macOS, de manera que una app consulta en temps d’execució quins estan disponibles en cada màquina.
| Llengua | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Italià | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Cantonès | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Portuguès (Brasil) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Hindi | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Telugu | 101,63 | — | 81,74 | 103,19 | — | — |
| Urdu | 101,69 | — | 23,39 | 38,83 | — | — |
| Panjabi | 101,75 | — | 92,05 | 103,40 | — | — |
| Bengalí | 102,00 | — | 83,52 | 117,37 | — | — |
| Nepalès | 102,13 | — | 88,59 | 118,84 | — | — |
| Malayalam | 102,18 | — | 107,34 | 167,16 | — | — |
| Marathi | 102,23 | — | 82,69 | 109,95 | — | — |
| Kannada | 103,83 | — | 72,07 | 116,10 | — | — |
| Gujarati | 104,52 | — | 75,31 | 108,91 | — | — |
| Tamil | 113,01 | — | 71,28 | 79,77 | — | — |
Les altres catorze llengües per a les quals Apple Speech va retornar un resultat, ordenades segons la seva pròpia taxa d’error. Les mateixes columnes, colors i abreviacions d’abans; CER per al cantonès i WER per a la resta. Una taxa d’error pot superar el 100% perquè les insercions també compten al numerador.
A les onze últimes files, de l’hindi al tàmil, Apple Speech va respondre amb una transliteració a l’alfabet llatí en comptes de l’escriptura nativa. Per tant, la seva taxa d’error mesura una diferència d’escriptura i no la precisió del reconeixement; aquestes cel·les no s’inclouen a la classificació de la fila. Els valors dels altres motors en aquestes files són mesures normals.
Com funciona SpeechAnalyzer
Apple disposa d’una API de reconeixement de veu des d’iOS 10. Aquesta API, SFSpeechRecognizer, és el motor de l’antic sistema de dictat. SpeechAnalyzer la substitueix: es va presentar amb macOS 26 i iOS 26 i està disponible en totes les plataformes d’Apple excepte watchOS.
L’API s’organitza al voltant d’una sessió. Crees un SpeechAnalyzer, li assignes un o diversos mòduls i li proporciones àudio; SpeechTranscriber és el mòdul que converteix la veu en text. L’àudio entra com una seqüència asíncrona que tu mateix alimentes, els resultats tornen en una segona seqüència i totes dues se solen executar en tasques diferents. L’analitzador accepta una seqüència d’entrada cada vegada. Cada memòria intermèdia i cada resultat porten una marca de temps referida a la línia temporal de l’àudio, de manera que un resultat es pot tornar a col·locar allà on es va originar.
Una sessió, tres tasques: l’àudio entra com una AsyncSequence, SpeechAnalyzer i SpeechTranscriber l’analitzen i els resultats tornen en una segona AsyncSequence que pot llegir la interfície. Font: Apple, sessió 277 de la WWDC25.
Els resultats arriben dues vegades. Tot el que es troba dins del que Apple anomena interval volàtil encara es pot substituir per un resultat millor; el que queda fora és definitiu. Així és com una app pot mostrar una transcripció aproximada mentre encara parles i corregir-la després.
Apple declara cinc objectius de disseny per al model SpeechTranscriber: àudio llarg, parla conversacional, parlants llunyans, baixa latència i privacitat, és a dir, execució al dispositiu. Notes, Notes de Veu, Diari i els resums de trucades s’hi basen.
Els cinc objectius de disseny declarats per Apple per al model SpeechTranscriber. Font: Apple, sessió 277 de la WWDC25.
Els models no formen part de cap app. Es descarreguen dels servidors d’Apple mitjançant AssetInventory, el sistema els emmagatzema i actualitza, i es comparteixen entre apps. No afegeixen res a la mida de descàrrega ni a l’espai de memòria d’una app, i la descodificació té lloc fora del procés que fa la crida. Quan SpeechTranscriber no disposa d’un model per a una llengua o un dispositiu, DictationTranscriber pren el relleu amb els mateixos models que el dictat del sistema.
Com ho vam mesurar
Cada motor d’aquest article va transcriure els mateixos fragments, en el mateix ordre i d’un en un, en un M5 MacBook Air (32 GB, macOS 27.0). L’àudio prové del conjunt de test de Google FLEURS, revisió 70bb2e84, amb unes 150 frases i 30 minuts per llengua. Un hash fix dels identificadors d’elements del mateix conjunt de dades ordena els elements, i agafem la seqüència més curta d’elements complets que supera els trenta minuts; cap resultat dels models va intervenir en aquesta elecció. Cada cel·la es va reconstruir a partir del seu propi registre i es va tornar a comprovar: les 285 van passar.
Les puntuacions són la taxa d’error per paraula quan les paraules se separen amb espais, i la taxa d’error per caràcter per al japonès, el coreà, el xinès i el cantonès. FLEURS conté parla llegida, no una reunió ni dictat. Aquestes taules indiquen si un motor és una opció raonable per a la teva llengua, no el que obtindràs amb les teves pròpies gravacions.
Quant millora respecte de l’antic Dictat d’Apple?
Apple ofereix dos modes de transcripció i vam mesurar tots dos. SpeechTranscriber és el nou, que aquest article anomena Apple Speech. DictationTranscriber és el mode de compatibilitat, el sistema de dictat que abans feia servir un Mac.
| Llengua | Dictat d’Apple | Apple Speech |
|---|---|---|
| Coreà | 7,11 | 4,31 |
| Italià | 6,93 | 4,39 |
| Espanyol (Llatinoamèrica) | 8,43 | 5,41 |
| Alemany | 12,69 | 6,26 |
| Japonès | 9,37 | 6,36 |
| Francès | 17,10 | 7,61 |
| Xinès | 10,28 | 7,97 |
| Cantonès | 10,18 | 8,69 |
| Anglès | 13,83 | 8,80 |
| Portuguès (Brasil) | 10,85 | 9,35 |
Totes les llengües que tots dos modes d’Apple van mesurar correctament, ordenades segons la taxa d’error d’Apple Speech; el verd assenyala el millor valor de la fila. La mateixa prova, els mateixos fragments i el mateix Mac. CER per al japonès, el coreà, el xinès i el cantonès; WER per a la resta.
Apple Speech és més precís en les deu llengües. En la llengua mediana desapareix aproximadament un terç dels errors; en francès i alemany, més de la meitat; i en portuguès brasiler i cantonès, prop d’un error de cada set.
Aquesta és una comparació amb la tecnologia anterior d’Apple. Contra els models que descarregues, la seva millor posició en una llengua mesurada correctament és la segona, en cantonès. Dictat cobreix més llengües: 33 configuracions contra 21 en aquesta prova, incloses les tres que falten al motor nou.
Quins avantatges ofereix el motor integrat?
| Motor | Velocitat | Pic de memòria | Descàrrega |
|---|---|---|---|
| SenseVoice Small | 162,3× el temps real | 0,95 GiB | 827 MB |
| Parakeet V3 | 75,6× el temps real | 0,09 GiB | 465 MB |
| Apple Speech | 30,8× el temps real | no indicat | paquet de llengua descarregat per macOS, no per l’app |
| Qwen3-ASR 1.7B | 11,1× el temps real | 2,43 GiB | uns 2,5 GB |
| Whisper Small | 7,9× el temps real | 0,87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3,0× el temps real | 1,87 GiB | uns 1,6 GB |
La velocitat és la mediana de cada motor en les tretze llengües que aquest article mesura correctament, comptant només aquelles que va executar: el rendiment de processament d’elements aïllats, una dada de diagnòstic i no la latència del producte. El pic de memòria és el màxim del grup de processos en aquesta prova. Apple Speech descodifica dins d’un servei de macOS que no pertany a l’app que el crida, de manera que cap xifra tindria allà el mateix significat que per als altres cinc.
El sistema descarrega una sola vegada els recursos de llengua d’Apple Speech i els comparteix entre totes les apps. L’app no inclou cap model ni assigna res al seu propi procés. El servei del sistema sí que utilitza memòria mentre funciona, però no la podem atribuir amb exactitud, així que no indiquem cap xifra en comptes de mostrar un zero. Va funcionar a 30,8× el temps real, per darrere de Parakeet V3 i SenseVoice Small.
Whisper Large V3 Turbo guanya quatre de les deu files i és el motor més lent d’aquesta prova, unes deu vegades més lent que Apple Speech, amb uns 1,6 GB al disc. Qwen3-ASR 1.7B guanya les altres sis, amb uns 2,5 GB i 2,43 GiB de memòria. Parakeet V3 ocupa 465 MB i 0,09 GiB, supera Turbo en francès, queda per darrere en polonès i no admet japonès, coreà, xinès ni cantonès. Whisper Small és la comparació més propera amb 600 MB, i Apple Speech va ser més precís en vuit de les deu llengües que tots dos van mesurar correctament.
Hauries d’utilitzar Apple Speech en lloc d’un model descarregat?
Llengua per llengua:
- Anglès: no és una bona opció. Apple Speech va obtenir 8,80; Qwen3-ASR 1.7B (4,49) o Whisper Large V3 Turbo (5,49) és clarament més precís.
- Alemany: no és una bona opció. Apple Speech va obtenir 6,26; Qwen3-ASR 1.7B (2,85) o Whisper Large V3 Turbo (4,05) és clarament més precís.
- Neerlandès, rus i polonès: Apple Speech no té cap model per a aquestes tres llengües. Whisper Large V3 Turbo va ser el més precís en cadascuna, amb 5,69, 5,13 i 5,45.
- Japonès: es pot utilitzar. Apple Speech va obtenir 6,36, per darrere de Whisper Large V3 Turbo, amb 5,30.
- Coreà: es pot utilitzar. Apple Speech va obtenir 4,31, per darrere de Qwen3-ASR 1.7B, amb 3,54.
- Francès: no és una bona opció. Apple Speech va obtenir 7,61; Qwen3-ASR 1.7B (4,57) o Parakeet V3 (5,83) és clarament més precís.
- Xinès: es pot utilitzar. Apple Speech va obtenir 7,97, igual que Whisper Large V3 Turbo; el més precís va ser Qwen3-ASR 1.7B, amb 6,49.
- Espanyol: no és una bona opció. Apple Speech va obtenir 5,41; Qwen3-ASR 1.7B (3,38) o Whisper Large V3 Turbo (3,62) és clarament més precís.
Apple Speech és el nom abreujat que aquest article dona al SpeechTranscriber d’Apple, l’API al dispositiu que qualsevol app per a Mac pot utilitzar en macOS 26 o posterior. No és un dels models que Whisper Notes per a Mac descarrega: a la versió de descàrrega directa per a Mac (DMG) són Whisper, Parakeet V3, SenseVoice i Qwen3-ASR; a l’iPhone i a la versió de la Mac App Store són Whisper, Parakeet V3 i SenseVoice. La taula per motor és a la nostra pàgina de suport de llengües.
Res d’això no canvia el funcionament actual de Whisper Notes per a Mac: Parakeet V3 continua sent el model predeterminat.
Preguntes freqüents
Apple Speech és tan precís com Whisper?
No en la majoria de les llengües que tots dos cobreixen. A la nostra pròpia prova amb FLEURS, entre les set d’aquestes deu llengües que admet Apple Speech, Whisper Large V3 Turbo va ser més precís en sis i tots dos van empatar exactament en xinès, amb un CER del 7,97% cadascun. Contra Whisper Small s’inverteix l’ordre: Apple Speech va quedar per davant en sis de les set i només va perdre en anglès, amb un WER del 8,80% contra el 7,04%. No lidera cap llengua mesurada correctament en aquesta prova i on més s’acosta és en coreà, amb un CER del 4,31% contra el 3,54% del líder de la fila. El cantonès és l’única llengua mesurada correctament en què va superar Whisper Large V3 Turbo, amb un CER del 8,69% contra el 36,75%. Utilitza el motor integrat si admet la teva llengua i prefereixes que macOS gestioni el paquet de llengua; utilitza Whisper Large V3 Turbo per obtenir el resultat més precís o si la teva llengua és una de les tres que Apple Speech no ofereix aquí.
Quines llengües admet Apple Speech?
macOS decideix la llista, no cap app. En aquesta prova, Apple Speech va produir resultats per a 21 de les 83 configuracions de llengua que vam provar, contra 83 per a les dues versions de Whisper, 30 per a Qwen3-ASR 1.7B i 25 per a Parakeet V3. De les deu llengües més utilitzades de la taula principal, admet anglès, alemany, japonès, coreà, francès, xinès i espanyol, però no neerlandès, polonès ni rus. La segona taula conté les altres catorze configuracions: italià, cantonès, portuguès brasiler i onze llengües en què va respondre amb una transliteració a l’alfabet llatí en lloc de l’escriptura nativa. Una app ha de consultar a macOS en temps d’execució quines llengües estan instal·lades en cada màquina. Si hi falta la teva, Whisper cobreix totes les llengües de la llista de l’app en tots els canals.
Apple Speech o Parakeet V3: quin cal triar?
Parakeet V3, en totes les llengües europees que tots dos cobreixen. Va obtenir 6,89 contra 8,80 en anglès; 5,83 contra 7,61 en francès; 4,86 contra 5,41 en espanyol; 3,43 contra 4,39 en italià; i 6,49 contra 9,35 en portuguès brasiler. En alemany empaten en 6,26. Parakeet V3 no admet japonès, coreà, xinès ni cantonès, de manera que Apple Speech és l’únic dels dos disponible per a aquestes llengües i queda a menys d’1,5 punts del líder de la fila en japonès, coreà i xinès. Parakeet V3 requereix una descàrrega de 465 MB i va funcionar a 75,6× el temps real amb un pic de 0,09 GiB; macOS descarrega el paquet de llengua d’Apple Speech, que va funcionar a 30,8× amb una memòria que no indiquem.
Què és SpeechAnalyzer i és el mateix que Dictat d’Apple?
SpeechAnalyzer és l’API general que Apple va presentar a la WWDC 2025 i va publicar amb macOS 26 i iOS 26. SpeechTranscriber és el mode de transcripció que conté; és el que vam mesurar i el que aquest article anomena Apple Speech. Dictat és el mode de compatibilitat i també el vam provar: Apple Speech va ser més precís en les deu llengües que tots dos van mesurar correctament, va eliminar prop d’un terç dels errors en la llengua mediana i més de la meitat en francès i alemany. Dictat cobreix més llengües, 33 configuracions contra 21, per la qual cosa és el motor del sistema per al neerlandès, el polonès o el rus si pots acceptar un WER del 17,34%, 13,50% i 13,13%. Whisper Large V3 Turbo va obtenir 5,69%, 5,45% i 5,13% amb els mateixos fragments.
L’àudio surt del meu Mac quan utilitzo Apple Speech?
Apple documenta SpeechTranscriber com a reconeixement de veu al dispositiu: macOS descarrega una vegada els recursos de llengua i el reconeixement s’executa en local. Vam mesurar la precisió i la velocitat, no el comportament de la xarxa, de manera que descrivim aquesta part tal com ho fa Apple. Els motors que descarrega Whisper Notes —Whisper, Parakeet V3, SenseVoice i Qwen3-ASR— s’executen a la GPU o el Neural Engine del teu Mac, sense compte ni API key, i la transcripció funciona sense connexió en tots els canals.
Per què aquestes xifres no coincideixen amb la precisió que obtinc a les meves gravacions?
Perquè FLEURS conté parla llegida, curta i neta, i les teves gravacions no. La nostra prova és un calibratge amb un conjunt de dades públic: unes 150 frases i 30 minuts d’àudio per llengua, un M5 MacBook Air i els mateixos fragments per a cada motor. Indica si un motor és una opció raonable per a una llengua, no el que obtindràs en una reunió, amb àudio sorollós, amb accent o en un fitxer de dues hores.
Per què altres comparatives diuen que Apple Speech supera Whisper?
Perquè el comparen amb Whisper Small i només en anglès. Contra Whisper Small la nostra prova hi coincideix: de les deu llengües que tots dos van mesurar correctament, Apple Speech va guanyar en vuit. L’anglès és una de les dues que va perdre, 8,80 contra 7,04. El resultat no es trasllada a Whisper Large V3 Turbo: allà Apple Speech va quedar per darrere en vuit d’aquelles deu llengües, va empatar en xinès en 7,97 i només va liderar en cantonès. Quin Whisper entra a la comparació decideix el titular.
Prova-ho
Els cinc models descarregables d’aquest article —Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small i Qwen3-ASR 1.7B— són a Whisper Notes per a Mac, versió de descàrrega directa (DMG), a Configuració i, després, Model de transcripció.
Si les nostres xifres no coincideixen amb la teva experiència en una llengua, escriu a mac@whispernotes.app. Notes completes de la versió: whispernotes.app/changelog.
Fonts: la nostra prova amb el conjunt de test de Google FLEURS, revisió 70bb2e84; la documentació d’Apple sobre SpeechAnalyzer, i la prova anterior de Qwen3-ASR en trenta llengües que la va precedir.