Desde macOS 26 e iOS 26, Apple ofrece una nueva generación de reconocimiento de voz en el dispositivo: SpeechAnalyzer y SpeechTranscriber, que en adelante llamaremos Apple Speech. Es bastante más preciso que el antiguo motor de dictado. Por eso queríamos saber: ¿es ya lo bastante bueno el reconocimiento de voz integrado de Apple como para prescindir por completo de una app de transcripción? ¿Y a qué distancia está de los modelos abiertos en el dispositivo de Whisper Notes —Whisper, Parakeet, SenseVoice y Qwen3-ASR—? Hicimos una prueba rigurosa. Estos son los resultados. En los diez idiomas que probamos, Apple Speech nunca tuvo la tasa de error más baja, quedó a menos de 1.5 puntos del líder en coreano, japonés y chino, y no tiene ningún modelo para neerlandés, ruso ni polaco.
¿A qué distancia está Apple Speech de los modelos que descargas?
| Idioma | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Inglés | 8.80 | 4.49 | 5.49 | 7.04 | 6.89 | 8.46 |
| Alemán | 6.26 | 2.85 | 4.05 | 8.67 | 6.26 | — |
| Neerlandés | — | 7.36 | 5.69 | 16.75 | 8.58 | — |
| Ruso | — | 5.65 | 5.13 | 11.37 | 7.12 | — |
| Polaco | — | 12.59 | 5.45 | 15.81 | 8.30 | — |
| Japonés | 6.36 | 5.74 | 5.30 | 11.37 | — | 6.78 |
| Coreano | 4.31 | 3.54 | 4.25 | 7.30 | — | 7.85 |
| Francés | 7.61 | 4.57 | 5.97 | 13.24 | 5.83 | — |
| Chino | 7.97 | 6.49 | 7.97 | 20.50 | — | 7.69 |
| Español (Latinoamérica) | 5.41 | 3.38 | 3.62 | 6.22 | 4.86 | — |
Diez de los idiomas más utilizados, un motor por columna. Cada celda indica la tasa de error del motor; cuanto más baja, mejor. El verde señala la menor de la fila y el blanco la segunda menor. CER para japonés, coreano y chino; WER para el resto, sin combinarlos nunca en una sola cifra. Nuestra propia prueba con FLEURS, realizada por el equipo de Whisper Notes, en una M5 MacBook Air y habla leída.
Nombres abreviados: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Un guion indica que el motor no tiene un modelo para ese idioma.
Qwen3-ASR 1.7B obtiene la tasa de error más baja en seis de los diez idiomas y Whisper Large V3 Turbo en los otros cuatro. Apple Speech queda 0.77 puntos por detrás del líder de la fila en coreano, 1.06 en japonés y 1.48 en chino, donde empata con Whisper Large V3 Turbo en 7.97. En los siete idiomas que admite, queda entre 0.8 y 4.3 puntos por detrás del líder de la fila; la mayor distancia aparece en inglés, con 8.80 contra 4.49. No hay resultados de Apple Speech para neerlandés, polaco ni ruso.
¿Qué idiomas admite Apple Speech?
Apple Speech devolvió resultados para 21 de las 83 configuraciones de idioma de esta prueba. Los dos modelos Whisper cubren las 83; Qwen3-ASR 1.7B, 30; y Parakeet V3, 25. De los diez idiomas anteriores, no tiene modelo para neerlandés, polaco ni ruso. No existe una lista fija que citar: los recursos de idioma pertenecen a macOS, así que una app consulta en tiempo de ejecución cuáles están disponibles en cada equipo.
| Idioma | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Italiano | 4.39 | 2.58 | 2.58 | 7.64 | 3.43 | — |
| Cantonés | 8.69 | 6.44 | 36.75 | 119.01 | — | 37.23 |
| Portugués (Brasil) | 9.35 | 5.17 | 5.44 | 8.61 | 6.49 | — |
| Hindi | 101.50 | 13.19 | 29.64 | 61.26 | — | — |
| Telugu | 101.63 | — | 81.74 | 103.19 | — | — |
| Urdu | 101.69 | — | 23.39 | 38.83 | — | — |
| Punyabí | 101.75 | — | 92.05 | 103.40 | — | — |
| Bengalí | 102.00 | — | 83.52 | 117.37 | — | — |
| Nepalí | 102.13 | — | 88.59 | 118.84 | — | — |
| Malayalam | 102.18 | — | 107.34 | 167.16 | — | — |
| Maratí | 102.23 | — | 82.69 | 109.95 | — | — |
| Canarés | 103.83 | — | 72.07 | 116.10 | — | — |
| Guyaratí | 104.52 | — | 75.31 | 108.91 | — | — |
| Tamil | 113.01 | — | 71.28 | 79.77 | — | — |
Los otros catorce idiomas para los que Apple Speech devolvió un resultado, ordenados según su propia tasa de error. Las mismas columnas, colores y abreviaturas de arriba; CER para cantonés y WER para el resto. Una tasa de error puede superar el 100% porque las inserciones también cuentan en el numerador.
En las once últimas filas, de hindi a tamil, Apple Speech respondió con una transliteración al alfabeto latino en lugar de la escritura nativa. Por tanto, su tasa de error mide una diferencia de escritura y no la precisión del reconocimiento; esas celdas no se incluyen en la clasificación de la fila. Los valores de los demás motores en esas filas son mediciones normales.
Cómo funciona SpeechAnalyzer
Apple dispone de una API de reconocimiento de voz desde iOS 10. Esa API, SFSpeechRecognizer, es el motor del antiguo sistema de dictado. SpeechAnalyzer la sustituye: se presentó en macOS 26 e iOS 26 y está disponible en todas las plataformas de Apple excepto watchOS.
La API se organiza en torno a una sesión. Creas un SpeechAnalyzer, le asignas uno o varios módulos y le proporcionas audio; SpeechTranscriber es el módulo que convierte la voz en texto. El audio entra como una secuencia asíncrona que tú mismo alimentas, los resultados vuelven en una segunda secuencia y ambas suelen ejecutarse en tareas distintas. El analizador acepta una secuencia de entrada cada vez. Cada búfer y cada resultado llevan una marca de tiempo referida a la propia línea temporal del audio, por lo que un resultado puede volver a colocarse donde se originó.
Una sesión, tres tareas: el audio entra como una AsyncSequence, SpeechAnalyzer y SpeechTranscriber lo analizan y los resultados regresan en una segunda AsyncSequence que puede leer la interfaz. Fuente: Apple, sesión 277 de la WWDC25.
Los resultados llegan dos veces. Todo lo que se encuentre dentro de lo que Apple denomina intervalo volátil aún puede sustituirse por un resultado mejor; lo que queda fuera es definitivo. Así puede una app mostrar una transcripción aproximada mientras sigues hablando y corregirla después.
Apple declara cinco objetivos de diseño para el modelo SpeechTranscriber: audio largo, habla conversacional, hablantes lejanos, baja latencia y privacidad, es decir, ejecución en el dispositivo. Notas, Notas de Voz, Diario y los resúmenes de llamadas se basan en él.
Los cinco objetivos de diseño declarados por Apple para el modelo SpeechTranscriber. Fuente: Apple, sesión 277 de la WWDC25.
Los modelos no forman parte de ninguna app. Se descargan de los servidores de Apple mediante AssetInventory, el sistema los almacena y actualiza, y se comparten entre apps. No añaden nada al tamaño de descarga ni al espacio de memoria de una app, y la decodificación ocurre fuera del proceso que realiza la llamada. Cuando SpeechTranscriber no dispone de un modelo para un idioma o dispositivo, DictationTranscriber toma el relevo con los mismos modelos que el dictado del sistema.
Cómo hicimos la medición
Cada motor de este artículo transcribió los mismos fragmentos, en el mismo orden y de uno en uno, en una M5 MacBook Air (32 GB, macOS 27.0). El audio procede de la partición de prueba de Google FLEURS, revisión 70bb2e84, con unas 150 frases y 30 minutos por idioma. Un hash fijo de los identificadores de elementos del propio conjunto de datos ordena los elementos, y tomamos la secuencia más corta de elementos completos que supera los treinta minutos; ningún resultado de los modelos intervino en esa elección. Cada celda se reconstruyó a partir de su propio registro y se volvió a comprobar: las 285 pasaron.
Las puntuaciones son la tasa de error por palabra cuando las palabras se separan con espacios, y la tasa de error por carácter para japonés, coreano, chino y cantonés. FLEURS contiene habla leída, no una junta ni dictado. Estas tablas indican si un motor es una opción razonable para tu idioma, no lo que obtendrás con tus propias grabaciones.
¿Cuánto mejora respecto al antiguo Dictado de Apple?
Apple ofrece dos modos de transcripción y medimos ambos. SpeechTranscriber es el nuevo, al que este artículo llama Apple Speech. DictationTranscriber es el modo de compatibilidad, el sistema de dictado que antes utilizaba una Mac.
| Idioma | Dictado de Apple | Apple Speech |
|---|---|---|
| Coreano | 7.11 | 4.31 |
| Italiano | 6.93 | 4.39 |
| Español (Latinoamérica) | 8.43 | 5.41 |
| Alemán | 12.69 | 6.26 |
| Japonés | 9.37 | 6.36 |
| Francés | 17.10 | 7.61 |
| Chino | 10.28 | 7.97 |
| Cantonés | 10.18 | 8.69 |
| Inglés | 13.83 | 8.80 |
| Portugués (Brasil) | 10.85 | 9.35 |
Todos los idiomas que ambos modos de Apple midieron correctamente, ordenados según la tasa de error de Apple Speech; el verde señala el mejor valor de la fila. La misma prueba, los mismos fragmentos y la misma Mac. CER para japonés, coreano, chino y cantonés; WER para el resto.
Apple Speech es más preciso en los diez idiomas. En el idioma mediano desaparece aproximadamente un tercio de los errores; en francés y alemán, más de la mitad; y en portugués brasileño y cantonés, cerca de un error de cada siete.
Esa es una comparación con la tecnología anterior de Apple. Contra los modelos que descargas, su mejor posición en un idioma medido correctamente es la segunda, en cantonés. Dictado cubre más idiomas: 33 configuraciones contra 21 en esta prueba, incluidas las tres que faltan en el motor nuevo.
¿Qué ventajas ofrece el motor integrado?
| Motor | Velocidad | Memoria máxima | Descarga |
|---|---|---|---|
| SenseVoice Small | 162.3× el tiempo real | 0.95 GiB | 827 MB |
| Parakeet V3 | 75.6× el tiempo real | 0.09 GiB | 465 MB |
| Apple Speech | 30.8× el tiempo real | no indicada | paquete de idioma descargado por macOS, no por la app |
| Qwen3-ASR 1.7B | 11.1× el tiempo real | 2.43 GiB | unos 2.5 GB |
| Whisper Small | 7.9× el tiempo real | 0.87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3.0× el tiempo real | 1.87 GiB | unos 1.6 GB |
La velocidad es la mediana de cada motor en los trece idiomas que este artículo mide correctamente, contando solo aquellos que ejecutó: el rendimiento de procesamiento de elementos aislados, un dato de diagnóstico y no la latencia del producto. La memoria máxima es el pico del grupo de procesos en esta prueba. Apple Speech decodifica dentro de un servicio de macOS que no pertenece a la app que lo invoca, por lo que ninguna cifra tendría allí el mismo significado que para los otros cinco.
El sistema descarga una sola vez los recursos de idioma de Apple Speech y los comparte entre todas las apps. La app no incluye ningún modelo ni asigna nada en su propio proceso. El servicio del sistema sí utiliza memoria mientras funciona, pero no podemos atribuirla con exactitud, así que no indicamos ninguna cifra en lugar de mostrar un cero. Corrió a 30.8× el tiempo real, por detrás de Parakeet V3 y SenseVoice Small.
Whisper Large V3 Turbo gana cuatro de las diez filas y es el motor más lento de esta prueba, unas diez veces más lento que Apple Speech, con unos 1.6 GB en disco. Qwen3-ASR 1.7B gana las otras seis, con unos 2.5 GB y 2.43 GiB de memoria. Parakeet V3 ocupa 465 MB y 0.09 GiB, supera a Turbo en francés, queda por detrás en polaco y no admite japonés, coreano, chino ni cantonés. Whisper Small es la comparación más cercana con 600 MB, y Apple Speech fue más preciso en ocho de los diez idiomas que ambos midieron correctamente.
¿Deberías usar Apple Speech en lugar de un modelo descargado?
Idioma por idioma:
- Inglés: no es una buena opción. Apple Speech obtuvo 8.80; Qwen3-ASR 1.7B (4.49) o Whisper Large V3 Turbo (5.49) es claramente más preciso.
- Alemán: no es una buena opción. Apple Speech obtuvo 6.26; Qwen3-ASR 1.7B (2.85) o Whisper Large V3 Turbo (4.05) es claramente más preciso.
- Neerlandés, ruso y polaco: Apple Speech no tiene modelo para ninguno de los tres. Whisper Large V3 Turbo fue el más preciso en cada uno, con 5.69, 5.13 y 5.45.
- Japonés: se puede usar. Apple Speech obtuvo 6.36, por detrás de Whisper Large V3 Turbo, con 5.30.
- Coreano: se puede usar. Apple Speech obtuvo 4.31, por detrás de Qwen3-ASR 1.7B, con 3.54.
- Francés: no es una buena opción. Apple Speech obtuvo 7.61; Qwen3-ASR 1.7B (4.57) o Parakeet V3 (5.83) es claramente más preciso.
- Chino: se puede usar. Apple Speech obtuvo 7.97, igual que Whisper Large V3 Turbo; el más preciso fue Qwen3-ASR 1.7B, con 6.49.
- Español: no es una buena opción. Apple Speech obtuvo 5.41; Qwen3-ASR 1.7B (3.38) o Whisper Large V3 Turbo (3.62) es claramente más preciso.
Apple Speech es el nombre abreviado que este artículo da al SpeechTranscriber de Apple, la API en el dispositivo que cualquier app para Mac puede utilizar en macOS 26 o posterior. No es uno de los modelos que Whisper Notes para Mac descarga: en la versión de descarga directa para Mac (DMG) son Whisper, Parakeet V3, SenseVoice y Qwen3-ASR; en iPhone y en la versión del Mac App Store son Whisper, Parakeet V3 y SenseVoice. La tabla por motor se encuentra en nuestra página de idiomas admitidos.
Nada de esto cambia el funcionamiento actual de Whisper Notes para Mac: Parakeet V3 sigue siendo el modelo predeterminado.
Preguntas frecuentes
¿Apple Speech es tan preciso como Whisper?
No en la mayoría de los idiomas que ambos cubren. En nuestra propia prueba con FLEURS, entre los siete de estos diez idiomas que admite Apple Speech, Whisper Large V3 Turbo fue más preciso en seis y ambos empataron exactamente en chino, con un CER del 7.97% cada uno. Contra Whisper Small se invierte el orden: Apple Speech quedó por delante en seis de los siete y solo perdió en inglés, con un WER del 8.80% contra el 7.04%. No lidera ningún idioma medido correctamente en esta prueba y donde más se acerca es en coreano, con un CER del 4.31% contra el 3.54% del líder de la fila. El cantonés es el único idioma medido correctamente en el que superó a Whisper Large V3 Turbo, con un CER del 8.69% contra el 36.75%. Utiliza el motor integrado si admite tu idioma y prefieres que macOS gestione el paquete de idioma; usa Whisper Large V3 Turbo para obtener el resultado más preciso o si tu idioma es uno de los tres que Apple Speech no ofrece aquí.
¿Qué idiomas admite Apple Speech?
macOS decide la lista, no una app. En esta prueba, Apple Speech produjo resultados para 21 de las 83 configuraciones de idioma que probamos, contra 83 para las dos versiones de Whisper, 30 para Qwen3-ASR 1.7B y 25 para Parakeet V3. De los diez idiomas más utilizados de la tabla principal, admite inglés, alemán, japonés, coreano, francés, chino y español, pero no neerlandés, polaco ni ruso. La segunda tabla contiene las otras catorce configuraciones: italiano, cantonés, portugués brasileño y once idiomas en los que respondió con una transliteración al alfabeto latino en lugar de la escritura nativa. Una app debe consultar a macOS en tiempo de ejecución qué idiomas están instalados en cada equipo. Si falta el tuyo, Whisper cubre todos los idiomas de la lista de la app en todos los canales.
Apple Speech o Parakeet V3: ¿cuál elegir?
Parakeet V3, en todos los idiomas europeos que ambos cubren. Obtuvo 6.89 contra 8.80 en inglés; 5.83 contra 7.61 en francés; 4.86 contra 5.41 en español; 3.43 contra 4.39 en italiano; y 6.49 contra 9.35 en portugués brasileño. En alemán empatan en 6.26. Parakeet V3 no admite japonés, coreano, chino ni cantonés, así que Apple Speech es el único de los dos disponible para esos idiomas y queda a menos de 1.5 puntos del líder de la fila en japonés, coreano y chino. Parakeet V3 requiere una descarga de 465 MB y corrió a 75.6× el tiempo real con un pico de 0.09 GiB; macOS descarga el paquete de idioma de Apple Speech, que corrió a 30.8× con una memoria que no indicamos.
¿Qué es SpeechAnalyzer y es lo mismo que Dictado de Apple?
SpeechAnalyzer es la API general que Apple presentó en la WWDC 2025 y publicó con macOS 26 e iOS 26. SpeechTranscriber es el modo de transcripción que contiene; es lo que medimos y lo que este artículo llama Apple Speech. Dictado es el modo de compatibilidad y también lo probamos: Apple Speech fue más preciso en los diez idiomas que ambos midieron correctamente, eliminó cerca de un tercio de los errores en el idioma mediano y más de la mitad en francés y alemán. Dictado cubre más idiomas, 33 configuraciones contra 21, por lo que es el motor del sistema para neerlandés, polaco o ruso si puedes aceptar un WER del 17.34%, 13.50% y 13.13%. Whisper Large V3 Turbo obtuvo 5.69%, 5.45% y 5.13% en los mismos fragmentos.
¿Sale el audio de mi Mac cuando uso Apple Speech?
Apple documenta SpeechTranscriber como reconocimiento de voz en el dispositivo: macOS descarga una vez los recursos de idioma y el reconocimiento se ejecuta localmente. Medimos la precisión y la velocidad, no el comportamiento de la red, así que describimos esa parte como lo hace Apple. Los motores que descarga Whisper Notes —Whisper, Parakeet V3, SenseVoice y Qwen3-ASR— corren en la GPU o el Neural Engine de tu propia Mac, sin cuenta ni API key, y la transcripción funciona sin conexión en todos los canales.
¿Por qué estas cifras no coinciden con la precisión que obtengo en mis grabaciones?
Porque FLEURS contiene habla leída, breve y limpia, y tus grabaciones no. Nuestra prueba es una calibración con un conjunto de datos público: unas 150 frases y 30 minutos de audio por idioma, una M5 MacBook Air y los mismos fragmentos para cada motor. Indica si un motor es una opción razonable para un idioma, no lo que obtendrás en una junta, con audio ruidoso, con acento o en un archivo de dos horas.
¿Por qué otras comparativas dicen que Apple Speech supera a Whisper?
Porque comparan con Whisper Small y solo en inglés. Contra Whisper Small nuestra prueba coincide: de los diez idiomas que ambos midieron correctamente, Apple Speech ganó en ocho. El inglés es uno de los dos que perdió, 8.80 contra 7.04. El resultado no se traslada a Whisper Large V3 Turbo: ahí Apple Speech quedó por detrás en ocho de esos diez idiomas, empató en chino en 7.97 y solo lideró en cantonés. Qué Whisper entra en la comparación decide el titular.
Pruébalo
Los cinco modelos descargables de este artículo —Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small y Qwen3-ASR 1.7B— están disponibles en Whisper Notes para Mac, versión de descarga directa (DMG), en Configuración y, después, Modelo de transcripción.
Si nuestras cifras no coinciden con tu experiencia en un idioma, escribe a mac@whispernotes.app. Notas completas de la versión: whispernotes.app/changelog.
Fuentes: nuestra prueba con la partición de prueba de Google FLEURS, revisión 70bb2e84; la documentación de Apple sobre SpeechAnalyzer, y la prueba anterior de Qwen3-ASR en treinta idiomas que la precedió.