SenseVoice: Transcripción 52× más rápida para chino, japonés y coreano en Mac

12 de mayo de 2026
·
7 min read
·Whisper Notes Team

TL;DR — Comparativa de tres modelos en el dispositivo

Parakeet V3 SenseVoice Small Whisper Large V3 Turbo
5 min inglés 2.91s (103×) 5.8s (52×) 20.92s (14.3×)
27 min chino 10.10s (161×) 13.83s (118×) 2 min 4s (13.1×)
Idiomas 25 (europeos) 5 (zh, en, ja, ko, yue) 100+
Descarga 465 MB 827 MB ~1.6 GB
Memoria ~800 MB ~700 MB ~1.6 GB
Mejor para Inglés & europeos Chino, japonés, coreano, cantonés Todo lo demás (100+ idiomas)

* Benchmarks de velocidad en un Apple M4 Pro, 32 GB. Podcast en inglés de 5 minutos y podcast en chino de 27 minutos. Factor de tiempo real = duración del audio ÷ tiempo de procesamiento (mayor = más rápido). Los benchmarks corresponden a la versión para Mac; SenseVoice también está disponible en iPhone.

A partir de la versión 1.5.0 (descarga directa / DMG), Whisper Notes para Mac incluye SenseVoice Small como motor dedicado para transcripción en chino, japonés, coreano y cantonés. Reemplaza a Qwen3-ASR y corre en la GPU de Apple vía MLX en lugar de la CPU — procesando un podcast chino de 27 minutos en 13.83 segundos en lugar de 3 minutos con 44 segundos.

Por qué reemplazamos Qwen3-ASR

Qwen3-ASR era un modelo sólido. Soportaba 30 idiomas más 22 dialectos chinos, y su precisión para chino estaba cerca del estado del arte. Pero tenía un problema que empeoraba con la duración del audio: la velocidad.

Qwen3 usaba una arquitectura autorregresiva — el mismo enfoque que Whisper, procesando el audio cuadro por cuadro, sin adelantarse nunca. En un podcast chino de 27 minutos, tardaba 224 segundos. Utilizable, pero no la experiencia de resultado instantáneo que Parakeet V3 ofrece para inglés.

El problema más profundo era nuestra infraestructura. Nuestra integración de Qwen3 usaba sherpa-onnx, una biblioteca en C con un wrapper de Swift de 2,249 líneas que dirigía todo a través de los núcleos del CPU. La GPU estaba ociosa mientras el CPU de tu Mac hacía todo el trabajo.

SenseVoice resolvió ambos problemas. Arquitectura no autorregresiva para velocidad. Apple MLX para aceleración de GPU. El resultado: una mejora de velocidad de 16.2× en el mismo hardware, con un código reducido de 2,249 líneas a 288.

El benchmark

Los tres modelos corriendo en el mismo Apple M4 Pro, los mismos archivos de audio, las mismas condiciones. Sin nube. Sin internet. Solo silicio.

Modelo 5 min inglés 27 min chino Velocidad (RTFx)
Parakeet V3 2.91s 10.10s 103–161×
SenseVoice Small 5.8s 13.83s 52–118×
Whisper Large V3 Turbo 20.92s 2 min 4s 13–14×
Qwen3-ASR (eliminado) 224s 7.2×

SenseVoice es aproximadamente la mitad de rápido que Parakeet V3 — aun así extraordinariamente rápido. Un podcast de 27 minutos se completa en menos de 14 segundos. Presionas transcribir, esperas un respiro, y el texto ya está ahí.

Compara eso con Whisper a 2 minutos con 4 segundos, o el viejo Qwen3 a 3 minutos con 44 segundos. La arquitectura importa más que la cantidad de parámetros.

Tabla oficial de comparación de velocidad de inferencia del artículo FunAudioLLM: SenseVoice-Small (70ms por 10s de audio) vs Whisper-Small (518ms) vs Whisper-Large-V3 (1281ms) - arquitectura del modelo, parámetros, idiomas soportados, RTF y latencia

Benchmark oficial de inferencia del artículo FunAudioLLM: SenseVoice-Small procesa 10s de audio en 70ms (GPU A800). Whisper-Large-V3 tarda 1,281ms. Eso es una diferencia de 18× en latencia bruta de inferencia.

Modelo Tiempo de carga Memoria Tamaño de descarga
Parakeet V3 0.77s ~800 MB 465 MB
SenseVoice Small 0.81s ~700 MB 827 MB
Whisper Small 1.03s ~487 MB 600 MB
Whisper Large V3 Turbo 3.18s ~1.6 GB ~1.6 GB

* Tiempo de carga y memoria medidos en un Apple M4 Pro, 32 GB.

SenseVoice carga en menos de un segundo y usa menos memoria que Parakeet. En una Mac de 8 GB, corre cómodamente junto con tus otras aplicaciones.

Por qué SenseVoice es más rápido: arquitectura + runtime

La diferencia de velocidad entre Qwen3-ASR y SenseVoice viene de dos factores independientes.

Factor 1: Arquitectura del modelo. Qwen3-ASR es autorregresivo — genera texto token por token, cada uno dependiendo del anterior. SenseVoice usa un codificador no autorregresivo (NAR) que procesa todo el audio en paralelo. Esta diferencia arquitectónica por sí sola hace que SenseVoice sea fundamentalmente más rápido, sin importar en qué hardware lo corras.

Factor 2: Runtime. Nuestra integración de Qwen3-ASR usaba sherpa-onnx, que corría en CPU. SenseVoice corre a través de Apple MLX, dirigiendo la computación a la GPU. ¿Podría Qwen3 también correr en MLX? Sí — pero seguiría siendo más lento que SenseVoice porque el cuello de botella autorregresivo está en la arquitectura, no en el runtime.

Qwen3-ASR (anterior) SenseVoice (nuevo)
Arquitectura Autorregresiva (token por token) No autorregresiva (paralela)
Runtime sherpa-onnx (CPU) Apple MLX (GPU)
27 min chino 224 segundos 13.83 segundos
Aceleración combinada línea base 16.2× más rápido
Código Framework en C de 168 MB + 2,249 líneas de Swift 288 líneas de Swift Actor

* Mismo podcast chino de 27 minutos, Apple M4 Pro. La aceleración de 16.2× combina mejoras tanto arquitectónicas (NAR vs AR) como de runtime (GPU vs CPU).

El código también se simplificó. La nueva implementación de SenseVoice es un único Swift Actor de 288 líneas que se comunica directamente con MLX, reemplazando un framework en C de 168 MB. Menos código, menos bugs, una app más pequeña.

Cinco idiomas, bien hechos

SenseVoice no intenta hacer todo. Maneja cinco idiomas:

Idioma SenseVoice-Small Whisper-Large-V3 Ganador
Chino (zh-CN) 10.78% CER 12.55% CER SenseVoice (-14%)
Cantonés (yue) 7.09% CER 10.41% CER SenseVoice (-32%)
Japonés (ja) 11.96% CER 10.34% CER Whisper (por poco)
Coreano (ko) 8.28% CER 5.59% CER Whisper
Inglés (en) 14.71% WER 9.39% WER Whisper (usa Parakeet)

* Benchmark CommonVoice, CER = tasa de error por carácter, WER = tasa de error por palabra. Menor es mejor. Fuente: artículo FunAudioLLM (2024). Latencia de inferencia de SenseVoice-Small: 70ms por 10s de audio (GPU A800), más de 15× más rápido que Whisper-Large-V3.

Comparación de precisión SenseVoice vs Whisper en el benchmark CommonVoice para chino, cantonés, inglés, japonés, coreano y 25 idiomas más - gráfica de barras WER/CER

Benchmark CommonVoice: SenseVoice-Small (amarillo) vs Whisper-Small (azul) vs Whisper-Large-V3 (naranja). Menor es mejor. Fuente: artículo FunAudioLLM

Los números cuentan una historia honesta. SenseVoice supera a Whisper en precisión para chino y cantonés por un margen significativo, mientras que Whisper es más preciso para japonés, coreano e inglés. Pero SenseVoice es más de 15× más rápido que Whisper-Large-V3. Para la mayoría de los usos reales, la diferencia de velocidad importa más que unos cuantos puntos porcentuales de precisión.

El resultado del cantonés merece mención aparte. Whisper-Small obtiene 38.97% CER en cantonés — casi inutilizable. Incluso Whisper-Large-V3 solo alcanza 10.41%. SenseVoice llega a 7.09%. Antes de SenseVoice, no había una buena forma de transcribir cantonés localmente en una Mac. Si hablas cantonés, este modelo existe para ti.

Resultado de transcripción coreana de SenseVoice en Whisper Notes para Mac mostrando texto coreano preciso de un video

Transcripción coreana con SenseVoice: importación de video con subtítulos con marcas de tiempo

Prueba real: podcast chino de 27 minutos

Transcribimos un episodio de 27 minutos de Thirteen Invitations (十三邀), un podcast de entrevistas chino, con SenseVoice y Whisper Large V3 Turbo en la misma M4 Pro. ElevenLabs Scribe (nube) sirvió como referencia. Ambos modelos locales cometen aproximadamente el mismo número de errores, pero de diferentes tipos:

SenseVoice Whisper Large V3
Tiempo 13.83s 2 min 4s
Errores (muestra de 5 min) ~15–20 ~12–15
Peor error 时差→食堂 (zona horaria→comedor) 西昌→西藏 (ciudad de Xichang→Tíbet, 4,000 km de error)
Patrón de errores Intercambios de homófonos Errores geográficos/factuales

* Comparación manual contra ElevenLabs Scribe (referencia en la nube, también imperfecta). Ambos modelos locales escribieron correctamente "根深蒂固" donde Scribe se equivocó.

Precisión comparable. 9× más rápido. Para la transcripción de chino en el mundo real, SenseVoice te da una transcripción usable antes de que Whisper termine de cargar.

Cuándo usar cuál modelo

Whisper Notes para Mac ahora incluye cuatro modelos de voz. Cada uno está optimizado para diferentes escenarios:

Necesitas... Usa este modelo Por qué
Inglés o idiomas europeos, velocidad máxima Parakeet V3 103× tiempo real, menor tasa de error. El predeterminado.
Chino, japonés, coreano o cantonés SenseVoice Small 52–118× tiempo real. Único modelo con soporte para cantonés.
Cualquiera de 100+ idiomas (árabe, tailandés, ruso, etc.) Whisper Large V3 Turbo Mayor soporte de idiomas. Más lento pero universal.
Menor uso de memoria (Macs más viejas) Whisper Small 487 MB de memoria. Bueno para Macs de 8 GB corriendo otras apps.
Selector de modelo de Whisper Notes Mac mostrando Parakeet V3, SenseVoice Small, Whisper Small y Whisper Large V3 Turbo con tamaños de descarga y soporte de idiomas

Configuración → Modelo de transcripción: elige el motor adecuado para tu idioma

El selector de modelos en Configuración muestra las cuatro opciones con tamaños de descarga, cantidad de idiomas y requisitos de memoria. SenseVoice se descarga en el primer uso (~827 MB) y se queda en tu dispositivo.

Las concesiones

SenseVoice no es un modelo universal. Esto es lo que no puede hacer:

Solo 5 idiomas. Si necesitas tailandés, ruso, árabe, hindi u otro idioma fuera del enfoque CJK de SenseVoice, sigue con Whisper.

Actualización: SenseVoice llegó primero solo a Mac vía Apple MLX, pero ahora también está disponible en iPhone — iOS trae la misma alineación de modelos que Mac: Parakeet V3, Whisper y SenseVoice.

Peculiaridad con audio silencioso. Durante segmentos muy cortos o muy silenciosos, SenseVoice puede a veces generar texto en chino sin importar el idioma seleccionado. Configurar el idioma manualmente (en lugar de "Auto") reduce esto.

Sin streaming. A diferencia del modo de streaming de Whisper, SenseVoice procesa el audio completo después de la grabación. Para archivos largos, segmenta automáticamente en los puntos de silencio y muestra resultados progresivamente.

Estas son restricciones arquitectónicas, no bugs. Un modelo entrenado en 5 idiomas hace esos 5 idiomas extremadamente bien. La cobertura de 100+ idiomas de Whisper viene con menor velocidad y una precisión dispareja entre idiomas.

¿Comparando todas las opciones locales? Todos los modelos de voz a texto en el dispositivo — las variantes de Whisper, Parakeet V3, SenseVoice y Voxtral — se comparan lado a lado en nuestra página de comparación de modelos Whisper. ¿Apenas conoces Whisper? Comienza con la guía de transcripción con Whisper — qué es el modelo, todas las formas de correrlo y cuánto cuesta.

Preguntas frecuentes

¿Cuál es la alternativa más rápida a Whisper para transcribir chino, japonés y coreano?

SenseVoice Small está disponible en Whisper Notes tanto para Mac como para iPhone. En nuestra prueba en una Mac con M4 Pro, transcribió un podcast chino de 27 minutos en 13.83 segundos (52–118× tiempo real), mientras que Whisper Large V3 Turbo tardó más de 2 minutos con el mismo archivo.

¿SenseVoice es mejor que Whisper para chino?

Para chino y cantonés, sí. En el benchmark CommonVoice, SenseVoice logra 10.78% CER en chino contra 12.55% de Whisper-Large-V3, y es más de 15× más rápido. Whisper sigue siendo ligeramente más preciso para japonés y coreano.

¿Puedo transcribir cantonés localmente en una Mac?

Sí. SenseVoice logra 7.09% CER en cantonés, comparado con 10.41% de Whisper-Large-V3 y un casi inutilizable 38.97% de Whisper-Small. Antes de SenseVoice, no había una buena forma de transcribir cantonés localmente en una Mac.

¿SenseVoice funciona en iPhone?

Sí. Whisper Notes en iPhone trae la misma alineación de modelos que en Mac — Parakeet V3, Whisper y SenseVoice — así que también puedes transcribir chino, japonés, coreano y cantonés localmente en tu iPhone.

Pruébalo

SenseVoice está disponible en Whisper Notes para Mac v1.5.0 (descarga directa / DMG) y posteriores, y en la app actual de iPhone. En Mac, descárgalo desde Configuración → Modelo de transcripción → SenseVoice Small (~827 MB). La versión para Mac requiere Apple Silicon (M1 o posterior).

Si estás usando Parakeet V3 y dictas principalmente en inglés, no hay necesidad de cambiar. SenseVoice es para cuando necesitas chino, japonés, coreano o cantonés — y lo quieres rápido.

Descargar para Mac

Changelog completo: whispernotes.app/changelog

Preguntas o comentarios: mac@whispernotes.app