Whisper Large V3 Turbo vs V3: 5× Más Rápido en Mac (Benchmark)

6 de noviembre de 2024
·
6 min read
·Whisper Notes Team

El Whisper Large-v3 Turbo de OpenAI reduce el decoder de 32 capas a 4, bajando los parámetros de 1,550 millones a 809 millones. En nuestras pruebas sobre Apple Silicon transcribió el mismo audio alrededor de 5× más rápido con una precisión prácticamente idéntica. Whisper Notes lo trae en Mac y iPhone.

Comparación de la arquitectura de Whisper Large V3 Turbo frente a V3

V3 Turbo vs V3: qué cambió

Turbo no es una arquitectura nueva. Es exactamente el mismo modelo Whisper Large-v3 con el decoder podado de 32 capas a 4, que luego se afinó (fine-tuning) para recuperar la precisión. El encoder queda sin tocar.

Large-v3 Turbo Large-v3
Parámetros 809M 1,550M
Capas del decoder 4 32
Idiomas 100+ 100+
Tarea de traducción No soportada Soportada
Licencia MIT Apache 2.0

Metodología: el mismo archivo de audio de 10 minutos se transcribió con el mismo build de Whisper Notes en cada dispositivo listado. Los tiempos son segundos de reloj desde que inicia la transcripción hasta obtener el texto final; entre V3 y Turbo lo único que cambió fue el modelo.

La tarea de traducción se excluyó de forma explícita de los datos de entrenamiento de Turbo. El modelo completo Large-v3 sí la soporta, pero Whisper Notes solo incluye Turbo — la traducción se maneja por separado con Apple Intelligence.

El modelo base: ¿qué es Whisper Large-v3?

Whisper Large-v3 es el modelo estrella de reconocimiento de voz de código abierto de OpenAI, publicado en noviembre de 2023. Tiene 1,550 millones de parámetros, usa una entrada de espectrograma de 128 mel-bins, se entrenó con 5 millones de horas de audio (1 millón con etiquetas débiles + 4 millones con pseudoetiquetas) y soporta más de 100 idiomas, incluido el cantonés. En el Open ASR Leaderboard de Hugging Face promedia una tasa de error por palabra de ~7.4% — el techo de precisión contra el que se mide Turbo en todo este artículo. Para ver cómo se compara Large-v3 con los demás modelos locales, revisa nuestra comparación de modelos Whisper.

Benchmark de velocidad: Whisper Notes en Apple Silicon

En Whisper Notes para Mac, Turbo corre vía CoreML en el Neural Engine. Procesando 10 minutos de audio:

Dispositivo Whisper V3 V3 Turbo Aceleración
iPhone 15 Pro 425 s 82 s 5.2×
iPad Pro M2 380 s 71 s 5.4×
MacBook Pro M2 316 s 63 s 5.0×

La aceleración de 5× es específica de Whisper Notes en Apple Silicon, donde el decoder más chico aprovecha la optimización del Neural Engine. En GPU con frameworks como faster-whisper, la brecha se reduce a ~2.7× (mira los benchmarks de la comunidad abajo).

Precisión: comparación de WER

El Open ASR Leaderboard de Hugging Face prueba ambos modelos con los mismos datasets en inglés. La tasa de error por palabra (WER) de Turbo queda a menos de medio punto de V3 en cada benchmark:

Dataset WER V3 Turbo WER V3
LibriSpeech Clean 2.10% 2.01%
LibriSpeech Other 4.24% 3.91%
GigaSpeech 10.14% 10.02%
Earnings22 11.63% 11.29%
AMI 16.13% 15.95%
WER promedio 7.83% 7.44%

V3 es un poco más preciso en cada dataset, pero la diferencia es pequeña — 0.39 puntos porcentuales en promedio. En la mayoría de las transcripciones del mundo real no vas a notar la diferencia.

En la evaluación de audio largo de YouTube-commons (uno de los benchmarks ASR de código abierto más grandes), Turbo obtiene 13.40% de WER frente a 13.20% de V3 — corriendo a un factor de tiempo real de 129.5× contra 55.3×. Es decir, 2.3× más rápido con precisión casi idéntica en audio real.

¿Qué tan preciso es Turbo en coreano, ruso y otros idiomas?

Los benchmarks de arriba son en inglés. Según la model card de OpenAI, el decoder podado de 4 capas de Turbo pierde un poco más de precisión fuera del inglés, con la mayor degradación en idiomas con menos recursos. En ruso y en la mayoría de los idiomas europeos, Turbo se mantiene cerca del Large-v3 completo — y si usas Whisper Notes, Parakeet V3 cubre el ruso y otros 24 idiomas europeos a 10× la velocidad de Whisper.

Para coreano, japonés, chino y cantonés, un modelo hecho a la medida es más rápido y maneja mejor la puntuación: SenseVoice transcribe CJK a 52× tiempo real. Whisper Notes incluye SenseVoice junto con Turbo tanto en Mac como en iOS, así que puedes escoger el modelo correcto para cada idioma en vez de forzar todo por uno solo.

Benchmarks de la comunidad: GPU y CPU

Benchmarks independientes de las comunidades de faster-whisper y whisper.cpp muestran resultados consistentes en hardware distinto. Transcribiendo 13 minutos de audio con faster-whisper en GPU:

Modelo Precisión Tiempo Memoria GPU WER
Large-v3 Turbo fp16 19.2 s 2,537 MB 1.92%
Large-v3 fp16 52.0 s 4,521 MB 2.88%
Large-v3 Turbo int8 19.6 s 1,545 MB 1.92%
Distil-Large-v3 fp16 26.1 s 2,409 MB 2.39%

Fuente: benchmark de faster-whisper en GPU NVIDIA, split de validación clean de LibriSpeech. Turbo en int8 usa apenas 1.5 GB de VRAM — cabe en una GPU de 2 GB.

La inferencia por lotes en una RTX 3060 Laptop (6 GB de VRAM, precisión int8) empuja la ventaja todavía más:

Modelo Secuencial Por lotes (10) WER por lotes
Large-v3 Turbo 46.1 s 18.7 s 7.7%
Large-v3 230.8 s 43.0 s 7.9%
Large-v2 178.3 s 43.2 s 8.8%
Medium 113.3 s 26.3 s 8.9%

Fuente: benchmark de NilaierMusic, Intel i7-12650H + RTX 3060 Laptop de 6 GB, audio en francés, precisión int8.

Con procesamiento por lotes, Turbo consigue el mejor WER de todos los modelos probados (7.7%) y al mismo tiempo es el más rápido. Es el punto ideal indiscutible para uso en producción.

Turbo vs Medium vs cada tamaño de Whisper

Antes de Turbo, Medium era el compromiso de siempre: precisión aceptable a una velocidad tolerable. Turbo vuelve obsoleta esa disyuntiva — con 809M de parámetros es apenas más grande que Medium (769M) y aun así entrega precisión de clase large a varias veces su velocidad. Aquí está la familia completa de modelos, lado a lado:

Modelo Parámetros Tamaño en disco Velocidad relativa Nivel de precisión
tiny 39M ~75 MB ~10× El más bajo
base 74M ~142 MB ~7× Bajo
small 244M ~466 MB ~4× Moderado
medium 769M ~1.5 GB ~2× Alto
large-v3 1,550M ~2.9 GB 1× (línea base) El más alto
large-v3-turbo 809M ~1.6 GB ~5× en Apple Silicon Casi el más alto

Lanzado el 30 de septiembre de 2024, Turbo tiene 809M de parámetros. Si escogías Medium para ahorrar espacio en disco o ganar velocidad, Turbo ahora le gana en precisión y en velocidad ocupando prácticamente lo mismo.

Limitaciones conocidas (y cómo las resuelve Whisper Notes)

Sin traducción integrada

Turbo se entrenó sin datos de traducción. Solo transcribe en el idioma original — a diferencia de Large-v3, que soporta traducción de audio a inglés.

Whisper Notes — Apple Intelligence traduce las transcripciones automáticamente al idioma que elijas, dándote salida bilingüe sin importar qué modelo uses.

Más alucinaciones con audio ruidoso

Reportes de la comunidad indican que Turbo alucina más que V3 en clips muy cortos o grabaciones con ruido. Es de esperarse por el decoder reducido (4 capas contra 32).

Whisper Notes — corre Pyannote VAD antes de transcribir: detecta los segmentos con voz y quita silencio y ruido para que el modelo solo procese voz real.

¿Qué modelo te conviene usar?

Inglés / idiomas europeos Parakeet V3 — 10× más rápido que Whisper, mejor precisión
Chino / japonés / coreano SenseVoice — hecho a la medida para CJK, velocidad 52×
Otros idiomas Whisper Large V3 Turbo — más de 100 idiomas, alta precisión, más lento

Preguntas frecuentes sobre Whisper Large-v3 Turbo

¿Cuál es la diferencia entre Whisper Large-v3 y Large-v3 Turbo?

Large-v3 Turbo mantiene el encoder de Large-v3 pero reduce el decoder de 32 capas a 4. Por eso es mucho más rápido y aun así queda cerca de la precisión de Large-v3 al transcribir. El costo es que Turbo no soporta la tarea de traducción integrada de Whisper.

¿faster-whisper soporta Large-v3 Turbo?

Sí. faster-whisper soporta Large-v3 Turbo mediante conversiones a CTranslate2, y los benchmarks de la comunidad muestran que Turbo es una excelente opción cuando la VRAM es limitada. En el benchmark de arriba, Turbo en int8 usó cerca de 1.5 GB de VRAM.

¿whisper.cpp soporta Large-v3 Turbo?

Sí. whisper.cpp puede correr versiones convertidas a GGML/GGUF de Whisper Large-v3 Turbo. Si estás armando tu propio pipeline de transcripción local, Turbo suele caber en hardware de consumo con más facilidad que el Large-v3 completo.

¿Dónde puedo descargar openai/whisper-large-v3-turbo?

Los pesos oficiales del modelo están disponibles en Hugging Face, publicados por OpenAI. Los usuarios de Whisper Notes no necesitan descargarlos manualmente: la app de Mac se encarga de configurar el modelo local desde la propia interfaz.

¿Estás comparando todas las opciones locales? Todos los modelos de voz a texto en el dispositivo — las variantes de Whisper, Parakeet V3, SenseVoice y Voxtral — aparecen lado a lado en nuestra página de comparación de modelos Whisper. ¿Apenas conoces Whisper? Empieza con la guía de transcripción con Whisper — qué es el modelo, todas las formas de correrlo y cuánto cuesta.