Mistral ha lanzado Voxtral, su primera familia de modelos de pesos abiertos para transcripción y comprensión de audio. Los benchmarks oficiales muestran un reconocimiento de voz multilingüe sólido y preguntas y respuestas sobre audio, mientras que los dos tamaños de modelo tienen requisitos de hardware muy distintos. Aquí tienes lo que este lanzamiento soporta realmente y por qué Whisper Notes sigue usando modelos más pequeños y centrados en la transcripción en hardware Apple de consumo.
Dos modelos
Mistral publicó dos checkpoints con licencia Apache 2.0 en julio de 2025:
Voxtral Small 24B
- •24.000 millones de parámetros
- •Transcripción, traducción, preguntas y respuestas sobre audio y resúmenes
- •Ventana de contexto de 32k
- •Unos 55 GB de RAM de GPU en bf16/fp16
Voxtral Mini 3B
- •3.000 millones de parámetros
- •La misma familia de tareas de audio y texto en un checkpoint más pequeño
- •Posicionado oficialmente para despliegue local y en el edge
- •Unos 9,5 GB de RAM de GPU en bf16/fp16
Pesos abiertos y licencia
Los dos checkpoints de 2025 son de pesos abiertos bajo la licencia Apache 2.0. Puedes descargarlos y ejecutarlos tú mismo:
- ✓ Pesos completos del modelo disponibles
- ✓ Puedes autoalojarlos o adaptarlos dentro de los términos de la licencia Apache 2.0
- ✓ Sin cuota de la API de Mistral si los autoalojas; sigues pagando tu propio cómputo
- ✓ Procesa el audio en tus propios servidores
Fuentes: el anuncio de lanzamiento de Voxtral de Mistral, la ficha oficial del modelo Voxtral Small y la ficha oficial del modelo Voxtral Mini.
Benchmarks
El lanzamiento de Mistral compara la tasa de error de palabra (WER) macro-media en conjuntos de inglés de formato corto y largo, Mozilla Common Voice, FLEURS y Multilingual LibriSpeech. En los resultados de FLEURS que reporta Mistral, Voxtral Small supera a Whisper en todas las tareas evaluadas. Un WER más bajo es mejor:
WER en FLEURS de los benchmarks de lanzamiento de Mistral frente al precio estimado de la API; tanto los resultados como los precios pueden cambiar
FLEURS es solo una parte de la calidad de transcripción. Son resultados reportados por el propio proveedor, así que compara las definiciones publicadas de los benchmarks y prueba tus propios idiomas, micrófonos y condiciones de grabación antes de elegir un modelo.
Voxtral vs Whisper: ¿cuál deberías usar?
Los benchmarks solo cuentan una parte de la historia. Así se comparan las dos familias de modelos en los factores que importan si de verdad quieres ejecutar uno tú mismo:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Idiomas | 8 idiomas principales | 8 idiomas principales | Más de 100 | Más de 100 |
| Código abierto | Sí | Sí | Sí | Sí |
| Tamaño del modelo | 24B parámetros; ~55 GB de RAM de GPU en bf16/fp16 | 3B parámetros; ~9,5 GB de RAM de GPU en bf16/fp16 | 1,55B parámetros | 809M parámetros (~1,6 GB) |
| Práctico en un Mac de consumo | No en precisión completa en hardware típico | Posible con un runtime compatible; más pesado que Turbo | Sí | Sí |
El veredicto: Voxtral Small reporta resultados de WER sólidos y añade comprensión de audio, algo que Whisper ni siquiera intenta. Voxtral Mini es el checkpoint que Mistral posiciona para despliegue local y en el edge, pero su ficha oficial sigue indicando unos 9,5 GB de RAM de GPU en bf16/fp16. Para una app de transcripción de consumo, Whisper Large-v3 Turbo sigue siendo más fácil de distribuir y cubre muchos más idiomas. Por eso Whisper Notes combina actualmente Whisper Turbo con Parakeet V3 y SenseVoice en lugar de Voxtral.
Coste de la API y del autoalojamiento
Según lo verificado el 10 de julio de 2026, la ficha del modelo de Mistral indica para la entrada de audio de Voxtral Small un precio de $0.004 por minuto. La entrada de texto y el texto generado se facturan por separado en las peticiones de comprensión de audio. Si autoalojas los pesos Apache 2.0, no hay ningún cargo de la API de Mistral, pero pagas el hardware y la operación.
API de Mistral
Pesos autoalojados
Cómo funciona
La ficha oficial del modelo describe Voxtral como un modelo de lenguaje con un codificador de audio y un modo dedicado de transcripción. Los límites de producto importantes son concretos:
1. Arquitectura multimodal
Voxtral acepta audio y texto en la misma conversación en lugar de actuar solo como un decodificador de voz a texto:
- •Modo dedicado para transcripción directa
- •Preguntas y respuestas sobre audio y resúmenes estructurados
- •Múltiples entradas de audio y conversaciones de audio de varios turnos
Límite de formato largo
La ventana de contexto de 32k admite hasta 30 minutos de audio para transcripción o 40 minutos para comprensión de audio más amplia.
2. Idiomas y evaluación
Mistral enumera ocho idiomas principales con detección automática:
- •Inglés, español, francés, portugués, hindi, alemán, neerlandés e italiano
- •Los benchmarks incluyen FLEURS, Mozilla Common Voice y Multilingual LibriSpeech
- •El lanzamiento también evalúa por separado el audio en inglés de formato corto y de formato largo
3. Requisitos de despliegue
Que los pesos sean abiertos no significa que cada checkpoint sea lo bastante pequeño para cualquier dispositivo:
- •Voxtral Small requiere unos 55 GB de RAM de GPU en bf16/fp16 según su ficha de modelo
- •Voxtral Mini es el checkpoint de 3B pensado para despliegue local y en el edge
- •Mistral recomienda vLLM para servir los checkpoints publicados
4. Características clave
Comprensión contextual
Puede responder preguntas y generar resúmenes directamente a partir del audio, dentro del límite de contexto de 32k.
Multilingüe
Detecta y transcribe automáticamente ocho idiomas principales: inglés, español, francés, portugués, hindi, alemán, neerlandés e italiano.
Manejo del ruido
La evaluación oficial incluye conjuntos de voz variados, pero Mistral no publica una garantía general para cualquier grabación con ruido.
Despliegue en el edge
Voxtral Mini es la opción local y de edge. Su ficha oficial de modelo indica unos 9,5 GB de RAM de GPU en bf16/fp16.
5. Arquitectura
Tres componentes principales:
- 1. Codificador de audio: Convierte la forma de onda en representaciones de audio aprendidas
- 2. Proyector: Proyecta las representaciones de audio al espacio oculto del modelo de lenguaje
- 3. Columna vertebral de modelo de lenguaje: Genera transcripciones, respuestas, resúmenes o llamadas a herramientas
Ese diseño explica por qué Voxtral puede hacer más cosas que transcribir, pero también carga con unos pesos de modelo de lenguaje mucho mayores que los de un modelo solo de transcripción como Whisper Turbo.
Por qué Whisper Notes sigue teniendo sentido
Voxtral y Whisper Notes resuelven problemas distintos. Voxtral combina transcripción con comprensión de audio; Whisper Notes se centra en una transcripción privada y fácil de ejecutar en hardware Apple de consumo.
Qué ofrece Whisper Notes
Privacidad
- •Procesamiento 100 % offline
- •Sin transmisión de datos
- •Sin dependencias de la nube
Rendimiento
- •Tecnología Whisper, precisión probada
- •Optimizado para Apple Silicon
- •Resultados fiables
Coste
- •compra única; precio indicado en el canal de compra; el Mac incluye una prueba de 10.000 palabras
- •Sin cargos por minuto
- •Transcripción ilimitada
Experiencia de usuario
- •Interfaz sencilla
- •Actualizaciones periódicas
- •Mejoras continuas
Requisitos de almacenamiento
Voxtral Small es un modelo de clase servidor en precisión completa: su ficha oficial indica unos 55 GB de RAM de GPU. Voxtral Mini está pensado específicamente para uso local y en el edge, pero su ficha sigue indicando unos 9,5 GB de RAM de GPU en bf16/fp16. La descarga de Whisper Turbo dentro de la app ronda los 1,6 GB, algo que encaja mucho mejor con el producto actual de Whisper Notes.
Whisper Notes usa Whisper Large-v3 Turbo: equilibra rendimiento, velocidad y requisitos de VRAM para el uso diario. Pasaremos a modelos mejores cuando estén disponibles con requisitos de recursos razonables.
Voxtral resulta atractivo cuando importan las preguntas y respuestas sobre audio, los resúmenes o el despliegue autoalojado en servidores. Whisper Notes está dirigido a usuarios individuales que quieren transcripción privada y sin suscripciones recurrentes.
Qué significa esto
Voxtral es un paso importante de pesos abiertos más allá del reconocimiento de voz puro, porque puede razonar sobre el audio además de transcribirlo.
Para la transcripción privada offline en Mac y iPhone, los motores especializados más pequeños siguen siendo más fáciles de empaquetar y de ejecutar de forma consistente.
¿Estás comparando todas las opciones locales? Todos los modelos de voz a texto en el dispositivo — las variantes de Whisper, Parakeet V3, SenseVoice y Voxtral — están comparados lado a lado en nuestra página de comparación de modelos Whisper.
Preguntas frecuentes
¿Qué es Mistral Voxtral?
Voxtral es la familia de modelos de pesos abiertos de Mistral para transcripción de voz y comprensión de audio. El lanzamiento de julio de 2025 incluye Voxtral Small 24B para cargas de trabajo de clase servidor y Voxtral Mini 3B para despliegue local y en el edge. Ambos checkpoints usan la licencia Apache 2.0.
¿Puede Voxtral ejecutarse localmente en un Mac?
Los pesos descargables se pueden autoalojar, pero los dos tamaños tienen requisitos distintos. Voxtral Small necesita unos 55 GB de RAM de GPU en bf16/fp16, así que es una opción de clase servidor. Voxtral Mini es el checkpoint local y de edge; su ficha de modelo indica unos 9,5 GB en bf16/fp16, y la velocidad y el uso de memoria reales en un Mac dependen del runtime y de la cuantización.
¿Whisper Notes usa Voxtral?
No. Whisper Notes ejecuta Parakeet V3 (el modelo por defecto en Mac), Whisper Large-v3 Turbo y SenseVoice: modelos elegidos porque equilibran rendimiento, velocidad y requisitos de VRAM para el uso diario en Apple Silicon. Adoptaremos modelos mejores en cuanto sea práctico ejecutarlos en hardware de consumo.
¿Cuántos idiomas soporta Voxtral?
Las fichas oficiales del modelo enumeran ocho idiomas principales con detección automática: inglés, español, francés, portugués, hindi, alemán, neerlandés e italiano. Mistral también evalúa el árabe en FLEURS, pero no está incluido en la lista de idiomas principales de la ficha del modelo.
¿Cuándo se lanzó Mistral Voxtral?
Mistral lanzó Voxtral el 15 de julio de 2025. Los checkpoints iniciales con licencia Apache 2.0 fueron Voxtral Small 24B y Voxtral Mini 3B.