A Mistral lançou o Voxtral, a sua primeira família de modelos de pesos abertos para transcrição e compreensão de áudio. Os benchmarks oficiais mostram um reconhecimento de voz multilingue forte e perguntas e respostas sobre áudio, mas os dois tamanhos de modelo têm requisitos de hardware muito diferentes. Eis o que o lançamento realmente suporta e porque é que o Whisper Notes continua a usar modelos mais pequenos, focados na transcrição, em hardware Apple de consumo.
Dois Modelos
A Mistral lançou dois checkpoints Apache 2.0 em julho de 2025:
Voxtral Small 24B
- •24 mil milhões de parâmetros
- •Transcrição, tradução, perguntas e respostas sobre áudio e sumarização
- •Janela de contexto de 32k
- •Cerca de 55 GB de RAM de GPU em bf16/fp16
Voxtral Mini 3B
- •3 mil milhões de parâmetros
- •A mesma família de tarefas de áudio e texto num checkpoint mais pequeno
- •Oficialmente posicionado para implementação local e edge
- •Cerca de 9,5 GB de RAM de GPU em bf16/fp16
Pesos Abertos e Licença
Ambos os checkpoints de 2025 são de pesos abertos sob a licença Apache 2.0. Pode descarregá-los e executá-los por conta própria:
- ✓ Pesos completos do modelo disponíveis
- ✓ Alojamento próprio ou adaptação dentro dos termos da licença Apache 2.0
- ✓ Sem custos de API da Mistral em alojamento próprio; continua a pagar a sua própria computação
- ✓ Processe o áudio nos seus próprios servidores
Fontes: o anúncio de lançamento do Voxtral da Mistral, a ficha oficial do modelo Voxtral Small e a ficha oficial do modelo Voxtral Mini.
Benchmarks
O lançamento da Mistral compara a taxa de erro de palavras em média macro em conjuntos de inglês de formato curto e longo, Mozilla Common Voice, FLEURS e Multilingual LibriSpeech. Nos resultados FLEURS reportados pela Mistral, o Voxtral Small supera o Whisper em todas as tarefas avaliadas. Quanto mais baixo o WER, melhor:
WER no FLEURS dos benchmarks de lançamento da Mistral em função do preço estimado da API; tanto os resultados dos benchmarks como os preços podem mudar
O FLEURS é apenas uma fatia da qualidade de transcrição. Estes são resultados reportados pelo próprio fornecedor, por isso compare as definições publicadas dos benchmarks e teste os seus próprios idiomas, microfones e condições de gravação antes de escolher um modelo.
Voxtral vs Whisper: Qual Deve Usar?
Os benchmarks contam apenas parte da história. Eis como as duas famílias de modelos se comparam nos fatores que importam se quiser mesmo executar um deles:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Idiomas | 8 idiomas principais | 8 idiomas principais | 100+ | 100+ |
| Código aberto | Sim | Sim | Sim | Sim |
| Tamanho do modelo | 24 mil milhões de parâmetros; ~55 GB de RAM de GPU em bf16/fp16 | 3 mil milhões de parâmetros; ~9,5 GB de RAM de GPU em bf16/fp16 | 1,55 mil milhões de parâmetros | 809 milhões de parâmetros (~1,6 GB) |
| Prático num Mac de consumo | Não em precisão total em hardware típico | Possível com um runtime compatível; mais pesado do que o Turbo | Sim | Sim |
O veredito: o Voxtral Small reporta resultados de WER fortes e acrescenta uma compreensão de áudio que o Whisper nem sequer tenta. O Voxtral Mini é o checkpoint que a Mistral posiciona para implementação local e edge, mas a sua ficha oficial continua a indicar cerca de 9,5 GB de RAM de GPU em bf16/fp16. Para uma aplicação de transcrição de consumo, o Whisper Large-v3 Turbo continua a ser mais fácil de distribuir e cobre muitos mais idiomas. É por isso que o Whisper Notes combina atualmente o Whisper Turbo com o Parakeet V3 e o SenseVoice, em vez do Voxtral.
Custo de API e de Alojamento Próprio
Conforme verificado a 10 de julho de 2026, a ficha do modelo da Mistral indica a entrada de áudio do Voxtral Small a $0.004 por minuto. A entrada de texto e o texto gerado são faturados separadamente nos pedidos de compreensão de áudio. Se alojar os pesos Apache 2.0 por conta própria, não há qualquer cobrança de API da Mistral, mas paga o hardware e a operação.
API da Mistral
Pesos em alojamento próprio
Como Funciona
A ficha oficial do modelo descreve o Voxtral como um backbone de modelo de linguagem com um codificador de áudio e um modo de transcrição dedicado. Os limites importantes do produto são concretos:
1. Arquitetura Multimodal
O Voxtral aceita áudio e texto na mesma conversa, em vez de atuar apenas como um descodificador de fala para texto:
- •Modo dedicado para transcrição direta
- •Perguntas e respostas sobre áudio e sumarização estruturada
- •Múltiplas entradas de áudio e conversas de áudio com várias interações
Limite de formato longo
A janela de contexto de 32k suporta até 30 minutos de áudio para transcrição ou 40 minutos para compreensão de áudio mais ampla.
2. Idiomas e Avaliação
A Mistral indica oito idiomas principais com deteção automática:
- •Inglês, espanhol, francês, português, hindi, alemão, neerlandês e italiano
- •Os benchmarks incluem FLEURS, Mozilla Common Voice e Multilingual LibriSpeech
- •O lançamento também avalia separadamente áudio em inglês de formato curto e de formato longo
3. Requisitos de Implementação
Pesos abertos não significam que todos os checkpoints sejam suficientemente pequenos para qualquer dispositivo:
- •O Voxtral Small requer cerca de 55 GB de RAM de GPU em bf16/fp16, segundo a sua ficha de modelo
- •O Voxtral Mini é o checkpoint de 3 mil milhões de parâmetros destinado a implementação local e edge
- •A Mistral recomenda o vLLM para servir os checkpoints lançados
4. Funcionalidades Principais
Compreensão Contextual
Consegue responder a perguntas e produzir resumos diretamente a partir do áudio, dentro do limite de contexto de 32k.
Multilingue
Deteta e transcreve automaticamente oito idiomas principais: inglês, espanhol, francês, português, hindi, alemão, neerlandês e italiano.
Tratamento de Ruído
A avaliação oficial inclui conjuntos de dados de fala variados, mas a Mistral não publica uma garantia geral para todas as gravações com ruído.
Implementação Edge
O Voxtral Mini é a opção local e edge. A sua ficha oficial indica cerca de 9,5 GB de RAM de GPU em bf16/fp16.
5. Arquitetura
Três componentes principais:
- 1. Codificador de áudio: converte a forma de onda em representações de áudio aprendidas
- 2. Projetor: mapeia as representações de áudio para o espaço oculto do modelo de linguagem
- 3. Backbone de modelo de linguagem: gera transcrições, respostas, resumos ou chamadas de ferramentas
Esse design explica porque é que o Voxtral consegue fazer mais do que transcrever, mas também carrega pesos de modelo de linguagem muito maiores do que um modelo exclusivamente de transcrição como o Whisper Turbo.
Porque É Que o Whisper Notes Continua a Fazer Sentido
O Voxtral e o Whisper Notes resolvem problemas diferentes. O Voxtral combina transcrição com compreensão de áudio; o Whisper Notes foca-se em transcrição privada, fácil de executar em hardware Apple de consumo.
O Que o Whisper Notes Oferece
Privacidade
- •Processamento 100% offline
- •Sem transmissão de dados
- •Sem dependências da nuvem
Desempenho
- •Tecnologia Whisper, precisão comprovada
- •Otimizado para Apple Silicon
- •Resultados fiáveis
Custo
- •compra única; preço indicado no canal de compra; o Mac inclui um teste gratuito de 10.000 palavras
- •Sem cobranças por minuto
- •Transcrição ilimitada
Experiência de Utilização
- •Interface simples
- •Atualizações regulares
- •Melhorias contínuas
Requisitos de Armazenamento
O Voxtral Small é um modelo de classe servidor em precisão total: a sua ficha oficial indica cerca de 55 GB de RAM de GPU. O Voxtral Mini destina-se especificamente a uso local e edge, mas a sua ficha continua a indicar cerca de 9,5 GB de RAM de GPU em bf16/fp16. O download do Whisper Turbo na aplicação ronda os 1,6 GB, o que se adequa melhor ao produto atual do Whisper Notes.
O Whisper Notes usa o Whisper Large-v3 Turbo — equilibra desempenho, velocidade e requisitos de VRAM para o uso diário. Passaremos a modelos melhores quando estes ficarem disponíveis com requisitos de recursos razoáveis.
O Voxtral é atrativo quando perguntas e respostas sobre áudio, sumarização ou implementação em servidor próprio são o que importa. O Whisper Notes destina-se a utilizadores individuais que querem transcrição privada e sem subscrição recorrente.
O Que Isto Significa
O Voxtral é um passo importante dos pesos abertos para lá do simples reconhecimento de voz, porque consegue raciocinar sobre o áudio além de o transcrever.
Para transcrição offline privada no Mac e no iPhone, motores especializados mais pequenos continuam a ser mais fáceis de empacotar e de executar de forma consistente.
A comparar todas as opções locais? Todos os modelos de fala para texto no dispositivo — as variantes do Whisper, o Parakeet V3, o SenseVoice e o Voxtral — estão comparados lado a lado na nossa página de comparação de modelos Whisper.
Perguntas Frequentes
O que é o Mistral Voxtral?
O Voxtral é a família de modelos de pesos abertos da Mistral para transcrição de fala e compreensão de áudio. O lançamento de julho de 2025 inclui o Voxtral Small 24B para cargas de trabalho de classe servidor e o Voxtral Mini 3B para implementação local e edge. Ambos os checkpoints usam a licença Apache 2.0.
O Voxtral pode correr localmente num Mac?
Os pesos descarregáveis podem ser alojados por conta própria, mas os dois tamanhos têm requisitos diferentes. O Voxtral Small precisa de cerca de 55 GB de RAM de GPU em bf16/fp16, pelo que é uma escolha de classe servidor. O Voxtral Mini é o checkpoint local e edge; a sua ficha de modelo indica cerca de 9,5 GB em bf16/fp16, e a velocidade e o uso de memória reais num Mac dependem do runtime e da quantização.
O Whisper Notes usa o Voxtral?
Não. O Whisper Notes executa o Parakeet V3 (o modelo predefinido no Mac), o Whisper Large-v3 Turbo e o SenseVoice — modelos escolhidos por equilibrarem desempenho, velocidade e requisitos de VRAM para o uso diário em Apple Silicon. Adotaremos modelos melhores assim que se tornarem práticos de executar em hardware de consumo.
Quantos idiomas suporta o Voxtral?
As fichas oficiais dos modelos indicam oito idiomas principais com deteção automática: inglês, espanhol, francês, português, hindi, alemão, neerlandês e italiano. A Mistral também avalia árabe no FLEURS, mas este não está incluído na lista de idiomas principais da ficha do modelo.
Quando foi lançado o Mistral Voxtral?
A Mistral lançou o Voxtral a 15 de julho de 2025. Os checkpoints Apache 2.0 iniciais foram o Voxtral Small 24B e o Voxtral Mini 3B.