Mistral Voxtral vs GPT-4o | Benchmark de IA de Voz

2 de agosto de 2025
·
8 min read
·Whisper Notes Team

A Mistral lançou o Voxtral, a sua primeira família de modelos de pesos abertos para transcrição e compreensão de áudio. Os benchmarks oficiais mostram um reconhecimento de voz multilingue forte e perguntas e respostas sobre áudio, mas os dois tamanhos de modelo têm requisitos de hardware muito diferentes. Eis o que o lançamento realmente suporta e porque é que o Whisper Notes continua a usar modelos mais pequenos, focados na transcrição, em hardware Apple de consumo.

Benchmarks de desempenho do Mistral Voxtral

Dois Modelos

A Mistral lançou dois checkpoints Apache 2.0 em julho de 2025:

Voxtral Small 24B

  • 24 mil milhões de parâmetros
  • Transcrição, tradução, perguntas e respostas sobre áudio e sumarização
  • Janela de contexto de 32k
  • Cerca de 55 GB de RAM de GPU em bf16/fp16

Voxtral Mini 3B

  • 3 mil milhões de parâmetros
  • A mesma família de tarefas de áudio e texto num checkpoint mais pequeno
  • Oficialmente posicionado para implementação local e edge
  • Cerca de 9,5 GB de RAM de GPU em bf16/fp16

Pesos Abertos e Licença

Ambos os checkpoints de 2025 são de pesos abertos sob a licença Apache 2.0. Pode descarregá-los e executá-los por conta própria:

  • Pesos completos do modelo disponíveis
  • Alojamento próprio ou adaptação dentro dos termos da licença Apache 2.0
  • Sem custos de API da Mistral em alojamento próprio; continua a pagar a sua própria computação
  • Processe o áudio nos seus próprios servidores

Fontes: o anúncio de lançamento do Voxtral da Mistral, a ficha oficial do modelo Voxtral Small e a ficha oficial do modelo Voxtral Mini.

Benchmarks

O lançamento da Mistral compara a taxa de erro de palavras em média macro em conjuntos de inglês de formato curto e longo, Mozilla Common Voice, FLEURS e Multilingual LibriSpeech. Nos resultados FLEURS reportados pela Mistral, o Voxtral Small supera o Whisper em todas as tarefas avaliadas. Quanto mais baixo o WER, melhor:

Comparação de benchmarks de WER do Voxtral entre todos os modelos

WER no FLEURS dos benchmarks de lançamento da Mistral em função do preço estimado da API; tanto os resultados dos benchmarks como os preços podem mudar

O FLEURS é apenas uma fatia da qualidade de transcrição. Estes são resultados reportados pelo próprio fornecedor, por isso compare as definições publicadas dos benchmarks e teste os seus próprios idiomas, microfones e condições de gravação antes de escolher um modelo.

Voxtral vs Whisper: Qual Deve Usar?

Os benchmarks contam apenas parte da história. Eis como as duas famílias de modelos se comparam nos fatores que importam se quiser mesmo executar um deles:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
Idiomas 8 idiomas principais 8 idiomas principais 100+ 100+
Código aberto Sim Sim Sim Sim
Tamanho do modelo 24 mil milhões de parâmetros; ~55 GB de RAM de GPU em bf16/fp16 3 mil milhões de parâmetros; ~9,5 GB de RAM de GPU em bf16/fp16 1,55 mil milhões de parâmetros 809 milhões de parâmetros (~1,6 GB)
Prático num Mac de consumo Não em precisão total em hardware típico Possível com um runtime compatível; mais pesado do que o Turbo Sim Sim

O veredito: o Voxtral Small reporta resultados de WER fortes e acrescenta uma compreensão de áudio que o Whisper nem sequer tenta. O Voxtral Mini é o checkpoint que a Mistral posiciona para implementação local e edge, mas a sua ficha oficial continua a indicar cerca de 9,5 GB de RAM de GPU em bf16/fp16. Para uma aplicação de transcrição de consumo, o Whisper Large-v3 Turbo continua a ser mais fácil de distribuir e cobre muitos mais idiomas. É por isso que o Whisper Notes combina atualmente o Whisper Turbo com o Parakeet V3 e o SenseVoice, em vez do Voxtral.

Custo de API e de Alojamento Próprio

Conforme verificado a 10 de julho de 2026, a ficha do modelo da Mistral indica a entrada de áudio do Voxtral Small a $0.004 por minuto. A entrada de texto e o texto gerado são faturados separadamente nos pedidos de compreensão de áudio. Se alojar os pesos Apache 2.0 por conta própria, não há qualquer cobrança de API da Mistral, mas paga o hardware e a operação.

API da Mistral

$0.004
por minuto de áudio para o Voxtral Small

Pesos em alojamento próprio

Apache 2.0
sem custos de API; a computação é da sua responsabilidade

Como Funciona

A ficha oficial do modelo descreve o Voxtral como um backbone de modelo de linguagem com um codificador de áudio e um modo de transcrição dedicado. Os limites importantes do produto são concretos:

1. Arquitetura Multimodal

O Voxtral aceita áudio e texto na mesma conversa, em vez de atuar apenas como um descodificador de fala para texto:

  • Modo dedicado para transcrição direta
  • Perguntas e respostas sobre áudio e sumarização estruturada
  • Múltiplas entradas de áudio e conversas de áudio com várias interações

Limite de formato longo

A janela de contexto de 32k suporta até 30 minutos de áudio para transcrição ou 40 minutos para compreensão de áudio mais ampla.

2. Idiomas e Avaliação

A Mistral indica oito idiomas principais com deteção automática:

  • Inglês, espanhol, francês, português, hindi, alemão, neerlandês e italiano
  • Os benchmarks incluem FLEURS, Mozilla Common Voice e Multilingual LibriSpeech
  • O lançamento também avalia separadamente áudio em inglês de formato curto e de formato longo

3. Requisitos de Implementação

Pesos abertos não significam que todos os checkpoints sejam suficientemente pequenos para qualquer dispositivo:

  • O Voxtral Small requer cerca de 55 GB de RAM de GPU em bf16/fp16, segundo a sua ficha de modelo
  • O Voxtral Mini é o checkpoint de 3 mil milhões de parâmetros destinado a implementação local e edge
  • A Mistral recomenda o vLLM para servir os checkpoints lançados

4. Funcionalidades Principais

Compreensão Contextual

Consegue responder a perguntas e produzir resumos diretamente a partir do áudio, dentro do limite de contexto de 32k.

Multilingue

Deteta e transcreve automaticamente oito idiomas principais: inglês, espanhol, francês, português, hindi, alemão, neerlandês e italiano.

Tratamento de Ruído

A avaliação oficial inclui conjuntos de dados de fala variados, mas a Mistral não publica uma garantia geral para todas as gravações com ruído.

Implementação Edge

O Voxtral Mini é a opção local e edge. A sua ficha oficial indica cerca de 9,5 GB de RAM de GPU em bf16/fp16.

5. Arquitetura

Três componentes principais:

  1. 1. Codificador de áudio: converte a forma de onda em representações de áudio aprendidas
  2. 2. Projetor: mapeia as representações de áudio para o espaço oculto do modelo de linguagem
  3. 3. Backbone de modelo de linguagem: gera transcrições, respostas, resumos ou chamadas de ferramentas

Esse design explica porque é que o Voxtral consegue fazer mais do que transcrever, mas também carrega pesos de modelo de linguagem muito maiores do que um modelo exclusivamente de transcrição como o Whisper Turbo.

Porque É Que o Whisper Notes Continua a Fazer Sentido

O Voxtral e o Whisper Notes resolvem problemas diferentes. O Voxtral combina transcrição com compreensão de áudio; o Whisper Notes foca-se em transcrição privada, fácil de executar em hardware Apple de consumo.

O Que o Whisper Notes Oferece

Privacidade

Desempenho

  • Tecnologia Whisper, precisão comprovada
  • Otimizado para Apple Silicon
  • Resultados fiáveis

Custo

  • compra única; preço indicado no canal de compra; o Mac inclui um teste gratuito de 10.000 palavras
  • Sem cobranças por minuto
  • Transcrição ilimitada

Experiência de Utilização

  • Interface simples
  • Atualizações regulares
  • Melhorias contínuas

Requisitos de Armazenamento

O Voxtral Small é um modelo de classe servidor em precisão total: a sua ficha oficial indica cerca de 55 GB de RAM de GPU. O Voxtral Mini destina-se especificamente a uso local e edge, mas a sua ficha continua a indicar cerca de 9,5 GB de RAM de GPU em bf16/fp16. O download do Whisper Turbo na aplicação ronda os 1,6 GB, o que se adequa melhor ao produto atual do Whisper Notes.

O Whisper Notes usa o Whisper Large-v3 Turbo — equilibra desempenho, velocidade e requisitos de VRAM para o uso diário. Passaremos a modelos melhores quando estes ficarem disponíveis com requisitos de recursos razoáveis.

O Voxtral é atrativo quando perguntas e respostas sobre áudio, sumarização ou implementação em servidor próprio são o que importa. O Whisper Notes destina-se a utilizadores individuais que querem transcrição privada e sem subscrição recorrente.

O Que Isto Significa

O Voxtral é um passo importante dos pesos abertos para lá do simples reconhecimento de voz, porque consegue raciocinar sobre o áudio além de o transcrever.

Para transcrição offline privada no Mac e no iPhone, motores especializados mais pequenos continuam a ser mais fáceis de empacotar e de executar de forma consistente.

A comparar todas as opções locais? Todos os modelos de fala para texto no dispositivo — as variantes do Whisper, o Parakeet V3, o SenseVoice e o Voxtral — estão comparados lado a lado na nossa página de comparação de modelos Whisper.

Perguntas Frequentes

O que é o Mistral Voxtral?

O Voxtral é a família de modelos de pesos abertos da Mistral para transcrição de fala e compreensão de áudio. O lançamento de julho de 2025 inclui o Voxtral Small 24B para cargas de trabalho de classe servidor e o Voxtral Mini 3B para implementação local e edge. Ambos os checkpoints usam a licença Apache 2.0.

O Voxtral pode correr localmente num Mac?

Os pesos descarregáveis podem ser alojados por conta própria, mas os dois tamanhos têm requisitos diferentes. O Voxtral Small precisa de cerca de 55 GB de RAM de GPU em bf16/fp16, pelo que é uma escolha de classe servidor. O Voxtral Mini é o checkpoint local e edge; a sua ficha de modelo indica cerca de 9,5 GB em bf16/fp16, e a velocidade e o uso de memória reais num Mac dependem do runtime e da quantização.

O Whisper Notes usa o Voxtral?

Não. O Whisper Notes executa o Parakeet V3 (o modelo predefinido no Mac), o Whisper Large-v3 Turbo e o SenseVoice — modelos escolhidos por equilibrarem desempenho, velocidade e requisitos de VRAM para o uso diário em Apple Silicon. Adotaremos modelos melhores assim que se tornarem práticos de executar em hardware de consumo.

Quantos idiomas suporta o Voxtral?

As fichas oficiais dos modelos indicam oito idiomas principais com deteção automática: inglês, espanhol, francês, português, hindi, alemão, neerlandês e italiano. A Mistral também avalia árabe no FLEURS, mas este não está incluído na lista de idiomas principais da ficha do modelo.

Quando foi lançado o Mistral Voxtral?

A Mistral lançou o Voxtral a 15 de julho de 2025. Os checkpoints Apache 2.0 iniciais foram o Voxtral Small 24B e o Voxtral Mini 3B.