O Whisper Large-v3 Turbo da OpenAI reduz o decoder de 32 camadas para 4, cortando os parâmetros de 1,55 mil milhões para 809M. Nos nossos testes em Apple Silicon, transcreveu o mesmo áudio cerca de 5× mais depressa com precisão quase idêntica. O Whisper Notes inclui-o no Mac e no iPhone.
V3 Turbo vs V3: o que mudou
O Turbo não é uma arquitetura nova. É exatamente o mesmo modelo Whisper Large-v3 com o decoder podado de 32 camadas para 4, depois afinado (fine-tuned) para recuperar a precisão. O encoder fica intocado.
| Large-v3 Turbo | Large-v3 | |
|---|---|---|
| Parâmetros | 809M | 1,550M |
| Camadas do decoder | 4 | 32 |
| Idiomas | 100+ | 100+ |
| Tarefa de tradução | Não suportada | Suportada |
| Licença | MIT | Apache 2.0 |
Método: o mesmo ficheiro de áudio de 10 minutos foi transcrito na mesma build do Whisper Notes em cada dispositivo indicado. Os tempos são segundos de relógio desde o início da transcrição até ao texto final; entre o V3 e o Turbo, só o modelo mudou.
A tarefa de tradução foi explicitamente excluída dos dados de treino do Turbo. O modelo completo Large-v3 suporta-a, mas o Whisper Notes inclui apenas o Turbo — a tradução é tratada à parte através da Apple Intelligence.
O modelo base: o que é o Whisper Large-v3?
O Whisper Large-v3 é o modelo de reconhecimento de voz open-source de referência da OpenAI, lançado em novembro de 2023. Tem 1,55 mil milhões de parâmetros, usa uma entrada de espetrograma com 128 mel-bins, foi treinado com 5 milhões de horas de áudio (1 milhão com anotação fraca + 4 milhões com pseudo-anotação) e suporta mais de 100 idiomas. No Open ASR Leaderboard da Hugging Face regista uma taxa média de erro por palavra de ~7,4% — o teto de precisão contra o qual o Turbo é medido ao longo deste artigo. Para ver como o Large-v3 se compara com todos os outros modelos locais, consulte a nossa comparação de modelos Whisper.
Benchmark de velocidade: Whisper Notes em Apple Silicon
No Whisper Notes para Mac, o Turbo corre via CoreML no Neural Engine. A processar 10 minutos de áudio:
| Dispositivo | Whisper V3 | V3 Turbo | Aceleração |
|---|---|---|---|
| iPhone 15 Pro | 425 s | 82 s | 5.2× |
| iPad Pro M2 | 380 s | 71 s | 5.4× |
| MacBook Pro M2 | 316 s | 63 s | 5.0× |
A aceleração de 5× é específica do Whisper Notes em Apple Silicon, onde o decoder mais pequeno beneficia da otimização do Neural Engine. Em GPU, com frameworks como o faster-whisper, a diferença encurta para ~2,7× (ver os benchmarks da comunidade abaixo).
Precisão: comparação de WER
O Open ASR Leaderboard da Hugging Face testa ambos os modelos nos mesmos datasets em inglês. A taxa de erro por palavra (WER) do Turbo fica a menos de meio ponto do V3 em todos os benchmarks:
| Dataset | WER V3 Turbo | WER V3 |
|---|---|---|
| LibriSpeech Clean | 2.10% | 2.01% |
| LibriSpeech Other | 4.24% | 3.91% |
| GigaSpeech | 10.14% | 10.02% |
| Earnings22 | 11.63% | 11.29% |
| AMI | 16.13% | 15.95% |
| WER médio | 7.83% | 7.44% |
O V3 é ligeiramente mais preciso em todos os datasets, mas a diferença é pequena — 0,39 pontos percentuais em média. Na maioria das transcrições do mundo real, não vai notar a diferença.
Na avaliação de áudio longo do YouTube-commons (um dos maiores benchmarks de ASR open-source), o Turbo obtém 13,40% de WER contra 13,20% do V3 — a funcionar a um fator de tempo real de 129,5× contra 55,3×. Ou seja, 2,3× mais rápido com precisão quase idêntica em áudio do mundo real.
Qual é a precisão do Turbo em coreano, russo e outros idiomas?
Os benchmarks acima são em inglês. Segundo a model card da OpenAI, o decoder podado de 4 camadas do Turbo custa um pouco mais de precisão fora do inglês, com a maior degradação nos idiomas com menos recursos. Em russo e na maioria das línguas europeias, o Turbo mantém-se próximo do Large-v3 completo — e, se usa o Whisper Notes, o Parakeet V3 cobre o russo e outras 24 línguas europeias a 10× a velocidade do Whisper.
Para coreano, japonês, chinês e cantonês, um modelo concebido de propósito é ao mesmo tempo mais rápido e melhor na pontuação: o SenseVoice transcreve CJK a 52× o tempo real. O Whisper Notes inclui o SenseVoice ao lado do Turbo tanto no Mac como no iOS, para que possa escolher o modelo certo para cada idioma em vez de forçar tudo por um só.
Benchmarks da comunidade: GPU e CPU
Benchmarks independentes das comunidades do faster-whisper e do whisper.cpp mostram resultados consistentes em hardware diferente. A transcrever 13 minutos de áudio com o faster-whisper em GPU:
| Modelo | Precisão | Tempo | Memória GPU | WER |
|---|---|---|---|---|
| Large-v3 Turbo | fp16 | 19.2 s | 2,537 MB | 1.92% |
| Large-v3 | fp16 | 52.0 s | 4,521 MB | 2.88% |
| Large-v3 Turbo | int8 | 19.6 s | 1,545 MB | 1.92% |
| Distil-Large-v3 | fp16 | 26.1 s | 2,409 MB | 2.39% |
Fonte: benchmark do faster-whisper em GPU NVIDIA, split de validação clean do LibriSpeech. O Turbo em int8 usa apenas 1,5 GB de VRAM — cabe numa GPU de 2 GB.
A inferência em lote numa RTX 3060 Laptop (6 GB de VRAM, precisão int8) alarga ainda mais a vantagem:
| Modelo | Sequencial | Em lote (10) | WER em lote |
|---|---|---|---|
| Large-v3 Turbo | 46.1 s | 18.7 s | 7.7% |
| Large-v3 | 230.8 s | 43.0 s | 7.9% |
| Large-v2 | 178.3 s | 43.2 s | 8.8% |
| Medium | 113.3 s | 26.3 s | 8.9% |
Fonte: benchmark de NilaierMusic, Intel i7-12650H + RTX 3060 Laptop de 6 GB, áudio em francês, precisão int8.
Com processamento em lote, o Turbo alcança o melhor WER de todos os modelos testados (7,7%), sendo ao mesmo tempo o mais rápido. É o ponto ideal claro para uso em produção.
Turbo vs Medium vs todos os tamanhos do Whisper
Antes do Turbo, o Medium era o compromisso habitual: precisão aceitável a uma velocidade tolerável. O Turbo torna essa troca obsoleta — com 809M de parâmetros, é pouco maior do que o Medium (769M) e, ainda assim, oferece precisão de classe large a várias vezes a velocidade. Eis a família completa de modelos lado a lado:
| Modelo | Parâmetros | Tamanho em disco | Velocidade relativa | Nível de precisão |
|---|---|---|---|---|
| tiny | 39M | ~75 MB | ~10× | O mais baixo |
| base | 74M | ~142 MB | ~7× | Baixo |
| small | 244M | ~466 MB | ~4× | Moderado |
| medium | 769M | ~1,5 GB | ~2× | Alto |
| large-v3 | 1,550M | ~2,9 GB | 1× (referência) | O mais alto |
| large-v3-turbo | 809M | ~1,6 GB | ~5× em Apple Silicon | Quase o mais alto |
Lançado a 30 de setembro de 2024, o Turbo tem 809M de parâmetros. Se escolhia o Medium para poupar espaço em disco ou ganhar velocidade, o Turbo supera-o agora em precisão e em velocidade com praticamente a mesma pegada.
Limitações conhecidas (e como o Whisper Notes as resolve)
Sem tradução integrada
O Turbo foi treinado sem dados de tradução. Transcreve apenas no idioma de origem — ao contrário do Large-v3, que suporta tradução de áudio para inglês.
Whisper Notes — a Apple Intelligence traduz automaticamente as transcrições para o idioma que escolher, dando-lhe saída bilingue independentemente do modelo que usar.
Mais alucinações em áudio com ruído
Relatos da comunidade indicam que o Turbo alucina mais do que o V3 em clips muito curtos ou gravações com ruído. É expectável dado o decoder reduzido (4 camadas vs 32).
Whisper Notes — executa o Pyannote VAD antes da transcrição, detetando os segmentos de fala e eliminando silêncio/ruído para que o modelo processe apenas voz real.
Que modelo deve usar?
| Inglês / línguas europeias | Parakeet V3 — 10× mais rápido do que o Whisper, melhor precisão |
| Chinês / Japonês / Coreano | SenseVoice — concebido para CJK, velocidade 52× |
| Outros idiomas | Whisper Large V3 Turbo — mais de 100 idiomas, alta precisão, mais lento |
Perguntas frequentes sobre o Whisper Large-v3 Turbo
Qual é a diferença entre o Whisper Large-v3 e o Large-v3 Turbo?
O Large-v3 Turbo mantém o encoder do Large-v3, mas reduz o decoder de 32 camadas para 4. É por isso que é muito mais rápido, mantendo-se próximo da precisão do Large-v3 na transcrição. A contrapartida é que o Turbo não suporta a tarefa de tradução integrada do Whisper.
O faster-whisper suporta o Large-v3 Turbo?
Sim. O faster-whisper suporta o Large-v3 Turbo através de conversões CTranslate2, e os benchmarks da comunidade mostram que o Turbo é uma escolha forte quando a VRAM é limitada. No benchmark acima, o Turbo em int8 usou cerca de 1,5 GB de VRAM.
O whisper.cpp suporta o Large-v3 Turbo?
Sim. O whisper.cpp consegue executar versões convertidas para GGML/GGUF do Whisper Large-v3 Turbo. Se está a montar o seu próprio pipeline de transcrição local, o Turbo cabe muitas vezes em hardware de consumo com mais facilidade do que o Large-v3 completo.
Onde posso descarregar o openai/whisper-large-v3-turbo?
Os pesos oficiais do modelo estão disponíveis na Hugging Face, publicados pela OpenAI. Os utilizadores do Whisper Notes não precisam de os descarregar manualmente: a aplicação para Mac trata da configuração do modelo local diretamente na interface.
A comparar todas as opções locais? Todos os modelos de voz para texto no dispositivo — as variantes do Whisper, o Parakeet V3, o SenseVoice e o Voxtral — estão comparados lado a lado na nossa página de comparação de modelos Whisper. Novo no Whisper? Comece pelo Guia de Transcrição com Whisper — o que é o modelo, todas as formas de o executar e quanto custa.