Queríamos responder a uma pergunta: existe algum modelo local que transcreva a sua língua com mais precisão do que o Whisper Large V3? Por isso testámos estes modelos no conjunto de dados FLEURS.
O FLEURS é um conjunto de dados da Google com fala lida em 102 línguas. Retirámos cerca de 75 frases de cada língua e passámos os mesmos excertos, pela mesma ordem, por cinco modelos:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
Os resultados são estes.
Qwen3-ASR 1.7B contra Whisper Large V3 Turbo — o nosso teste FLEURS, um único MacBook Air M5, fala lida, excertos curtos.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| Línguas suportadas | 30 | 101 |
| Vantagens claras | Cantonês, hindi, tailandês, vietnamita, francês (5) | Finlandês, húngaro, grego e mais 8 línguas (11) |
| Velocidade | 8,7× o tempo real | 2,4× o tempo real |
| Pico de memória | 2,43 GiB | 1,87 GiB |
| Transferência | cerca de 2,5 GB | cerca de 1,6 GB |
Fora das línguas fortes de cada modelo, a diferença de precisão é pequena.
Whisper Large V3 vs Qwen3-ASR: a comparação língua a língua
Todas as 30 línguas, ordenadas da maior vantagem do Qwen até à maior desvantagem. Nas duas colunas, mais baixo é melhor.
O nosso teste FLEURS, um único MacBook Air M5, fala lida. CER para chinês, cantonês, japonês, coreano e tailandês, WER para as restantes; o verde assinala uma vantagem maior do que as margens de erro emparelhadas de 95%.
| Língua | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| Cantonês | 6,00 | 37,97 |
| Hindi | 13,67 | 30,42 |
| Tailandês | 5,92 | 12,95 |
| Vietnamita | 5,07 | 9,79 |
| Persa | 26,98 | 30,03 |
| Árabe | 14,14 | 15,75 |
| Indonésio | 4,97 | 6,50 |
| Francês | 3,98 | 5,39 |
| Chinês | 5,69 | 6,88 |
| Inglês | 5,07 | 5,92 |
| Alemão | 3,51 | 4,10 |
| Japonês | 5,39 | 5,71 |
| Coreano | 3,51 | 3,70 |
| Espanhol | 3,60 | 3,76 |
| Italiano | 2,98 | 3,05 |
| Russo | 5,98 | 5,51 |
| Português | 5,64 | 4,91 |
| Macedónio | 17,81 | 16,64 |
| Malaio | 11,60 | 10,18 |
| Neerlandês | 7,65 | 5,63 |
| Turco | 8,34 | 5,53 |
| Dinamarquês | 20,12 | 14,92 |
| Polaco | 12,78 | 5,32 |
| Romeno | 18,97 | 8,22 |
| Filipino | 20,44 | 9,37 |
| Sueco | 20,04 | 8,72 |
| Checo | 23,92 | 11,15 |
| Grego | 30,20 | 12,97 |
| Finlandês | 26,08 | 6,54 |
| Húngaro | 36,35 | 13,66 |
O nosso teste emparelhado no conjunto de teste do FLEURS, revisão 70bb2e84, cerca de 75 frases por língua, um único MacBook Air M5.
As cinco línguas que o Qwen3-ASR 1.7B ganha claramente. Taxa de erro em percentagem, Qwen contra Turbo: cantonês (6,0 contra 38,0), hindi (13,7 contra 30,4), tailandês (5,9 contra 13,0), vietnamita (5,1 contra 9,8), francês (4,0 contra 5,4). O cantonês e o tailandês são pontuados por carácter, os restantes por palavra. A sua vantagem está nas línguas pontuadas por carácter: em chinês, cantonês, japonês, coreano e tailandês ficou numa média de 5,3% contra os 13,4% do Turbo, ao passo que nas outras vinte e cinco, pontuadas por palavra, ficou numa média de 14,0% contra os 10,2% do Turbo.
As onze línguas que o Whisper Large V3 Turbo ganha claramente. Taxa de erro em percentagem, Qwen contra Turbo, todas pontuadas por palavra: húngaro (36,4 contra 13,7), grego (30,2 contra 13,0), finlandês (26,1 contra 6,5), checo (23,9 contra 11,2), filipino (20,4 contra 9,4), dinamarquês (20,1 contra 14,9), sueco (20,0 contra 8,7), romeno (19,0 contra 8,2), polaco (12,8 contra 5,3), turco (8,3 contra 5,5), neerlandês (7,7 contra 5,6).
As catorze que ficam perto ou empatadas. Inglês (5,1 contra 5,9), alemão (3,5 contra 4,1), espanhol (3,6 contra 3,8), italiano (3,0 contra 3,1), russo (6,0 contra 5,5), português (5,6 contra 4,9); o chinês (5,7 contra 6,9), o japonês (5,4 contra 5,7) e o coreano (3,5 contra 3,7) são pontuados por carácter. Depois, o árabe, o indonésio, o persa, o malaio e o macedónio. Aqui todas as diferenças são pequenas e caem dentro da faixa de 95%, por isso este teste não consegue separar os dois modelos.
O cantonês é a única linha que muda uma decisão: 6,00% contra 37,97%, e o SenseVoice Small — que tínhamos publicado como a resposta para o cantonês — ficou-se pelos 36,71% de CER nos mesmos excertos. Neste conjunto de fala lida, nenhum dos dois passa a fasquia, por isso a recomendação antiga passa a levar essa ressalva.
Qual é a velocidade do Qwen3-ASR 1.7B?
Os cinco motores, medidos na mesma bancada de testes e na mesma máquina (MacBook Air M5), pelo que são pelo menos comparáveis entre si.
Fator de tempo real mediano nas línguas de cada motor no mesmo teste FLEURS, um único MacBook Air M5, fala lida.
| Motor | Línguas | Velocidade mediana neste teste (excertos curtos) |
|---|---|---|
| SenseVoice Small | 6 opções | 161,0× |
| Parakeet TDT 0.6B v3 | 25 | 82,9× |
| Qwen3-ASR 1.7B | 30 anunciadas | 8,7× |
| Whisper Small | 101 | 6,4× |
| Whisper Large V3 Turbo | 101 | 2,4× |
Estes números vêm de uma bancada de testes com excertos curtos e ficam abaixo do que os mesmos motores fazem numa gravação longa. Use a coluna para comparar os motores entre si dentro deste único teste, e para mais nada.
O Parakeet V3 e o SenseVoice Small são cerca de uma ordem de grandeza mais rápidos do que o Qwen3-ASR na mesma bancada de testes. Em ficheiros longos em vez de excertos curtos, o Parakeet já correu a 103× o tempo real num M4 Pro e o SenseVoice a 52× ou mais — uma medição diferente, com áudio diferente, que aponta no mesmo sentido.
O Qwen3-ASR fica a meio. Não foi o motor mais lento neste teste com excertos curtos — foi o Whisper Large V3 Turbo — mas varia mais de língua para língua do que os outros, de 2,7× no grego a 12,4× no japonês.
Quanta memória e quanto disco custa o Qwen3-ASR?
O pico de memória é a ocupação máxima do processo observada item a item no mesmo teste FLEURS, um único MacBook Air M5, fala lida, excertos curtos.
| Motor | Transferência | Pico de memória neste teste |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0,09 GiB |
| Whisper Small | 600 MB | 0,87 GiB |
| SenseVoice Small | 827 MB | 0,95 GiB |
| Whisper Large V3 Turbo | cerca de 1,6 GB | 1,87 GiB |
| Qwen3-ASR 1.7B | cerca de 2,5 GB | 2,43 GiB |
Nos dois eixos, o Qwen3-ASR é o mais pesado dos cinco: cerca de 2,5 GB de transferência e 2,43 GiB de pico de memória do processo neste teste, contra cerca de 1,6 GB e 1,87 GiB do Whisper Large V3 Turbo.
Numa máquina de 8 GB há um caminho mais leve. O Parakeet V3 cobre 25 línguas em 465 MB e 0,09 GiB, e o Whisper Small cobre 101 em 600 MB e 0,87 GiB.
Como medimos: FLEURS, 30 línguas, um Mac
O Qwen3-ASR 1.7B correu como build MLX de 8 bits e o Whisper Large V3 Turbo como build ggml do whisper.cpp sobre Metal. Os dados são o conjunto de teste do Google FLEURS na revisão 70bb2e84 (CC-BY-4.0): 83 das suas 102 línguas, cerca de 75 frases e 15 minutos em cada uma, os mesmos excertos pela mesma ordem para todos os modelos; a comparação emparelhada é sobre as 30 línguas do Qwen. WER para as línguas que separam palavras com espaços, CER para chinês, cantonês, japonês, coreano e tailandês, nunca fundidos num só número; as margens de erro vêm de um bootstrap item a item com 10.000 reamostragens. Um único MacBook Air M5, 32 GB, macOS 26.5, sem resultados vazios nem falhas em qualquer dos modelos.
O FLEURS é fala lida, não é uma reunião nem um ditado. Já por duas vezes, nos nossos próprios testes, classificações de fala lida não sobreviveram ao áudio real, por isso não as extrapolamos para gravações longas: estas tabelas dizem se um modelo é plausível para a sua língua, não a precisão que vai obter. A avaliação do Qwen3-ASR 1.7B em reuniões reais fica para um artigo à parte.
Vale a pena usar o Qwen3-ASR em vez do Whisper Large V3?
Língua a língua, é assim que responderíamos dentro do Whisper Notes para Mac.
- Se transcreve cantonês, hindi, tailandês, vietnamita ou francês: escolha o Qwen3-ASR 1.7B.
- Se transcreve chinês, japonês, coreano, inglês, alemão, espanhol ou italiano: ficou à frente por um triz, e é só isso que afirmamos. Qualquer um dos modelos serve, tal como para persa, árabe, indonésio, russo, português, macedónio e malaio.
- Se transcreve finlandês, húngaro, grego, checo, sueco, dinamarquês, polaco, romeno, filipino, turco ou neerlandês: fique no Whisper Large V3 Turbo. Ganhou as onze com clareza.
- Se o que lhe interessa é a velocidade ou o espaço em disco: não é este o motor. O Parakeet V3 e o SenseVoice Small foram uma ordem de grandeza mais rápidos, com uma fração da transferência, e o Whisper Small cobre 101 línguas em 600 MB a 6,4×.
- Se está no iPhone ou na versão da Mac App Store: o motor ainda não chegou lá. Nesses canais, a escolha para o cantonês é o SenseVoice.
Isto é o port no dispositivo do Qwen3-ASR aberto da Alibaba feito pelo Whisper Notes para Mac: os pesos abertos convertidos para Apple MLX a 8 bits, a correr na GPU do seu Mac, sem que o áudio chegue aos servidores da Alibaba. Não é o mesmo modelo de 0.6B que o SenseVoice substituiu na versão por transferência direta (DMG) 1.5.0.
Como usá-lo (Mac por transferência direta, DMG 1.6.0 e posteriores): Definições, depois Modelo de transcrição, depois Qwen3-ASR 1.7B. O modelo é transferido dentro da app na primeira utilização e ocupa cerca de 2,5 GB. Precisa de macOS 15 ou posterior em Apple silicon, com 16 GB de memória recomendados; o resto da app corre em macOS 14. A lista de línguas por motor está na nossa página de suporte de línguas. A CLI local e o servidor MCP aceitam «qwen», «qwen3» e «qwen3-asr».
Se preferir não mudar, nada tem de mudar: o Parakeet V3 continua a ser o modelo predefinido.
Perguntas frequentes
O Qwen3-ASR é mais preciso do que o Whisper Large V3 Turbo?
Depende da língua, e a divisão está quase a meio. No nosso teste FLEURS dentro do Whisper Notes para Mac, nas 30 línguas que ambos os modelos cobrem, o Qwen3-ASR 1.7B ficou à frente em 15 e o Whisper Large V3 Turbo em 15. O Qwen liderou com clareza no cantonês (6,00% contra 37,97% de CER), no hindi (13,67% contra 30,42% de WER), no tailandês, no vietnamita e no francês. O Turbo liderou com clareza no finlandês (6,54% contra 26,08% de WER), no húngaro, no grego, no checo, no sueco, no dinamarquês, no polaco, no romeno, no filipino, no turco e no neerlandês. Catorze das trinta diferenças caem dentro das margens de erro e devem ser lidas como empates. Escolha o Qwen3-ASR se a sua língua estiver na coluna em que ele ganha e se usar a versão Mac do Whisper Notes por transferência direta (DMG); escolha o Whisper Large V3 Turbo para tudo o resto e para todas as línguas fora das 30 do Qwen, já que o Whisper chega às 101 opções.
Posso usar o Qwen3-ASR no iPhone ou a partir da Mac App Store?
Hoje está na versão Mac do Whisper Notes por transferência direta (DMG), a partir da 1.6.0. A versão da Mac App Store deverá receber os motores mais recentes em atualizações posteriores, e não temos data para isso. Entretanto, a app para iPhone e a versão da Mac App Store têm três famílias de motores — Whisper, Parakeet V3 e SenseVoice — e todas as línguas que o Qwen reconhece estão aí cobertas pelo Whisper. Contando modelos, a versão da Mac App Store oferece hoje quatro e a versão por transferência direta cinco, porque o Whisper vem em Small e em Large V3 Turbo. Se precisar de cantonês no iPhone, o motor a usar aí é o SenseVoice.
Qwen3-ASR ou SenseVoice para chinês, japonês e coreano?
São próximos na precisão e muito distantes na velocidade. No nosso teste FLEURS, o Qwen3-ASR registou 5,69% de CER em chinês, 5,39% em japonês e 3,51% em coreano; o SenseVoice Small registou 7,06%, 6,85% e 7,82% nos mesmos excertos. Nesse teste, o SenseVoice correu a uma mediana de 161× o tempo real contra os 8,7× do Qwen, transfere 827 MB em vez de cerca de 2,5 GB e está disponível no iPhone e nas duas versões para Mac. Escolha o SenseVoice, a não ser que transcreva cantonês: aí o Qwen3-ASR registou 6,00% de CER contra os 36,71% do SenseVoice, e a diferença é grande o suficiente para compensar a espera.
Quais são os requisitos de sistema do Qwen3-ASR 1.7B?
Um Mac com Apple silicon em macOS 15 ou posterior, com 16 GB de memória recomendados, mais cerca de 2,5 GB de disco para o modelo. É mais do que o resto do Whisper Notes para Mac exige, já que a app corre em macOS 14 e posteriores. No nosso teste, o modelo atingiu um pico de 2,43 GiB de memória de processo, o valor mais alto dos cinco motores. Num Mac de 8 GB, o Whisper Small cobre a mesma lista de 101 línguas em 600 MB e o Parakeet V3 cobre 25 línguas europeias em 465 MB.
O áudio sai do meu Mac quando uso o Qwen3-ASR?
Não. A Alibaba também oferece o Qwen3-ASR como serviço na cloud, através das APIs DashScope Real-time e FileTrans, onde o áudio é enviado para os servidores deles. O Whisper Notes não as usa. Executa os pesos abertos localmente como modelo MLX de 8 bits na GPU do seu Mac, sem conta e sem chave de API, e a transcrição funciona com a rede desligada. Isto vale para todas as famílias de motores da app, em todos os canais.
Porque é que estes números não correspondem à precisão que obtenho nas minhas gravações?
Porque o FLEURS é fala lida, curta e limpa, e as suas gravações não são. O nosso teste é uma calibração sobre um conjunto de dados público: cerca de 75 frases por língua, um único MacBook Air M5, os mesmos excertos para todos os modelos. Serve para perguntar se um modelo é plausível para uma língua, e não é uma previsão da precisão que vai obter numa reunião, em áudio com ruído, em fala com sotaque ou num ficheiro de duas horas.
Experimente
O Qwen3-ASR 1.7B está no Whisper Notes para Mac a partir da 1.6.0, só por transferência direta (DMG). Definições, depois Modelo de transcrição. A avaliação gratuita cobre 10.000 palavras, o suficiente para passar a sua língua pelo modelo e discordar das tabelas acima.
Se encontrar uma língua em que os nossos números não correspondem à sua experiência, escreva para mac@whispernotes.app. Notas de versão completas: whispernotes.app/changelog.
As fontes de tudo o que está acima: o nosso teste no conjunto de teste do Google FLEURS na revisão 70bb2e84, o cartão do modelo Qwen3-ASR 1.7B e a tabela de línguas por motor na nossa página de suporte de línguas, que é gerada a partir do código da própria app.