Qwen3-ASR vs Whisper Large V3 Turbo: quais idiomas ganham (Mac)

25 de agosto de 2026
·
11 min read
·Whisper Notes Team

Queríamos responder a uma pergunta: existe algum modelo local que transcreva o seu idioma com mais precisão que o Whisper Large V3? Foi por isso que testamos estes modelos no conjunto de dados FLEURS.

O FLEURS é um conjunto de dados do Google com fala lida em 102 idiomas. Pegamos cerca de 75 frases de cada idioma e passamos os mesmos trechos, na mesma ordem, por cinco modelos:

  • Parakeet V3
  • Whisper Large V3 Turbo
  • SenseVoice Small
  • Whisper Small
  • Qwen3-ASR 1.7B

Os resultados são estes.

Qwen3-ASR 1.7B contra Whisper Large V3 Turbo — o nosso teste FLEURS, um único MacBook Air M5, fala lida, trechos curtos.

Qwen3-ASR 1.7B Whisper Large V3 Turbo
Idiomas suportados 30 101
Vantagens claras Cantonês, hindi, tailandês, vietnamita, francês (5) Finlandês, húngaro, grego e mais 8 idiomas (11)
Velocidade 8,7× o tempo real 2,4× o tempo real
Pico de memória 2,43 GiB 1,87 GiB
Download cerca de 2,5 GB cerca de 1,6 GB

Fora dos idiomas fortes de cada modelo, a diferença de precisão é pequena.

Whisper Large V3 vs Qwen3-ASR: a comparação idioma por idioma

Todos os 30 idiomas, ordenados da maior vantagem do Qwen até a maior desvantagem. Nas duas colunas, mais baixo é melhor.

O nosso teste FLEURS, um único MacBook Air M5, fala lida. CER para chinês, cantonês, japonês, coreano e tailandês, WER para os demais; o verde marca uma vantagem maior que as margens de erro pareadas de 95%.

Idioma Qwen3-ASR 1.7B Whisper Large V3 Turbo
Cantonês 6,00 37,97
Hindi 13,67 30,42
Tailandês 5,92 12,95
Vietnamita 5,07 9,79
Persa 26,98 30,03
Árabe 14,14 15,75
Indonésio 4,97 6,50
Francês 3,98 5,39
Chinês 5,69 6,88
Inglês 5,07 5,92
Alemão 3,51 4,10
Japonês 5,39 5,71
Coreano 3,51 3,70
Espanhol 3,60 3,76
Italiano 2,98 3,05
Russo 5,98 5,51
Português 5,64 4,91
Macedônio 17,81 16,64
Malaio 11,60 10,18
Holandês 7,65 5,63
Turco 8,34 5,53
Dinamarquês 20,12 14,92
Polonês 12,78 5,32
Romeno 18,97 8,22
Filipino 20,44 9,37
Sueco 20,04 8,72
Tcheco 23,92 11,15
Grego 30,20 12,97
Finlandês 26,08 6,54
Húngaro 36,35 13,66

O nosso teste pareado no conjunto de teste do FLEURS, revisão 70bb2e84, cerca de 75 frases por idioma, um único MacBook Air M5.

Os cinco idiomas em que o Qwen3-ASR 1.7B ganha com folga. Taxa de erro em porcentagem, Qwen contra Turbo: cantonês (6,0 contra 38,0), hindi (13,7 contra 30,4), tailandês (5,9 contra 13,0), vietnamita (5,1 contra 9,8), francês (4,0 contra 5,4). Cantonês e tailandês são pontuados por caractere, os demais por palavra. A vantagem dele está nos idiomas pontuados por caractere: em chinês, cantonês, japonês, coreano e tailandês ficou em média com 5,3% contra os 13,4% do Turbo, enquanto nos outros vinte e cinco, pontuados por palavra, ficou em média com 14,0% contra os 10,2% do Turbo.

Os onze idiomas em que o Whisper Large V3 Turbo ganha com folga. Taxa de erro em porcentagem, Qwen contra Turbo, todos pontuados por palavra: húngaro (36,4 contra 13,7), grego (30,2 contra 13,0), finlandês (26,1 contra 6,5), tcheco (23,9 contra 11,2), filipino (20,4 contra 9,4), dinamarquês (20,1 contra 14,9), sueco (20,0 contra 8,7), romeno (19,0 contra 8,2), polonês (12,8 contra 5,3), turco (8,3 contra 5,5), holandês (7,7 contra 5,6).

Os quatorze que ficam perto ou empatados. Inglês (5,1 contra 5,9), alemão (3,5 contra 4,1), espanhol (3,6 contra 3,8), italiano (3,0 contra 3,1), russo (6,0 contra 5,5), português (5,6 contra 4,9); chinês (5,7 contra 6,9), japonês (5,4 contra 5,7) e coreano (3,5 contra 3,7) são pontuados por caractere. Depois, árabe, indonésio, persa, malaio e macedônio. Aqui toda diferença é pequena e cai dentro da faixa de 95%, então este teste não consegue separar os dois modelos.

O cantonês é a única linha que muda uma decisão: 6,00% contra 37,97%, e o SenseVoice Small — que tínhamos publicado como a resposta para o cantonês — ficou em 36,71% de CER nos mesmos trechos. Neste conjunto de fala lida, nenhum dos dois atinge o nível necessário, então a recomendação antiga agora vem com essa ressalva.

Qual é a velocidade do Qwen3-ASR 1.7B?

Os cinco mecanismos, medidos na mesma bancada de testes e na mesma máquina (MacBook Air M5), então pelo menos entre si eles são comparáveis.

Fator de tempo real mediano nos idiomas de cada mecanismo no mesmo teste FLEURS, um único MacBook Air M5, fala lida.

Mecanismo Idiomas Velocidade mediana neste teste (trechos curtos)
SenseVoice Small 6 opções 161,0×
Parakeet TDT 0.6B v3 25 82,9×
Qwen3-ASR 1.7B 30 anunciados 8,7×
Whisper Small 101 6,4×
Whisper Large V3 Turbo 101 2,4×

Estes números vêm de uma bancada de testes com trechos curtos e ficam abaixo do que os mesmos mecanismos entregam numa gravação longa. Use a coluna para comparar os mecanismos entre si dentro deste único teste, e para mais nada.

O Parakeet V3 e o SenseVoice Small são cerca de uma ordem de grandeza mais rápidos que o Qwen3-ASR na mesma bancada de testes. Em arquivos longos, em vez de trechos curtos, o Parakeet já rodou a 103× o tempo real num M4 Pro e o SenseVoice a 52× ou mais — uma medição diferente, com áudio diferente, que aponta na mesma direção.

O Qwen3-ASR fica no meio. Não foi o mecanismo mais lento neste teste com trechos curtos — foi o Whisper Large V3 Turbo — mas varia mais de um idioma para outro que os demais, de 2,7× no grego a 12,4× no japonês.

Quanta memória e quanto disco o Qwen3-ASR consome?

O pico de memória é o maior uso do processo observado item a item no mesmo teste FLEURS, um único MacBook Air M5, fala lida, trechos curtos.

Mecanismo Download Pico de memória neste teste
Parakeet TDT 0.6B v3 465 MB 0,09 GiB
Whisper Small 600 MB 0,87 GiB
SenseVoice Small 827 MB 0,95 GiB
Whisper Large V3 Turbo cerca de 1,6 GB 1,87 GiB
Qwen3-ASR 1.7B cerca de 2,5 GB 2,43 GiB

Nos dois eixos, o Qwen3-ASR é o mais pesado dos cinco: cerca de 2,5 GB de download e 2,43 GiB de pico de memória do processo neste teste, contra cerca de 1,6 GB e 1,87 GiB do Whisper Large V3 Turbo.

Numa máquina de 8 GB existe um caminho mais leve. O Parakeet V3 cobre 25 idiomas em 465 MB e 0,09 GiB, e o Whisper Small cobre 101 em 600 MB e 0,87 GiB.

Como medimos: FLEURS, 30 idiomas, um Mac

O Qwen3-ASR 1.7B rodou como build MLX de 8 bits e o Whisper Large V3 Turbo como build ggml do whisper.cpp sobre Metal. Os dados são o conjunto de teste do Google FLEURS na revisão 70bb2e84 (CC-BY-4.0): 83 dos seus 102 idiomas, cerca de 75 frases e 15 minutos em cada um, os mesmos trechos na mesma ordem para todos os modelos; a comparação pareada é sobre os 30 idiomas do Qwen. WER para os idiomas que separam palavras com espaços, CER para chinês, cantonês, japonês, coreano e tailandês, nunca fundidos em um único número; as margens de erro vêm de um bootstrap item a item com 10.000 reamostragens. Um único MacBook Air M5, 32 GB, macOS 26.5, sem saídas vazias nem falhas em nenhum dos dois modelos.

O FLEURS é fala lida, não é uma reunião nem um ditado. Já duas vezes, em nossos próprios testes, rankings de fala lida não sobreviveram ao áudio real, então não extrapolamos para gravações longas: estas tabelas dizem se um modelo é plausível para o seu idioma, não a precisão que você vai obter. A avaliação do Qwen3-ASR 1.7B em reuniões reais fica para um artigo à parte.

Vale a pena usar o Qwen3-ASR no lugar do Whisper Large V3?

Idioma por idioma, é assim que responderíamos dentro do Whisper Notes para Mac.

  • Se você transcreve cantonês, hindi, tailandês, vietnamita ou francês: escolha o Qwen3-ASR 1.7B.
  • Se você transcreve chinês, japonês, coreano, inglês, alemão, espanhol ou italiano: ele ficou na frente por um triz, e é só isso que afirmamos. Qualquer um dos modelos serve, assim como para persa, árabe, indonésio, russo, português, macedônio e malaio.
  • Se você transcreve finlandês, húngaro, grego, tcheco, sueco, dinamarquês, polonês, romeno, filipino, turco ou holandês: fique no Whisper Large V3 Turbo. Ele ganhou os onze com clareza.
  • Se o que importa para você é velocidade ou espaço em disco: não é este o mecanismo. O Parakeet V3 e o SenseVoice Small foram uma ordem de grandeza mais rápidos, com uma fração do download, e o Whisper Small cobre 101 idiomas em 600 MB a 6,4×.
  • Se você está no iPhone ou na versão da Mac App Store: o mecanismo ainda não chegou lá. Nesses canais, a escolha para o cantonês é o SenseVoice.

Esta é a versão no dispositivo do Qwen3-ASR aberto da Alibaba, portada pelo Whisper Notes para Mac: os pesos abertos convertidos para Apple MLX a 8 bits, rodando na GPU do seu próprio Mac, sem que o áudio chegue aos servidores da Alibaba. Não é o mesmo modelo de 0.6B que o SenseVoice substituiu na versão de download direto (DMG) 1.5.0.

Como usar (Mac por download direto, DMG 1.6.0 em diante): Ajustes, depois Modelo de transcrição, depois Qwen3-ASR 1.7B. O modelo é baixado dentro do app no primeiro uso e ocupa cerca de 2,5 GB. Ele pede macOS 15 ou posterior em Apple silicon, com 16 GB de memória recomendados; o resto do app roda em macOS 14. A lista de idiomas por mecanismo está na nossa página de suporte a idiomas. A CLI local e o servidor MCP aceitam “qwen”, “qwen3” e “qwen3-asr”.

Se você preferir não trocar, não precisa mudar nada: o Parakeet V3 continua sendo o padrão.

Perguntas frequentes

O Qwen3-ASR é mais preciso que o Whisper Large V3 Turbo?

Depende do idioma, e o placar está quase empatado. No nosso teste FLEURS dentro do Whisper Notes para Mac, nos 30 idiomas que os dois modelos cobrem, o Qwen3-ASR 1.7B ficou na frente em 15 e o Whisper Large V3 Turbo em 15. O Qwen liderou com clareza no cantonês (6,00% contra 37,97% de CER), no hindi (13,67% contra 30,42% de WER), no tailandês, no vietnamita e no francês. O Turbo liderou com clareza no finlandês (6,54% contra 26,08% de WER), no húngaro, no grego, no tcheco, no sueco, no dinamarquês, no polonês, no romeno, no filipino, no turco e no holandês. Quatorze das trinta diferenças caem dentro das margens de erro e devem ser lidas como empates. Escolha o Qwen3-ASR se o seu idioma estiver na coluna em que ele ganha e se você usa a versão Mac do Whisper Notes por download direto (DMG); escolha o Whisper Large V3 Turbo para todo o resto e para todos os idiomas fora dos 30 do Qwen, já que o Whisper alcança as 101 opções.

Dá para usar o Qwen3-ASR no iPhone ou pela Mac App Store?

Hoje ele está na versão Mac do Whisper Notes por download direto (DMG), da 1.6.0 em diante. A versão da Mac App Store deve receber os mecanismos mais novos em atualizações seguintes, e não temos uma data. Enquanto isso, o app para iPhone e a versão da Mac App Store têm três famílias de mecanismos — Whisper, Parakeet V3 e SenseVoice — e todo idioma que o Qwen reconhece também é coberto pelo Whisper ali. Contando modelos, a versão da Mac App Store oferece quatro hoje e a de download direto cinco, porque o Whisper vem em Small e em Large V3 Turbo. Se você precisa de cantonês no iPhone, o mecanismo a usar ali é o SenseVoice.

Qwen3-ASR ou SenseVoice para chinês, japonês e coreano?

Eles são próximos na precisão e muito distantes na velocidade. No nosso teste FLEURS, o Qwen3-ASR marcou 5,69% de CER em chinês, 5,39% em japonês e 3,51% em coreano; o SenseVoice Small marcou 7,06%, 6,85% e 7,82% nos mesmos trechos. Nesse teste, o SenseVoice rodou a uma mediana de 161× o tempo real contra os 8,7× do Qwen, baixa 827 MB em vez de cerca de 2,5 GB e está disponível no iPhone e nas duas versões para Mac. Escolha o SenseVoice, a menos que você transcreva cantonês: ali o Qwen3-ASR marcou 6,00% de CER contra os 36,71% do SenseVoice, e a diferença é grande o bastante para compensar a espera.

Quais são os requisitos de sistema do Qwen3-ASR 1.7B?

Um Mac com Apple silicon em macOS 15 ou posterior, com 16 GB de memória recomendados, mais cerca de 2,5 GB de disco para o modelo. É mais do que o resto do Whisper Notes para Mac pede, já que o app roda em macOS 14 e posteriores. No nosso teste, o modelo chegou a um pico de 2,43 GiB de memória de processo, o mais alto dos cinco mecanismos. Num Mac de 8 GB, o Whisper Small cobre a mesma lista de 101 idiomas em 600 MB e o Parakeet V3 cobre 25 idiomas europeus em 465 MB.

O áudio sai do meu Mac quando eu uso o Qwen3-ASR?

Não. A Alibaba também oferece o Qwen3-ASR como serviço na nuvem, pelas APIs DashScope Real-time e FileTrans, em que o áudio é enviado para os servidores deles. O Whisper Notes não usa essas APIs. Ele executa os pesos abertos localmente como modelo MLX de 8 bits na GPU do seu Mac, sem conta e sem chave de API, e a transcrição funciona com a rede desligada. Isso vale para todas as famílias de mecanismos do app, em todos os canais.

Por que estes números não batem com a precisão que eu obtenho nas minhas gravações?

Porque o FLEURS é fala lida, curta e limpa, e as suas gravações não são. O nosso teste é uma calibração sobre um conjunto de dados público: cerca de 75 frases por idioma, um único MacBook Air M5, os mesmos trechos para todos os modelos. Ele serve para perguntar se um modelo é plausível para um idioma, e não é uma previsão da precisão que você vai ter numa reunião, num áudio com ruído, numa fala com sotaque ou num arquivo de duas horas.

Experimente

O Qwen3-ASR 1.7B está no Whisper Notes para Mac da 1.6.0 em diante, só por download direto (DMG). Ajustes, depois Modelo de transcrição. A avaliação gratuita cobre 10.000 palavras, o suficiente para passar o seu idioma pelo modelo e discordar das tabelas acima.

Se você achar um idioma em que os nossos números não batem com a sua experiência, escreva para mac@whispernotes.app. Notas de versão completas: whispernotes.app/changelog.

As fontes de tudo o que está acima: o nosso teste no conjunto de teste do Google FLEURS na revisão 70bb2e84, o cartão do modelo Qwen3-ASR 1.7B e a tabela de idiomas por mecanismo na nossa página de suporte a idiomas, que é gerada a partir do código do próprio app.