Apple Speech vs Whisper: SpeechAnalyzer é bom em português?

1 de setembro de 2026
·
8 min read
·Whisper Notes Team

Desde o macOS 26 e o iOS 26, a Apple oferece uma nova geração de reconhecimento de voz no dispositivo — SpeechAnalyzer e SpeechTranscriber, chamados abaixo, de forma abreviada, de Apple Speech. Ela é claramente mais precisa que o antigo mecanismo de ditado. Por isso, queríamos saber: o reconhecimento de voz integrado da Apple já é bom o bastante para você dispensar completamente um app de transcrição? E a que distância ele fica dos modelos abertos no dispositivo disponíveis no Whisper Notes — Whisper, Parakeet, SenseVoice e Qwen3-ASR? Fizemos um teste rigoroso. Estes são os resultados. Nos dez idiomas que testamos, o Apple Speech nunca teve a taxa de erro mais baixa, ficou a menos de 1,5 ponto do líder em coreano, japonês e chinês e não tem nenhum modelo para holandês, russo ou polonês.

A que distância o Apple Speech fica dos modelos que você baixa?

Idioma Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Inglês 8,80 4,49 5,49 7,04 6,89 8,46
Alemão 6,26 2,85 4,05 8,67 6,26
Holandês 7,36 5,69 16,75 8,58
Russo 5,65 5,13 11,37 7,12
Polonês 12,59 5,45 15,81 8,30
Japonês 6,36 5,74 5,30 11,37 6,78
Coreano 4,31 3,54 4,25 7,30 7,85
Francês 7,61 4,57 5,97 13,24 5,83
Chinês 7,97 6,49 7,97 20,50 7,69
Espanhol (América Latina) 5,41 3,38 3,62 6,22 4,86

Dez dos idiomas mais usados, um mecanismo por coluna. Cada célula mostra a taxa de erro desse mecanismo: quanto menor, melhor; o verde marca o menor valor da linha e o branco o segundo menor. CER para japonês, coreano e chinês, WER para os demais, nunca combinados em um único número. O nosso teste FLEURS, feito pela equipe do Whisper Notes, em um único M5 MacBook Air, fala lida.

Nomes abreviados: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Um travessão significa que o mecanismo não tem modelo para esse idioma.

O Qwen3-ASR 1.7B tem a taxa de erro mais baixa em seis dos dez idiomas e o Whisper Large V3 Turbo nos outros quatro. O Apple Speech fica 0,77 ponto atrás do líder da linha no coreano, 1,06 no japonês e 1,48 no chinês, onde empata com o Whisper Large V3 Turbo em 7,97. Nos sete idiomas que suporta, fica entre 0,8 e 4,3 pontos atrás do líder da linha; a maior distância aparece no inglês, 8,80 contra 4,49. Não há resultado do Apple Speech para holandês, polonês ou russo.

Quais idiomas o Apple Speech suporta?

O Apple Speech retornou resultados para 21 das 83 configurações de idioma deste teste. Os dois modelos Whisper cobrem todas as 83, o Qwen3-ASR 1.7B cobre 30 e o Parakeet V3 25. Dos dez idiomas acima, ele não tem modelo para holandês, polonês ou russo. Não existe uma lista fixa para citar: os recursos de idioma pertencem ao macOS, então um app pergunta em tempo de execução o que está disponível em cada máquina.

Idioma Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Italiano 4,39 2,58 2,58 7,64 3,43
Cantonês 8,69 6,44 36,75 119,01 37,23
Português (Brasil) 9,35 5,17 5,44 8,61 6,49
Hindi 101,50 13,19 29,64 61,26
Telugu 101,63 81,74 103,19
Urdu 101,69 23,39 38,83
Punjabi 101,75 92,05 103,40
Bengali 102,00 83,52 117,37
Nepalês 102,13 88,59 118,84
Malaiala 102,18 107,34 167,16
Marata 102,23 82,69 109,95
Canarês 103,83 72,07 116,10
Guzerate 104,52 75,31 108,91
Tâmil 113,01 71,28 79,77

Os outros catorze idiomas para os quais o Apple Speech retornou um resultado, ordenados pela própria taxa de erro. As mesmas colunas, cores e abreviações acima; CER para cantonês, WER para os demais. Uma taxa de erro pode ultrapassar 100% porque as inserções também contam no numerador.

Nas últimas onze linhas, do hindi ao tâmil, o Apple Speech respondeu em transliteração latina, em vez da escrita nativa. Portanto, sua taxa de erro mede uma incompatibilidade de escrita, não a precisão do reconhecimento, e essas células ficam fora do ranking da linha; os valores dos outros mecanismos nessas linhas são medições normais.

Como funciona o SpeechAnalyzer

A Apple tem uma API de reconhecimento de voz desde o iOS 10. Essa API, SFSpeechRecognizer, é o mecanismo por trás do antigo caminho de ditado. O SpeechAnalyzer a substitui: foi introduzido no macOS 26 e no iOS 26 e está disponível em todas as plataformas Apple, exceto no watchOS.

A API é organizada em torno de uma sessão. Você cria um SpeechAnalyzer, atribui a ele um ou mais módulos e fornece o áudio; o SpeechTranscriber é o módulo que transforma fala em texto. O áudio entra como uma sequência assíncrona que o próprio app preenche, os resultados voltam como uma segunda sequência e as duas normalmente rodam em tarefas diferentes. O analisador aceita uma sequência de entrada por vez. Cada buffer e cada resultado têm um código de tempo relativo à timeline do próprio áudio, para que o resultado possa ser recolocado no ponto de origem.

Diagrama Apple WWDC25 da concorrência do SpeechAnalyzer: uma tarefa de entrada envia uma AsyncSequence de entrada ao SpeechAnalyzer e ao SpeechTranscriber em uma tarefa de análise, que emitem uma AsyncSequence de resultados para uma tarefa de resultados e para a interface do usuário

Uma sessão, três tarefas: o áudio entra como AsyncSequence, o SpeechAnalyzer e o SpeechTranscriber o analisam e os resultados voltam como uma segunda AsyncSequence que a interface pode ler. Fonte: Apple, sessão WWDC25 277.

Os resultados chegam duas vezes. Tudo dentro do que a Apple chama de intervalo volátil ainda pode ser substituído por um resultado melhor; tudo fora dele é definitivo. É assim que um app mostra uma transcrição provisória enquanto você ainda está falando e a corrige depois.

A Apple indica cinco objetivos de design para o modelo SpeechTranscriber: áudio longo, fala conversacional, vozes distantes, baixa latência e privacidade, o que significa que ele roda no dispositivo. Os apps Notas, Gravador e Diário, além do resumo de chamadas, usam esse modelo.

Slide Apple WWDC25 com os recursos do modelo SpeechTranscriber: áudio longo, fala conversacional, vozes distantes, baixa latência e privacidade

Os cinco objetivos de design declarados pela Apple para o modelo SpeechTranscriber. Fonte: Apple, sessão WWDC25 277.

Os modelos não fazem parte de nenhum app. Eles são baixados dos servidores da Apple pelo AssetInventory, armazenados e atualizados pelo sistema e compartilhados entre apps. Não acrescentam nada ao tamanho do download nem ao espaço de memória de um app, e a decodificação ocorre fora do processo que fez a chamada. Quando o SpeechTranscriber não tem um modelo para um idioma ou dispositivo, o DictationTranscriber assume com os mesmos modelos do ditado do sistema.

Como fizemos as medições

Todos os mecanismos deste post transcreveram os mesmos trechos, na mesma ordem e um por vez, em um M5 MacBook Air (32 GB, macOS 27.0). O áudio é o do conjunto de teste do Google FLEURS na revisão 70bb2e84, cerca de 150 frases e 30 minutos por idioma. Um hash fixo dos IDs dos itens do próprio conjunto de dados ordena os itens, e usamos a sequência mais curta de itens inteiros que ultrapassa trinta minutos; nenhum resultado dos modelos teve qualquer influência nessa escolha. Cada célula foi reconstruída a partir do respectivo recibo e verificada novamente, e todas as 285 passaram.

As pontuações são WER nos idiomas em que as palavras são separadas por espaços e CER para japonês, coreano, chinês e cantonês. O FLEURS é fala lida, não uma reunião nem um ditado. Estas tabelas dizem se um mecanismo é plausível para o seu idioma, não o que você vai obter nas suas próprias gravações.

Quanto melhora em relação ao antigo ditado da Apple?

A Apple oferece dois modos operacionais de transcrição e medimos ambos. O SpeechTranscriber é o novo, aquele a que este post chama Apple Speech. DictationTranscriber é o modo de compatibilidade, o caminho de ditado que um Mac tinha anteriormente.

Idioma Ditado da Apple Apple Speech
Coreano 7,11 4,31
Italiano 6,93 4,39
Espanhol (América Latina) 8,43 5,41
Alemão 12,69 6,26
Japonês 9,37 6,36
Francês 17,10 7,61
Chinês 10,28 7,97
Cantonês 10,18 8,69
Inglês 13,83 8,80
Português (Brasil) 10,85 9,35

Todos os idiomas que os dois modos operacionais da Apple mediram corretamente, ordenados pela taxa de erro do Apple Speech; o verde marca o melhor valor da linha. O mesmo teste, os mesmos trechos, o mesmo Mac. CER para japonês, coreano, chinês e cantonês, WER para os demais.

O Apple Speech é mais preciso nos dez idiomas. O idioma mediano perde cerca de um terço dos erros, o francês e o alemão mais da metade, e o português do Brasil e o cantonês cerca de um erro em cada sete.

Essa é uma comparação com o passado da própria Apple. Contra os modelos que você baixa, sua melhor posição em um idioma medido corretamente é o segundo lugar, no cantonês. O ditado cobre mais idiomas: 33 configurações contra 21 neste teste, incluindo os três que faltam aqui ao novo mecanismo.

Que vantagens oferece o mecanismo integrado?

Mecanismo Velocidade Pico de memória Download
SenseVoice Small 162,3× o tempo real 0,95 GiB 827 MB
Parakeet V3 75,6× o tempo real 0,09 GiB 465 MB
Apple Speech 30,8× o tempo real não indicado pacote de idioma baixado pelo macOS, não pelo app
Qwen3-ASR 1.7B 11,1× o tempo real 2,43 GiB cerca de 2,5 GB
Whisper Small 7,9× o tempo real 0,87 GiB 600 MB
Whisper Large V3 Turbo 3,0× o tempo real 1,87 GiB cerca de 1,6 GB

A velocidade é a mediana de cada mecanismo nos treze idiomas que este post mede corretamente, contando apenas aqueles em que ele rodou — vazão do processamento de itens isolados, um diagnóstico, não a latência do produto. O pico de memória é o máximo do grupo de processos neste teste. O Apple Speech decodifica dentro de um serviço do macOS que não pertence ao app que faz a chamada, então nenhum valor teria o mesmo significado que os dos outros cinco.

Os recursos de idioma do Apple Speech são baixados uma vez pelo sistema e compartilhados por todos os apps. Nada vem incluído no app e nada é alocado no processo do próprio app. O serviço do sistema ainda usa memória enquanto trabalha, mas não conseguimos atribuí-la com exatidão, então não informamos nenhum valor em vez de registrar zero. Ele rodou a 30,8× o tempo real, atrás do Parakeet V3 e do SenseVoice Small.

O Whisper Large V3 Turbo ganha quatro das dez linhas e é o mecanismo mais lento aqui, cerca de dez vezes mais lento que o Apple Speech, ocupando cerca de 1,6 GB no disco. O Qwen3-ASR 1.7B ganha as outras seis, com cerca de 2,5 GB e 2,43 GiB de memória. O Parakeet V3 ocupa 465 MB e 0,09 GiB, supera o Turbo em francês, fica atrás em polonês e não tem japonês, coreano, chinês nem cantonês. O Whisper Small é a comparação mais próxima, com 600 MB, e o Apple Speech foi mais preciso em oito dos dez idiomas que os dois mediram corretamente.

Você deve usar o Apple Speech em vez de um modelo baixado?

Idioma por idioma:

  • Inglês: não é uma boa opção. O Apple Speech marcou 8,80; Qwen3-ASR 1.7B (4,49) ou o Whisper Large V3 Turbo (5,49) é claramente mais preciso.
  • Alemão: não é uma boa opção. O Apple Speech marcou 6,26; Qwen3-ASR 1.7B (2,85) ou o Whisper Large V3 Turbo (4,05) é claramente mais preciso.
  • Holandês, russo e polonês: o Apple Speech não tem modelo para estes três idiomas. Whisper Large V3 Turbo foi o mais preciso em todos, com 5,69, 5,13 e 5,45.
  • Japonês: utilizável. O Apple Speech marcou 6,36, atrás do Whisper Large V3 Turbo com 5,30.
  • Coreano: utilizável. O Apple Speech marcou 4,31, atrás do Qwen3-ASR 1.7B com 3,54.
  • Francês: não é uma boa opção. O Apple Speech marcou 7,61; Qwen3-ASR 1.7B (4,57) ou o Parakeet V3 (5,83) é claramente mais preciso.
  • Chinês: utilizável. O Apple Speech marcou 7,97, empatado com o Whisper Large V3 Turbo; o mais preciso foi o Qwen3-ASR 1.7B com 6,49.
  • Espanhol: não é uma boa opção. O Apple Speech marcou 5,41; Qwen3-ASR 1.7B (3,38) ou o Whisper Large V3 Turbo (3,62) é claramente mais preciso.

Apple Speech é a abreviação usada neste post para o SpeechTranscriber da Apple, a API no dispositivo que qualquer app para Mac pode chamar no macOS 26 ou posterior. Ele não é um dos modelos que o Whisper Notes para Mac baixa: esses são o Whisper, o Parakeet V3, o SenseVoice e o Qwen3-ASR na versão Mac por download direto (DMG), e o Whisper, o Parakeet V3 e o SenseVoice no iPhone e na versão da Mac App Store. A tabela por mecanismo está na nossa página de suporte de idiomas.

Nada aqui altera o que o Whisper Notes para Mac faz atualmente: o Parakeet V3 continua sendo o modelo padrão.

Perguntas frequentes

O Apple Speech é tão preciso quanto o Whisper?

Não na maioria dos idiomas que os dois cobrem. No nosso teste FLEURS, entre os sete destes dez idiomas suportados pelo Apple Speech, o Whisper Large V3 Turbo foi mais preciso em seis e os dois empataram exatamente no chinês, com 7,97% de CER cada. Contra o Whisper Small, a ordem se inverte: o Apple Speech ficou na frente em seis dos sete e perdeu apenas no inglês, 8,80% contra 7,04% de WER. Ele não lidera nenhum idioma medido corretamente neste teste e chega mais perto no coreano, com 4,31% de CER contra 3,54% do líder da linha. O cantonês é o único idioma medido corretamente em que ele superou o Whisper Large V3 Turbo, 8,69% contra 36,75% de CER. Use o mecanismo integrado se ele cobrir o seu idioma e você preferir que o macOS gerencie o pacote de idioma; use o Whisper Large V3 Turbo para obter o resultado mais preciso ou se o seu idioma for um dos três que faltam aqui ao Apple Speech.

Que idiomas são suportados pelo Apple Speech?

A lista é decidida pelo macOS, não por um app. Neste teste, o Apple Speech produziu resultados em 21 das 83 configurações de idioma que testamos, contra 83 para as duas versões do Whisper, 30 para o Qwen3-ASR 1.7B e 25 para o Parakeet V3. Dos dez idiomas mais usados na tabela principal, ele tem inglês, alemão, japonês, coreano, francês, chinês e espanhol, mas não holandês, polonês ou russo. A segunda tabela contém as outras catorze configurações: italiano, cantonês, português do Brasil e onze idiomas em que ele respondeu em transliteração latina, não na escrita nativa. Um app precisa perguntar ao macOS em tempo de execução quais idiomas estão disponíveis em uma determinada máquina. Se o seu idioma não estiver disponível, o Whisper alcança todos os idiomas da lista do app em todos os canais.

Apple Speech ou Parakeet V3: qual escolher?

O Parakeet V3, em todos os idiomas europeus que os dois cobrem. Ele marcou 6,89 contra 8,80 no inglês, 5,83 contra 7,61 no francês, 4,86 contra 5,41 no espanhol, 3,43 contra 4,39 no italiano e 6,49 contra 9,35 no português do Brasil; os dois empatam no alemão com 6,26. O Parakeet V3 não tem japonês, coreano, chinês nem cantonês, então o Apple Speech é o único dos dois que existe nesses casos, a menos de 1,5 ponto do líder da linha no japonês, coreano e chinês. O Parakeet V3 exige um download de 465 MB e rodou a 75,6× o tempo real com um pico de 0,09 GiB; o pacote de idioma do Apple Speech é baixado pelo macOS, e ele rodou a 30,8× com uma memória que não informamos.

O que é o SpeechAnalyzer e é igual ao ditado da Apple?

O SpeechAnalyzer é a API abrangente que a Apple apresentou na WWDC 2025 e lançou no macOS 26 e no iOS 26. O SpeechTranscriber é o modo operacional de transcrição dentro dela, aquele que medimos e que este post chama de Apple Speech. O ditado é o modo de compatibilidade, e também o testamos: o Apple Speech foi mais preciso nos dez idiomas que os dois trataram corretamente, eliminando cerca de um terço dos erros no idioma mediano e mais da metade no francês e no alemão. O ditado cobre mais idiomas, 33 configurações contra 21, então é o mecanismo do sistema para holandês, polonês ou russo, se você puder aceitar 17,34%, 13,50% e 13,13% de WER. O Whisper Large V3 Turbo marcou 5,69%, 5,45% e 5,13% nos mesmos trechos.

O áudio sai do meu Mac quando eu uso o Apple Speech?

A Apple documenta o SpeechTranscriber como reconhecimento de voz no dispositivo: o macOS baixa os recursos de idioma uma vez, e o reconhecimento roda localmente. Medimos a precisão e a velocidade, não o comportamento da rede, então descrevemos essa parte como a Apple a descreve. Os mecanismos que o próprio Whisper Notes baixa — Whisper, Parakeet V3, SenseVoice e Qwen3-ASR — rodam na GPU ou no Neural Engine do seu Mac, sem conta e sem API key, e a transcrição funciona com a rede desligada em todos os canais.

Por que estes números não correspondem à precisão que eu obtenho nas minhas gravações?

Porque o FLEURS é fala lida, curta e limpa, e as suas gravações não são. O nosso teste é uma calibração em um conjunto de dados público: cerca de 150 frases e 30 minutos de áudio por idioma, um único M5 MacBook Air e os mesmos trechos para todos os mecanismos. Ele diz se um mecanismo é plausível para um idioma, não o que você vai obter em uma reunião, em áudio com ruído, em fala com sotaque ou em um arquivo de duas horas.

Por que outros benchmarks dizem que o Apple Speech supera o Whisper?

Porque comparam com o Whisper Small e só em inglês. Quanto ao Whisper Small, o nosso teste concorda: nos dez idiomas que os dois mediram corretamente, o Apple Speech ficou na frente em oito. O inglês é um dos dois em que perdeu, 8,80 contra 7,04. O resultado não passa para o Whisper Large V3 Turbo: aí o Apple Speech ficou atrás em oito desses dez idiomas, empatou no chinês em 7,97 e só liderou no cantonês. É o Whisper escolhido para a comparação que decide o título.

Experimente

Os cinco modelos disponíveis para baixar aqui — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small e Qwen3-ASR 1.7B — estão todos no Whisper Notes para Mac, versão por download direto (DMG), em Ajustes e depois Modelo de transcrição.

Se os nossos números não baterem com a sua experiência em um idioma, escreva para mac@whispernotes.app. Notas de versão completas: whispernotes.app/changelog.

Fontes: o nosso teste no conjunto de teste do Google FLEURS na revisão 70bb2e84, a documentação da Apple sobre o SpeechAnalyzer, e o teste do Qwen3-ASR em trinta idiomas que o antecedeu.