Desde o macOS 26 e o iOS 26, a Apple disponibiliza uma nova geração de reconhecimento de voz no dispositivo — SpeechAnalyzer e SpeechTranscriber, abaixo designados abreviadamente por Apple Speech. É claramente mais precisa do que o antigo motor de ditado. Por isso, quisemos saber: o reconhecimento de voz integrado da Apple já é suficientemente bom para dispensar por completo uma app de transcrição? E a que distância fica dos modelos abertos no dispositivo disponíveis no Whisper Notes — Whisper, Parakeet, SenseVoice e Qwen3-ASR? Fizemos um teste rigoroso. Estes são os resultados. Nas dez línguas que testámos, o Apple Speech nunca teve a taxa de erro mais baixa, ficou a menos de 1,5 pontos do primeiro em coreano, japonês e chinês e não tem qualquer modelo para neerlandês, russo ou polaco.
A que distância fica o Apple Speech dos modelos que transfere?
| Língua | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Inglês | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Alemão | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Neerlandês | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Russo | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Polaco | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Japonês | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Coreano | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Francês | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Chinês | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Espanhol (América Latina) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Dez das línguas mais utilizadas, um motor por coluna. Cada célula mostra a taxa de erro desse motor: mais baixo é melhor; o verde assinala o valor mais baixo da linha e o branco o segundo mais baixo. CER para japonês, coreano e chinês, WER para as restantes, nunca combinados num único número. O nosso teste FLEURS, realizado pela equipa do Whisper Notes, num único M5 MacBook Air, fala lida.
Nomes abreviados: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Um travessão significa que o motor não tem modelo para essa língua.
O Qwen3-ASR 1.7B tem a taxa de erro mais baixa em seis das dez línguas e o Whisper Large V3 Turbo nas outras quatro. O Apple Speech fica 0,77 pontos atrás do primeiro da linha em coreano, 1,06 em japonês e 1,48 em chinês, onde empata com o Whisper Large V3 Turbo nos 7,97. Nas sete línguas que suporta, fica entre 0,8 e 4,3 pontos atrás do primeiro da linha; a maior distância surge no inglês, 8,80 contra 4,49. Não há resultado do Apple Speech para neerlandês, polaco ou russo.
Que línguas são suportadas pelo Apple Speech?
O Apple Speech devolveu resultados para 21 das 83 configurações linguísticas deste teste. Ambos os modelos Whisper cobrem as 83, o Qwen3-ASR 1.7B cobre 30 e o Parakeet V3 25. Das dez línguas acima, não tem modelo para neerlandês, polaco ou russo. Não existe uma lista fixa que se possa citar: os recursos linguísticos pertencem ao macOS, pelo que uma app pergunta em tempo de execução o que está disponível em cada máquina.
| Língua | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Italiano | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Cantonês | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Português (Brasil) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Hindi | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Telugu | 101,63 | — | 81,74 | 103,19 | — | — |
| Urdu | 101,69 | — | 23,39 | 38,83 | — | — |
| Punjabi | 101,75 | — | 92,05 | 103,40 | — | — |
| Bengali | 102,00 | — | 83,52 | 117,37 | — | — |
| Nepalês | 102,13 | — | 88,59 | 118,84 | — | — |
| Malaiala | 102,18 | — | 107,34 | 167,16 | — | — |
| Marata | 102,23 | — | 82,69 | 109,95 | — | — |
| Canarês | 103,83 | — | 72,07 | 116,10 | — | — |
| Guzerate | 104,52 | — | 75,31 | 108,91 | — | — |
| Tâmil | 113,01 | — | 71,28 | 79,77 | — | — |
As outras catorze línguas para as quais o Apple Speech devolveu um resultado, ordenadas pela sua própria taxa de erro. As mesmas colunas, cores e abreviaturas acima; CER para cantonês, WER para as restantes. Uma taxa de erro pode ultrapassar 100% porque as inserções também contam no numerador.
Nas últimas onze linhas, do hindi ao tâmil, o Apple Speech respondeu em transliteração latina em vez da escrita nativa. A sua taxa de erro mede, portanto, uma incompatibilidade de escrita, e não a precisão do reconhecimento, e essas células ficam fora da classificação da linha; os valores dos outros motores nessas linhas são medições normais.
Como funciona o SpeechAnalyzer
A Apple tem uma API de reconhecimento de voz desde o iOS 10. Essa API, SFSpeechRecognizer, é o motor por detrás do antigo caminho de ditado. O SpeechAnalyzer substitui-a: foi introduzido no macOS 26 e no iOS 26 e está disponível em todas as plataformas Apple, exceto no watchOS.
A API está organizada em torno de uma sessão. Cria-se um SpeechAnalyzer, atribuem-se-lhe um ou mais módulos e fornece-se o áudio; o SpeechTranscriber é o módulo que transforma fala em texto. O áudio entra como uma sequência assíncrona preenchida pela própria app, os resultados regressam como uma segunda sequência e as duas costumam correr em tarefas diferentes. O analisador aceita uma sequência de entrada de cada vez. Cada buffer e cada resultado têm um código de tempo relativo à timeline do próprio áudio, para que um resultado possa ser recolocado no ponto de origem.
Uma sessão, três tarefas: o áudio entra como AsyncSequence, o SpeechAnalyzer e o SpeechTranscriber analisam-no e os resultados regressam como uma segunda AsyncSequence que a interface pode ler. Fonte: Apple, sessão WWDC25 277.
Os resultados chegam duas vezes. Tudo o que estiver dentro daquilo a que a Apple chama intervalo volátil ainda pode ser substituído por um resultado melhor; tudo o que estiver fora é definitivo. É assim que uma app mostra uma transcrição provisória enquanto ainda se fala e a corrige depois.
A Apple indica cinco objetivos de conceção para o modelo SpeechTranscriber: áudio longo, fala conversacional, oradores distantes, baixa latência e privacidade, o que significa que corre no dispositivo. As apps Notas, Dictafone e Diário, bem como o resumo de chamadas, assentam neste modelo.
Os cinco objetivos de conceção declarados pela Apple para o modelo SpeechTranscriber. Fonte: Apple, sessão WWDC25 277.
Os modelos não fazem parte de nenhuma app. São transferidos dos servidores da Apple através do AssetInventory, guardados e atualizados pelo sistema e partilhados entre apps. Não acrescentam nada ao tamanho de transferência de uma app nem ao seu espaço de memória, e a descodificação ocorre fora do processo que faz a chamada. Quando o SpeechTranscriber não tem um modelo para uma língua ou dispositivo, o DictationTranscriber assume o controlo com os mesmos modelos do ditado do sistema.
Como fizemos as medições
Todos os motores deste artigo transcreveram os mesmos excertos, pela mesma ordem e um de cada vez, num M5 MacBook Air (32 GB, macOS 27.0). O áudio é o do conjunto de teste do Google FLEURS na revisão 70bb2e84, cerca de 150 frases e 30 minutos por língua. Um hash fixo dos IDs dos elementos do próprio conjunto de dados ordena os elementos, e usamos a sequência mais curta de elementos inteiros que ultrapassa trinta minutos; nenhum resultado dos modelos teve qualquer influência nessa escolha. Cada célula foi reconstruída a partir do respetivo recibo e verificada novamente, e todas as 285 passaram.
As pontuações são WER nas línguas em que as palavras são separadas por espaços e CER para japonês, coreano, chinês e cantonês. O FLEURS é fala lida, não uma reunião nem um ditado. Estas tabelas dizem se um motor é plausível para a sua língua, não o que obterá nas suas próprias gravações.
Quanto melhora em relação ao antigo ditado da Apple?
A Apple disponibiliza dois modos operacionais de transcrição e medimos ambos. O SpeechTranscriber é o novo, aquele a que este artigo chama Apple Speech. DictationTranscriber é o modo de compatibilidade, o caminho de ditado que um Mac tinha anteriormente.
| Língua | Ditado da Apple | Apple Speech |
|---|---|---|
| Coreano | 7,11 | 4,31 |
| Italiano | 6,93 | 4,39 |
| Espanhol (América Latina) | 8,43 | 5,41 |
| Alemão | 12,69 | 6,26 |
| Japonês | 9,37 | 6,36 |
| Francês | 17,10 | 7,61 |
| Chinês | 10,28 | 7,97 |
| Cantonês | 10,18 | 8,69 |
| Inglês | 13,83 | 8,80 |
| Português (Brasil) | 10,85 | 9,35 |
Todas as línguas que os dois modos operacionais da Apple mediram corretamente, ordenadas pela taxa de erro do Apple Speech; o verde assinala o melhor valor da linha. O mesmo teste, os mesmos excertos, o mesmo Mac. CER para japonês, coreano, chinês e cantonês, WER para as restantes.
O Apple Speech é mais preciso nas dez línguas. A língua mediana perde cerca de um terço dos erros, o francês e o alemão mais de metade, e o português do Brasil e o cantonês cerca de um erro em cada sete.
Esta é uma comparação com o passado da própria Apple. Face aos modelos que se transferem, a sua melhor posição numa língua medida corretamente é o segundo lugar, no cantonês. O ditado abrange mais línguas: 33 configurações contra 21 neste teste, incluindo as três que faltam aqui ao novo motor.
Que vantagens oferece o motor integrado?
| Motor | Velocidade | Pico de memória | Transferência |
|---|---|---|---|
| SenseVoice Small | 162,3× o tempo real | 0,95 GiB | 827 MB |
| Parakeet V3 | 75,6× o tempo real | 0,09 GiB | 465 MB |
| Apple Speech | 30,8× o tempo real | não indicado | pacote de língua transferido pelo macOS, não pela app |
| Qwen3-ASR 1.7B | 11,1× o tempo real | 2,43 GiB | cerca de 2,5 GB |
| Whisper Small | 7,9× o tempo real | 0,87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3,0× o tempo real | 1,87 GiB | cerca de 1,6 GB |
A velocidade é a mediana de cada motor nas treze línguas que este artigo mede corretamente, contando apenas aquelas em que correu — débito de processamento de elementos isolados, um diagnóstico, não a latência do produto. O pico de memória é o máximo do grupo de processos neste teste. O Apple Speech descodifica dentro de um serviço do macOS que não pertence à app que o chama, pelo que nenhum valor seria equivalente aos dos outros cinco.
Os recursos linguísticos do Apple Speech são transferidos uma vez pelo sistema e partilhados por todas as apps. Nada vem incluído na app e nada é alocado no processo da própria app. O serviço do sistema continua a usar memória enquanto trabalha, mas não conseguimos atribuí-la com exatidão, pelo que não indicamos nenhum valor em vez de um zero. Correu a 30,8× o tempo real, atrás do Parakeet V3 e do SenseVoice Small.
O Whisper Large V3 Turbo ganha quatro das dez linhas e é o motor mais lento aqui, cerca de dez vezes mais lento do que o Apple Speech, ocupando cerca de 1,6 GB no disco. O Qwen3-ASR 1.7B ganha as outras seis, com cerca de 2,5 GB e 2,43 GiB de memória. O Parakeet V3 ocupa 465 MB e 0,09 GiB, supera o Turbo em francês, fica atrás em polaco e não tem japonês, coreano, chinês nem cantonês. O Whisper Small é a comparação mais próxima, com 600 MB, e o Apple Speech foi mais preciso em oito das dez línguas que ambos mediram corretamente.
Deve usar o Apple Speech em vez de um modelo transferido?
Língua por língua:
- Inglês: não é uma boa opção. O Apple Speech obteve 8,80; Qwen3-ASR 1.7B (4,49) ou o Whisper Large V3 Turbo (5,49) é claramente mais preciso.
- Alemão: não é uma boa opção. O Apple Speech obteve 6,26; Qwen3-ASR 1.7B (2,85) ou o Whisper Large V3 Turbo (4,05) é claramente mais preciso.
- Neerlandês, russo e polaco: o Apple Speech não tem modelo para estas três línguas. Whisper Large V3 Turbo foi o mais preciso em todas, com 5,69, 5,13 e 5,45.
- Japonês: utilizável. O Apple Speech obteve 6,36, atrás do Whisper Large V3 Turbo com 5,30.
- Coreano: utilizável. O Apple Speech obteve 4,31, atrás do Qwen3-ASR 1.7B com 3,54.
- Francês: não é uma boa opção. O Apple Speech obteve 7,61; Qwen3-ASR 1.7B (4,57) ou o Parakeet V3 (5,83) é claramente mais preciso.
- Chinês: utilizável. O Apple Speech obteve 7,97, empatado com o Whisper Large V3 Turbo; o mais preciso foi o Qwen3-ASR 1.7B com 6,49.
- Espanhol: não é uma boa opção. O Apple Speech obteve 5,41; Qwen3-ASR 1.7B (3,38) ou o Whisper Large V3 Turbo (3,62) é claramente mais preciso.
Apple Speech é a abreviatura usada neste artigo para o SpeechTranscriber da Apple, a API no dispositivo que qualquer app para Mac pode chamar no macOS 26 ou posterior. Não é um dos modelos que o Whisper Notes para Mac transfere: esses são o Whisper, o Parakeet V3, o SenseVoice e o Qwen3-ASR na versão Mac por transferência direta (DMG), e o Whisper, o Parakeet V3 e o SenseVoice no iPhone e na versão da Mac App Store. A tabela por motor está na nossa página de suporte de línguas.
Nada aqui altera o que o Whisper Notes para Mac faz atualmente: o Parakeet V3 continua a ser o modelo predefinido.
Perguntas frequentes
O Apple Speech é tão preciso como o Whisper?
Não na maioria das línguas que ambos cobrem. No nosso teste FLEURS, entre as sete destas dez línguas suportadas pelo Apple Speech, o Whisper Large V3 Turbo foi mais preciso em seis e os dois empataram exatamente no chinês, com 7,97% de CER cada. Face ao Whisper Small, a ordem inverte-se: o Apple Speech ficou à frente em seis das sete e perdeu apenas no inglês, 8,80% contra 7,04% de WER. Não lidera nenhuma língua medida corretamente neste teste e aproxima-se mais no coreano, com 4,31% de CER contra 3,54% do primeiro da linha. O cantonês é a única língua medida corretamente em que superou o Whisper Large V3 Turbo, 8,69% contra 36,75% de CER. Use o motor integrado se este cobrir a sua língua e preferir que o macOS faça a gestão do pacote de língua; use o Whisper Large V3 Turbo para o resultado mais preciso ou se a sua língua for uma das três que faltam aqui ao Apple Speech.
Que línguas são suportadas pelo Apple Speech?
A lista é decidida pelo macOS, não por uma app. Neste teste, o Apple Speech produziu resultados em 21 das 83 configurações linguísticas que testámos, contra 83 para ambas as versões do Whisper, 30 para o Qwen3-ASR 1.7B e 25 para o Parakeet V3. Das dez línguas mais utilizadas na tabela principal, tem inglês, alemão, japonês, coreano, francês, chinês e espanhol, mas não neerlandês, polaco ou russo. A segunda tabela contém as outras catorze configurações: italiano, cantonês, português do Brasil e onze línguas em que respondeu em transliteração latina, e não na escrita nativa. Uma app tem de perguntar ao macOS em tempo de execução quais são as línguas disponíveis numa determinada máquina. Se a sua língua não estiver disponível, o Whisper chega a todas as línguas da lista da app em todos os canais.
Apple Speech ou Parakeet V3: qual escolher?
O Parakeet V3, em todas as línguas europeias que ambos cobrem. Obteve 6,89 contra 8,80 no inglês, 5,83 contra 7,61 no francês, 4,86 contra 5,41 no espanhol, 3,43 contra 4,39 no italiano e 6,49 contra 9,35 no português do Brasil; os dois empatam no alemão com 6,26. O Parakeet V3 não tem japonês, coreano, chinês nem cantonês, pelo que o Apple Speech é o único dos dois que existe aí, a menos de 1,5 pontos do primeiro da linha no japonês, coreano e chinês. O Parakeet V3 exige uma transferência de 465 MB e correu a 75,6× o tempo real com um pico de 0,09 GiB; o pacote de língua do Apple Speech é transferido pelo macOS, e correu a 30,8× com uma memória que não indicamos.
O que é o SpeechAnalyzer e é igual ao ditado da Apple?
O SpeechAnalyzer é a API abrangente que a Apple apresentou na WWDC 2025 e disponibilizou no macOS 26 e no iOS 26. O SpeechTranscriber é o modo operacional de transcrição no seu interior, aquele que medimos e a que este artigo chama Apple Speech. O ditado é o modo de compatibilidade, e também o testámos: o Apple Speech foi mais preciso nas dez línguas que ambos trataram corretamente, eliminando cerca de um terço dos erros na língua mediana e mais de metade no francês e no alemão. O ditado abrange mais línguas, 33 configurações contra 21, pelo que é o motor do sistema para neerlandês, polaco ou russo se forem aceitáveis 17,34%, 13,50% e 13,13% de WER. O Whisper Large V3 Turbo obteve 5,69%, 5,45% e 5,13% nos mesmos excertos.
O áudio sai do meu Mac quando uso o Apple Speech?
A Apple documenta o SpeechTranscriber como reconhecimento de voz no dispositivo: o macOS transfere os recursos linguísticos uma vez e o reconhecimento corre localmente. Medimos a precisão e a velocidade, não o comportamento da rede, pelo que descrevemos essa parte como a Apple a descreve. Os motores que o próprio Whisper Notes transfere — Whisper, Parakeet V3, SenseVoice e Qwen3-ASR — correm na GPU ou no Neural Engine do seu Mac, sem conta e sem API key, e a transcrição funciona com a rede desligada em todos os canais.
Porque é que estes números não correspondem à precisão que obtenho nas minhas gravações?
Porque o FLEURS é fala lida, curta e limpa, e as suas gravações não são. O nosso teste é uma calibração num conjunto de dados público: cerca de 150 frases e 30 minutos de áudio por língua, um único M5 MacBook Air e os mesmos excertos para todos os motores. Diz se um motor é plausível para uma língua, não o que obterá numa reunião, em áudio com ruído, em fala com sotaque ou num ficheiro de duas horas.
Porque é que outros benchmarks dizem que o Apple Speech supera o Whisper?
Porque comparam com o Whisper Small e apenas em inglês. Quanto ao Whisper Small, o nosso teste concorda: nas dez línguas que ambos mediram corretamente, o Apple Speech ficou à frente em oito. O inglês é uma das duas em que perdeu, 8,80 contra 7,04. O resultado não passa para o Whisper Large V3 Turbo: aí o Apple Speech ficou atrás em oito dessas dez línguas, empatou no chinês nos 7,97 e só liderou no cantonês. É o Whisper escolhido para a comparação que decide o título.
Experimente
Os cinco modelos transferíveis aqui — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small e Qwen3-ASR 1.7B — estão todos no Whisper Notes para Mac, versão por transferência direta (DMG), em Definições e depois Modelo de transcrição.
Se os nossos números não corresponderem à sua experiência numa língua, escreva para mac@whispernotes.app. Notas de versão completas: whispernotes.app/changelog.
Fontes: o nosso teste no conjunto de teste do Google FLEURS na revisão 70bb2e84, a documentação da Apple sobre o SpeechAnalyzer, e o teste do Qwen3-ASR em trinta línguas que o antecedeu.