TL;DR — Três modelos no dispositivo comparados
| Parakeet V3 | SenseVoice Small | Whisper Large V3 Turbo | |
|---|---|---|---|
| 5 min de inglês | 2,91s (103×) | 5,8s (52×) | 20,92s (14,3×) |
| 27 min de chinês | 10,10s (161×) | 13,83s (118×) | 2 min 4s (13,1×) |
| Idiomas | 25 (europeus) | 5 (zh, en, ja, ko, yue) | 100+ |
| Download | 465 MB | 827 MB | ~1,6 GB |
| Memória | ~800 MB | ~700 MB | ~1,6 GB |
| Melhor para | Inglês & idiomas europeus | Chinês, japonês, coreano, cantonês | Todo o resto (100+ idiomas) |
* Benchmarks de velocidade em um Apple M4 Pro, 32 GB. Podcast de 5 minutos em inglês e podcast de 27 minutos em chinês. Fator de tempo real = duração do áudio ÷ tempo de processamento (quanto maior, mais rápido). Os benchmarks são da versão para Mac; o SenseVoice também está disponível no iPhone.
A partir da versão 1.5.0 (Direct Download / DMG), o Whisper Notes para Mac traz o SenseVoice Small como motor dedicado para transcrição em chinês, japonês, coreano e cantonês. Ele substitui o Qwen3-ASR e roda na GPU da Apple via MLX em vez da CPU — processando um podcast chinês de 27 minutos em 13,83 segundos em vez de 3 minutos e 44 segundos.
Por que substituímos o Qwen3-ASR
O Qwen3-ASR era um modelo sólido. Suportava 30 idiomas mais 22 dialetos chineses, e sua precisão para chinês estava próxima do estado da arte. Mas tinha um problema que piorava quanto mais longo era o áudio: a velocidade.
O Qwen3 usava uma arquitetura autorregressiva — a mesma abordagem do Whisper, processando o áudio quadro a quadro, sem nunca pular para a frente. Em um podcast chinês de 27 minutos, levava 224 segundos. Utilizável, mas não a experiência de resultado instantâneo que o Parakeet V3 oferece para o inglês.
O problema mais profundo era a nossa infraestrutura. Nossa integração do Qwen3 usava sherpa-onnx, uma biblioteca C com um wrapper Swift de 2.249 linhas que direcionava tudo para os núcleos da CPU. A GPU ficava ociosa enquanto a CPU do seu Mac fazia todo o trabalho.
O SenseVoice resolveu os dois problemas. Arquitetura não autorregressiva para velocidade. Apple MLX para aceleração via GPU. O resultado: uma melhoria de velocidade de 16,2× no mesmo hardware, com uma base de código reduzida de 2.249 linhas para 288.
O benchmark
Os três modelos rodando no mesmo Apple M4 Pro, mesmos arquivos de áudio, mesmas condições. Sem nuvem. Sem internet. Só silício.
| Modelo | 5 min de inglês | 27 min de chinês | Velocidade (RTFx) |
|---|---|---|---|
| Parakeet V3 | 2,91s | 10,10s | 103–161× |
| SenseVoice Small | 5,8s | 13,83s | 52–118× |
| Whisper Large V3 Turbo | 20,92s | 2 min 4s | 13–14× |
| Qwen3-ASR (removido) | — | 224s | 7,2× |
O SenseVoice tem cerca de metade da velocidade do Parakeet V3 — ainda assim, extraordinariamente rápido. Um podcast de 27 minutos fica pronto em menos de 14 segundos. Você aperta transcrever, espera uma respiração, e o texto já está lá.
Compare isso com o Whisper em 2 minutos e 4 segundos, ou o antigo Qwen3 em 3 minutos e 44 segundos. A arquitetura importa mais do que a quantidade de parâmetros.
Benchmark oficial de inferência do artigo FunAudioLLM: o SenseVoice-Small processa 10s de áudio em 70ms (GPU A800). O Whisper-Large-V3 leva 1.281ms. Uma diferença de 18× na latência bruta de inferência.
| Modelo | Tempo de carregamento | Memória | Tamanho do download |
|---|---|---|---|
| Parakeet V3 | 0,77s | ~800 MB | 465 MB |
| SenseVoice Small | 0,81s | ~700 MB | 827 MB |
| Whisper Small | 1,03s | ~487 MB | 600 MB |
| Whisper Large V3 Turbo | 3,18s | ~1,6 GB | ~1,6 GB |
* Tempo de carregamento e memória medidos em um Apple M4 Pro, 32 GB.
O SenseVoice carrega em menos de um segundo e usa menos memória do que o Parakeet. Em um Mac de 8 GB, ele roda tranquilamente junto com os seus outros aplicativos.
Por que o SenseVoice é mais rápido: arquitetura + runtime
A diferença de velocidade entre o Qwen3-ASR e o SenseVoice vem de dois fatores independentes.
Fator 1: Arquitetura do modelo. O Qwen3-ASR é autorregressivo — gera texto token por token, cada um dependendo do anterior. O SenseVoice usa um codificador não autorregressivo (NAR) que processa todo o áudio em paralelo. Essa diferença arquitetural, sozinha, torna o SenseVoice fundamentalmente mais rápido, não importa em qual hardware ele rode.
Fator 2: Runtime. Nossa integração do Qwen3-ASR usava sherpa-onnx, que rodava na CPU. O SenseVoice roda por meio do Apple MLX, direcionando a computação para a GPU. O Qwen3 também poderia rodar no MLX? Sim — mas ainda seria mais lento que o SenseVoice, porque o gargalo autorregressivo está na arquitetura, não no runtime.
| Qwen3-ASR (antigo) | SenseVoice (novo) | |
|---|---|---|
| Arquitetura | Autorregressiva (token por token) | Não autorregressiva (paralela) |
| Runtime | sherpa-onnx (CPU) | Apple MLX (GPU) |
| 27 min de chinês | 224 segundos | 13,83 segundos |
| Aceleração combinada | linha de base | 16,2× mais rápido |
| Base de código | Framework C de 168 MB + 2.249 linhas de Swift | 288 linhas de Swift Actor |
* Mesmo podcast chinês de 27 minutos, Apple M4 Pro. A aceleração de 16,2× combina melhorias de arquitetura (NAR vs AR) e de runtime (GPU vs CPU).
O código também ficou mais simples. A nova implementação do SenseVoice é um único Swift Actor de 288 linhas que conversa diretamente com o MLX, substituindo um framework C de 168 MB. Menos código, menos bugs, app menor.
Cinco idiomas, bem feitos
O SenseVoice não tenta fazer tudo. Ele cuida de cinco idiomas:
| Idioma | SenseVoice-Small | Whisper-Large-V3 | Vencedor |
|---|---|---|---|
| Chinês (zh-CN) | 10,78% CER | 12,55% CER | SenseVoice (-14%) |
| Cantonês (yue) | 7,09% CER | 10,41% CER | SenseVoice (-32%) |
| Japonês (ja) | 11,96% CER | 10,34% CER | Whisper (por pouco) |
| Coreano (ko) | 8,28% CER | 5,59% CER | Whisper |
| Inglês (en) | 14,71% WER | 9,39% WER | Whisper (use o Parakeet) |
* Benchmark CommonVoice, CER = taxa de erro por caractere, WER = taxa de erro por palavra. Menor é melhor. Fonte: artigo FunAudioLLM (2024). Latência de inferência do SenseVoice-Small: 70ms por 10s de áudio (GPU A800), mais de 15× mais rápido que o Whisper-Large-V3.
Benchmark CommonVoice: SenseVoice-Small (amarelo) vs Whisper-Small (azul) vs Whisper-Large-V3 (laranja). Menor é melhor. Fonte: artigo FunAudioLLM
Os números contam uma história honesta. O SenseVoice supera o Whisper em precisão para chinês e cantonês por uma margem significativa, enquanto o Whisper é mais preciso para japonês, coreano e inglês. Mas o SenseVoice é mais de 15× mais rápido que o Whisper-Large-V3. Na maioria dos usos do dia a dia, a diferença de velocidade importa mais do que alguns pontos percentuais de precisão.
O resultado do cantonês merece destaque à parte. O Whisper-Small marca 38,97% de CER em cantonês — quase inutilizável. Mesmo o Whisper-Large-V3 só alcança 10,41%. O SenseVoice atinge 7,09%. Antes do SenseVoice, não havia um bom jeito de transcrever cantonês localmente em um Mac. Se você fala cantonês, esse modelo existe para você.
Transcrição em coreano com o SenseVoice: importação de vídeo com legendas com marcação de tempo
Teste no mundo real: podcast chinês de 27 minutos
Transcrevemos um episódio de 27 minutos do Thirteen Invitations (十三邀), um podcast chinês de entrevistas, com o SenseVoice e o Whisper Large V3 Turbo no mesmo M4 Pro. O ElevenLabs Scribe (nuvem) serviu como referência. Os dois modelos locais cometem aproximadamente o mesmo número de erros, mas de tipos diferentes:
| SenseVoice | Whisper Large V3 | |
|---|---|---|
| Tempo | 13,83s | 2 min 4s |
| Erros (amostra de 5 min) | ~15–20 | ~12–15 |
| Pior erro | 时差→食堂 (fuso horário→refeitório) | 西昌→西藏 (cidade de Xichang→Tibete, 4.000 km de distância) |
| Padrão de erros | Trocas de homófonos | Erros geográficos/factuais |
* Comparação manual contra o ElevenLabs Scribe (referência na nuvem, também imperfeita). Os dois modelos locais escreveram corretamente "根深蒂固" onde o Scribe errou.
Precisão comparável. 9× mais rápido. Para transcrição de chinês no mundo real, o SenseVoice te entrega uma transcrição utilizável antes de o Whisper terminar de carregar.
Quando usar cada modelo
O Whisper Notes para Mac agora traz quatro modelos de fala. Cada um é otimizado para cenários diferentes:
| Você precisa de... | Use este modelo | Por quê |
|---|---|---|
| Inglês ou idiomas europeus, velocidade máxima | Parakeet V3 | 103× tempo real, menor taxa de erro. O padrão. |
| Chinês, japonês, coreano ou cantonês | SenseVoice Small | 52–118× tempo real. Único modelo com suporte a cantonês. |
| Qualquer um dos 100+ idiomas (árabe, tailandês, russo etc.) | Whisper Large V3 Turbo | Suporte mais amplo a idiomas. Mais lento, mas universal. |
| Menor uso de memória (Macs mais antigos) | Whisper Small | 487 MB de memória. Bom para Macs de 8 GB rodando outros apps. |
Configurações → Modelo de transcrição: escolha o motor certo para o seu idioma
O seletor de modelos nas Configurações mostra as quatro opções com tamanhos de download, número de idiomas e requisitos de memória. O SenseVoice é baixado no primeiro uso (~827 MB) e fica no seu dispositivo.
Os compromissos
O SenseVoice não é um modelo universal. Eis o que ele não consegue fazer:
• Só 5 idiomas. Se você precisa de tailandês, russo, árabe, hindi ou outro idioma fora do foco CJK do SenseVoice, fique com o Whisper.
• Atualização: o SenseVoice foi lançado inicialmente só para Mac via Apple MLX, mas agora também está disponível no iPhone — o iOS suporta a mesma linha de modelos do Mac: Parakeet V3, Whisper e SenseVoice.
• Peculiaridade com áudio baixo. Em trechos muito curtos ou muito silenciosos, o SenseVoice pode às vezes cair para saída em chinês, independentemente do idioma selecionado. Definir o idioma manualmente (em vez de "Auto") reduz isso.
• Sem streaming. Diferentemente do modo de streaming do Whisper, o SenseVoice processa o áudio completo depois da gravação. Para arquivos longos, ele segmenta automaticamente nos pontos de silêncio e mostra os resultados progressivamente.
Essas são restrições de arquitetura, não bugs. Um modelo treinado em 5 idiomas faz esses 5 idiomas extremamente bem. A cobertura de mais de 100 idiomas do Whisper vem com velocidade menor e precisão desigual entre os idiomas.
Comparando todas as opções locais? Todos os modelos de fala para texto no dispositivo — as variantes do Whisper, o Parakeet V3, o SenseVoice e o Voxtral — estão comparados lado a lado na nossa página de comparação de modelos Whisper. Primeiro contato com o Whisper? Comece pelo Guia de Transcrição com Whisper — o que é o modelo, todas as formas de rodá-lo e quanto custa.
Perguntas frequentes
Qual é a alternativa mais rápida ao Whisper para transcrição de chinês, japonês e coreano?
O SenseVoice Small está disponível no Whisper Notes tanto no Mac quanto no iPhone. No nosso teste no Mac com um M4 Pro, ele transcreveu um podcast chinês de 27 minutos em 13,83 segundos (52–118× tempo real), enquanto o Whisper Large V3 Turbo levou mais de 2 minutos com o mesmo arquivo.
O SenseVoice é melhor que o Whisper para chinês?
Para chinês e cantonês, sim. No benchmark CommonVoice, o SenseVoice marca 10,78% de CER em chinês contra 12,55% do Whisper-Large-V3, e é mais de 15× mais rápido. O Whisper continua um pouco mais preciso para japonês e coreano.
Posso transcrever cantonês localmente em um Mac?
Sim. O SenseVoice marca 7,09% de CER em cantonês, contra 10,41% do Whisper-Large-V3 e uns quase inutilizáveis 38,97% do Whisper-Small. Antes do SenseVoice, não havia um bom jeito de transcrever cantonês localmente em um Mac.
O SenseVoice funciona no iPhone?
Sim. O Whisper Notes no iPhone suporta a mesma linha de modelos do Mac — Parakeet V3, Whisper e SenseVoice — então você também pode transcrever chinês, japonês, coreano e cantonês localmente no seu iPhone.
Experimente
O SenseVoice está disponível no Whisper Notes para Mac v1.5.0 (Direct Download / DMG) e posteriores, e no app atual para iPhone. No Mac, baixe-o em Configurações → Modelo de transcrição → SenseVoice Small (~827 MB). A versão para Mac exige Apple Silicon (M1 ou posterior).
Se você usa o Parakeet V3 e dita principalmente em inglês, não precisa trocar. O SenseVoice é para quando você precisa de chinês, japonês, coreano ou cantonês — e quer rapidez.
Changelog completo: whispernotes.app/changelog
Dúvidas ou feedback: mac@whispernotes.app