SenseVoice: Transcrição 52× mais rápida para chinês, japonês e coreano no Mac

12 de maio de 2026
·
7 min read
·Whisper Notes Team

TL;DR — Três modelos no dispositivo comparados

Parakeet V3 SenseVoice Small Whisper Large V3 Turbo
5 min de inglês 2,91s (103×) 5,8s (52×) 20,92s (14,3×)
27 min de chinês 10,10s (161×) 13,83s (118×) 2 min 4s (13,1×)
Idiomas 25 (europeus) 5 (zh, en, ja, ko, yue) 100+
Download 465 MB 827 MB ~1,6 GB
Memória ~800 MB ~700 MB ~1,6 GB
Melhor para Inglês & idiomas europeus Chinês, japonês, coreano, cantonês Todo o resto (100+ idiomas)

* Benchmarks de velocidade em um Apple M4 Pro, 32 GB. Podcast de 5 minutos em inglês e podcast de 27 minutos em chinês. Fator de tempo real = duração do áudio ÷ tempo de processamento (quanto maior, mais rápido). Os benchmarks são da versão para Mac; o SenseVoice também está disponível no iPhone.

A partir da versão 1.5.0 (Direct Download / DMG), o Whisper Notes para Mac traz o SenseVoice Small como motor dedicado para transcrição em chinês, japonês, coreano e cantonês. Ele substitui o Qwen3-ASR e roda na GPU da Apple via MLX em vez da CPU — processando um podcast chinês de 27 minutos em 13,83 segundos em vez de 3 minutos e 44 segundos.

Por que substituímos o Qwen3-ASR

O Qwen3-ASR era um modelo sólido. Suportava 30 idiomas mais 22 dialetos chineses, e sua precisão para chinês estava próxima do estado da arte. Mas tinha um problema que piorava quanto mais longo era o áudio: a velocidade.

O Qwen3 usava uma arquitetura autorregressiva — a mesma abordagem do Whisper, processando o áudio quadro a quadro, sem nunca pular para a frente. Em um podcast chinês de 27 minutos, levava 224 segundos. Utilizável, mas não a experiência de resultado instantâneo que o Parakeet V3 oferece para o inglês.

O problema mais profundo era a nossa infraestrutura. Nossa integração do Qwen3 usava sherpa-onnx, uma biblioteca C com um wrapper Swift de 2.249 linhas que direcionava tudo para os núcleos da CPU. A GPU ficava ociosa enquanto a CPU do seu Mac fazia todo o trabalho.

O SenseVoice resolveu os dois problemas. Arquitetura não autorregressiva para velocidade. Apple MLX para aceleração via GPU. O resultado: uma melhoria de velocidade de 16,2× no mesmo hardware, com uma base de código reduzida de 2.249 linhas para 288.

O benchmark

Os três modelos rodando no mesmo Apple M4 Pro, mesmos arquivos de áudio, mesmas condições. Sem nuvem. Sem internet. Só silício.

Modelo 5 min de inglês 27 min de chinês Velocidade (RTFx)
Parakeet V3 2,91s 10,10s 103–161×
SenseVoice Small 5,8s 13,83s 52–118×
Whisper Large V3 Turbo 20,92s 2 min 4s 13–14×
Qwen3-ASR (removido) 224s 7,2×

O SenseVoice tem cerca de metade da velocidade do Parakeet V3 — ainda assim, extraordinariamente rápido. Um podcast de 27 minutos fica pronto em menos de 14 segundos. Você aperta transcrever, espera uma respiração, e o texto já está lá.

Compare isso com o Whisper em 2 minutos e 4 segundos, ou o antigo Qwen3 em 3 minutos e 44 segundos. A arquitetura importa mais do que a quantidade de parâmetros.

Tabela oficial de comparação de velocidade de inferência do artigo FunAudioLLM: SenseVoice-Small (70ms por 10s de áudio) vs Whisper-Small (518ms) vs Whisper-Large-V3 (1281ms) - mostrando arquitetura do modelo, parâmetros, idiomas suportados, RTF e latência

Benchmark oficial de inferência do artigo FunAudioLLM: o SenseVoice-Small processa 10s de áudio em 70ms (GPU A800). O Whisper-Large-V3 leva 1.281ms. Uma diferença de 18× na latência bruta de inferência.

Modelo Tempo de carregamento Memória Tamanho do download
Parakeet V3 0,77s ~800 MB 465 MB
SenseVoice Small 0,81s ~700 MB 827 MB
Whisper Small 1,03s ~487 MB 600 MB
Whisper Large V3 Turbo 3,18s ~1,6 GB ~1,6 GB

* Tempo de carregamento e memória medidos em um Apple M4 Pro, 32 GB.

O SenseVoice carrega em menos de um segundo e usa menos memória do que o Parakeet. Em um Mac de 8 GB, ele roda tranquilamente junto com os seus outros aplicativos.

Por que o SenseVoice é mais rápido: arquitetura + runtime

A diferença de velocidade entre o Qwen3-ASR e o SenseVoice vem de dois fatores independentes.

Fator 1: Arquitetura do modelo. O Qwen3-ASR é autorregressivo — gera texto token por token, cada um dependendo do anterior. O SenseVoice usa um codificador não autorregressivo (NAR) que processa todo o áudio em paralelo. Essa diferença arquitetural, sozinha, torna o SenseVoice fundamentalmente mais rápido, não importa em qual hardware ele rode.

Fator 2: Runtime. Nossa integração do Qwen3-ASR usava sherpa-onnx, que rodava na CPU. O SenseVoice roda por meio do Apple MLX, direcionando a computação para a GPU. O Qwen3 também poderia rodar no MLX? Sim — mas ainda seria mais lento que o SenseVoice, porque o gargalo autorregressivo está na arquitetura, não no runtime.

Qwen3-ASR (antigo) SenseVoice (novo)
Arquitetura Autorregressiva (token por token) Não autorregressiva (paralela)
Runtime sherpa-onnx (CPU) Apple MLX (GPU)
27 min de chinês 224 segundos 13,83 segundos
Aceleração combinada linha de base 16,2× mais rápido
Base de código Framework C de 168 MB + 2.249 linhas de Swift 288 linhas de Swift Actor

* Mesmo podcast chinês de 27 minutos, Apple M4 Pro. A aceleração de 16,2× combina melhorias de arquitetura (NAR vs AR) e de runtime (GPU vs CPU).

O código também ficou mais simples. A nova implementação do SenseVoice é um único Swift Actor de 288 linhas que conversa diretamente com o MLX, substituindo um framework C de 168 MB. Menos código, menos bugs, app menor.

Cinco idiomas, bem feitos

O SenseVoice não tenta fazer tudo. Ele cuida de cinco idiomas:

Idioma SenseVoice-Small Whisper-Large-V3 Vencedor
Chinês (zh-CN) 10,78% CER 12,55% CER SenseVoice (-14%)
Cantonês (yue) 7,09% CER 10,41% CER SenseVoice (-32%)
Japonês (ja) 11,96% CER 10,34% CER Whisper (por pouco)
Coreano (ko) 8,28% CER 5,59% CER Whisper
Inglês (en) 14,71% WER 9,39% WER Whisper (use o Parakeet)

* Benchmark CommonVoice, CER = taxa de erro por caractere, WER = taxa de erro por palavra. Menor é melhor. Fonte: artigo FunAudioLLM (2024). Latência de inferência do SenseVoice-Small: 70ms por 10s de áudio (GPU A800), mais de 15× mais rápido que o Whisper-Large-V3.

Comparação de precisão SenseVoice vs Whisper no benchmark CommonVoice para chinês, cantonês, inglês, japonês, coreano e 25 outros idiomas - gráfico de barras WER/CER

Benchmark CommonVoice: SenseVoice-Small (amarelo) vs Whisper-Small (azul) vs Whisper-Large-V3 (laranja). Menor é melhor. Fonte: artigo FunAudioLLM

Os números contam uma história honesta. O SenseVoice supera o Whisper em precisão para chinês e cantonês por uma margem significativa, enquanto o Whisper é mais preciso para japonês, coreano e inglês. Mas o SenseVoice é mais de 15× mais rápido que o Whisper-Large-V3. Na maioria dos usos do dia a dia, a diferença de velocidade importa mais do que alguns pontos percentuais de precisão.

O resultado do cantonês merece destaque à parte. O Whisper-Small marca 38,97% de CER em cantonês — quase inutilizável. Mesmo o Whisper-Large-V3 só alcança 10,41%. O SenseVoice atinge 7,09%. Antes do SenseVoice, não havia um bom jeito de transcrever cantonês localmente em um Mac. Se você fala cantonês, esse modelo existe para você.

Resultado de transcrição em coreano com SenseVoice no Whisper Notes para Mac mostrando texto coreano preciso de um vídeo

Transcrição em coreano com o SenseVoice: importação de vídeo com legendas com marcação de tempo

Teste no mundo real: podcast chinês de 27 minutos

Transcrevemos um episódio de 27 minutos do Thirteen Invitations (十三邀), um podcast chinês de entrevistas, com o SenseVoice e o Whisper Large V3 Turbo no mesmo M4 Pro. O ElevenLabs Scribe (nuvem) serviu como referência. Os dois modelos locais cometem aproximadamente o mesmo número de erros, mas de tipos diferentes:

SenseVoice Whisper Large V3
Tempo 13,83s 2 min 4s
Erros (amostra de 5 min) ~15–20 ~12–15
Pior erro 时差→食堂 (fuso horário→refeitório) 西昌→西藏 (cidade de Xichang→Tibete, 4.000 km de distância)
Padrão de erros Trocas de homófonos Erros geográficos/factuais

* Comparação manual contra o ElevenLabs Scribe (referência na nuvem, também imperfeita). Os dois modelos locais escreveram corretamente "根深蒂固" onde o Scribe errou.

Precisão comparável. 9× mais rápido. Para transcrição de chinês no mundo real, o SenseVoice te entrega uma transcrição utilizável antes de o Whisper terminar de carregar.

Quando usar cada modelo

O Whisper Notes para Mac agora traz quatro modelos de fala. Cada um é otimizado para cenários diferentes:

Você precisa de... Use este modelo Por quê
Inglês ou idiomas europeus, velocidade máxima Parakeet V3 103× tempo real, menor taxa de erro. O padrão.
Chinês, japonês, coreano ou cantonês SenseVoice Small 52–118× tempo real. Único modelo com suporte a cantonês.
Qualquer um dos 100+ idiomas (árabe, tailandês, russo etc.) Whisper Large V3 Turbo Suporte mais amplo a idiomas. Mais lento, mas universal.
Menor uso de memória (Macs mais antigos) Whisper Small 487 MB de memória. Bom para Macs de 8 GB rodando outros apps.
Seletor de modelos do Whisper Notes Mac mostrando Parakeet V3, SenseVoice Small, Whisper Small e Whisper Large V3 Turbo com tamanhos de download e suporte a idiomas

Configurações → Modelo de transcrição: escolha o motor certo para o seu idioma

O seletor de modelos nas Configurações mostra as quatro opções com tamanhos de download, número de idiomas e requisitos de memória. O SenseVoice é baixado no primeiro uso (~827 MB) e fica no seu dispositivo.

Os compromissos

O SenseVoice não é um modelo universal. Eis o que ele não consegue fazer:

Só 5 idiomas. Se você precisa de tailandês, russo, árabe, hindi ou outro idioma fora do foco CJK do SenseVoice, fique com o Whisper.

Atualização: o SenseVoice foi lançado inicialmente só para Mac via Apple MLX, mas agora também está disponível no iPhone — o iOS suporta a mesma linha de modelos do Mac: Parakeet V3, Whisper e SenseVoice.

Peculiaridade com áudio baixo. Em trechos muito curtos ou muito silenciosos, o SenseVoice pode às vezes cair para saída em chinês, independentemente do idioma selecionado. Definir o idioma manualmente (em vez de "Auto") reduz isso.

Sem streaming. Diferentemente do modo de streaming do Whisper, o SenseVoice processa o áudio completo depois da gravação. Para arquivos longos, ele segmenta automaticamente nos pontos de silêncio e mostra os resultados progressivamente.

Essas são restrições de arquitetura, não bugs. Um modelo treinado em 5 idiomas faz esses 5 idiomas extremamente bem. A cobertura de mais de 100 idiomas do Whisper vem com velocidade menor e precisão desigual entre os idiomas.

Comparando todas as opções locais? Todos os modelos de fala para texto no dispositivo — as variantes do Whisper, o Parakeet V3, o SenseVoice e o Voxtral — estão comparados lado a lado na nossa página de comparação de modelos Whisper. Primeiro contato com o Whisper? Comece pelo Guia de Transcrição com Whisper — o que é o modelo, todas as formas de rodá-lo e quanto custa.

Perguntas frequentes

Qual é a alternativa mais rápida ao Whisper para transcrição de chinês, japonês e coreano?

O SenseVoice Small está disponível no Whisper Notes tanto no Mac quanto no iPhone. No nosso teste no Mac com um M4 Pro, ele transcreveu um podcast chinês de 27 minutos em 13,83 segundos (52–118× tempo real), enquanto o Whisper Large V3 Turbo levou mais de 2 minutos com o mesmo arquivo.

O SenseVoice é melhor que o Whisper para chinês?

Para chinês e cantonês, sim. No benchmark CommonVoice, o SenseVoice marca 10,78% de CER em chinês contra 12,55% do Whisper-Large-V3, e é mais de 15× mais rápido. O Whisper continua um pouco mais preciso para japonês e coreano.

Posso transcrever cantonês localmente em um Mac?

Sim. O SenseVoice marca 7,09% de CER em cantonês, contra 10,41% do Whisper-Large-V3 e uns quase inutilizáveis 38,97% do Whisper-Small. Antes do SenseVoice, não havia um bom jeito de transcrever cantonês localmente em um Mac.

O SenseVoice funciona no iPhone?

Sim. O Whisper Notes no iPhone suporta a mesma linha de modelos do Mac — Parakeet V3, Whisper e SenseVoice — então você também pode transcrever chinês, japonês, coreano e cantonês localmente no seu iPhone.

Experimente

O SenseVoice está disponível no Whisper Notes para Mac v1.5.0 (Direct Download / DMG) e posteriores, e no app atual para iPhone. No Mac, baixe-o em Configurações → Modelo de transcrição → SenseVoice Small (~827 MB). A versão para Mac exige Apple Silicon (M1 ou posterior).

Se você usa o Parakeet V3 e dita principalmente em inglês, não precisa trocar. O SenseVoice é para quando você precisa de chinês, japonês, coreano ou cantonês — e quer rapidez.

Baixar para Mac

Changelog completo: whispernotes.app/changelog

Dúvidas ou feedback: mac@whispernotes.app