Whisper Notes App: solução offline de voz para texto
Análise do app baseado no OpenAI Whisper Large V3 Turbo que oferece transcrição IA profissional offline e conversão de voz para texto
O que é o Whisper Notes?
Whisper Notes é um app de conversão offline de voz para texto que corre o Parakeet V3 (o predefinido), o Whisper Large V3 Turbo e o SenseVoice no próprio dispositivo. Ao contrário dos serviços de conversão de voz para texto na nuvem, este software de transcrição offline processa o áudio no seu equipamento: não existe caminho de envio.
O app Whisper Notes é usado por profissionais de várias indústrias — desde provedores de saúde até jornalistas conduzindo entrevistas sensíveis. Com mais de 10.000 usuários ativos, esta solução de conversão offline de voz para texto é uma opção em software de transcrição offline.
O custo oculto dos apps Whisper "gratuitos"
Na nossa experiência, ferramentas de transcrição "gratuitas" seguem um padrão consistente: carregam seu áudio para servidores na nuvem, processam remotamente e retêm dados para melhorar seus modelos. O produto não é o software — é a sua voz.
Dados de voz são permanentes
Diferente de senhas ou números de cartão de crédito, a biometria vocal não pode ser alterada após comprometimento. Alguns segundos de gravação capturam assinaturas acústicas que identificam você em diferentes contextos.
A tecnologia de clonagem de voz agora requer apenas três a cinco segundos de áudio de amostra. A precisão de detecção humana para deepfakes de voz de alta qualidade permanece em apenas 24,5%. Em 2025, um clone de voz do Ministro da Defesa italiano foi usado para extrair quase um milhão de euros. Este não é um risco teórico.
Quando você carrega áudio para um serviço de transcrição na nuvem, está criando um registro permanente da sua identidade biométrica em infraestrutura que você não controla.
O panorama de violações na transcrição em nuvem
Incidentes de segurança relacionados à IA aumentaram 56,4% em 2024. Oitenta e dois por cento das violações agora envolvem infraestrutura de nuvem. A saúde viu exposição de informações de saúde protegidas através de agentes de transcrição, integrações de EHR e data lakes mal configurados.
O padrão é previsível: dados sensíveis fluem para sistemas de IA, a visibilidade diminui, e atacantes ou acidentes expõem o que deveria ser privado. Transcrições de call centers fluem para modelos enquanto números de conta caem em logs de debug sem mascaramento.
A primeira metade de 2025 viu um forte aumento em grandes violações de dados envolvendo categorias de dados mais sensíveis. Em vez de apenas nomes de usuário e senhas, as violações agora expõem perfis genéticos, gravações de voz e identificadores biométricos.
A direção da jornada
Em março de 2025, a Amazon anunciou que estava descontinuando a configuração "Não Enviar Gravações de Voz" em dispositivos Echo. Todas as interações de usuários com dispositivos Alexa agora são gravadas e enviadas para os servidores da Amazon por padrão, sem opção de cancelamento.
Esta não é uma decisão isolada. As principais plataformas estão se movendo em direção a mais coleta de dados, não menos. Os incentivos econômicos do desenvolvimento de IA favorecem o acúmulo de dados de treinamento. Opções de privacidade que existem hoje podem não existir amanhã.
Construímos o Whisper Notes com a arquitetura oposta: não há servidor para enviar dados. Esta não é uma configuração que pode ser alterada. É uma restrição fundamental de como o app é construído.
O verdadeiro preço do "gratuito"
Ferramentas web Whisper gratuitas frequentemente usam seu áudio para melhorar seus modelos. Isso é divulgado em termos de serviço que poucos usuários leem. Serviços de nuvem por minuto de $0,006 a $0,40 por minuto acumulam centenas de dólares anualmente para usuários regulares.
Serviços baseados em assinatura como Otter.ai custam aproximadamente $99 por ano. Em cinco anos, isso é $495—por um serviço que processa seu áudio em servidores remotos.
Whisper Notes custa $7,99 uma vez. Sem assinatura. Sem taxas por minuto. Sem coleta de dados. O modelo de negócio é simples: você paga pelo software, você possui o software.
Custo por ano
| Tipo de serviço | Ano 1 | Ano 2 | Ano 3 | Tratamento de dados |
|---|---|---|---|---|
| Whisper Notes | $7,99 | $0 | $0 | Nunca sai do dispositivo |
| Serviço de assinatura | $99 | $99 | $99 | Processado na nuvem |
| API de nuvem por minuto | $120-480 | $120-480 | $120-480 | Processado na nuvem |
| Ferramentas web "gratuitas" | $0 | $0 | $0 | Usado para treinar IA |
Quando faz mais sentido usar um serviço na nuvem
Com áudio limpo, os grandes modelos na nuvem continuam um pouco mais precisos, porque correm num tamanho que nenhum telemóvel ou portátil consegue albergar, e conseguem legendar a fala em direto, coisa que a transcrição no dispositivo ainda não iguala. São vantagens reais e não vamos fingir o contrário.
Se precisa de legendas em direto, se várias pessoas têm de editar a mesma transcrição enquanto a reunião decorre, ou se a última fração de precisão pesa mais do que o sítio onde o áudio fica, um serviço na nuvem é a melhor ferramenta e preferimos que o use.
O que contestamos é tratar essa diferença de precisão como o único número da decisão. Em trabalho sujeito a dever de confidencialidade — registos clínicos, material abrangido por segredo profissional, entrevistas com fontes — «para onde vai o áudio?» é uma pergunta a que tem de saber responder, e a resposta mais curta que se aguenta é que não foi a lado nenhum.
Por que a arquitetura importa: apps nativos vs. wrappers web
Quando você pesquisa "Whisper app", encontrará três categorias: ferramentas web rodando no seu navegador, APIs de nuvem que requerem internet e apps nativos compilados especificamente para seu dispositivo. A diferença de arquitetura importa tanto para privacidade quanto para desempenho.
Wrappers web e ferramentas baseadas em navegador
Muitas ferramentas Whisper baseadas em navegador afirmam "processamento local", o que é tecnicamente correto. Seu áudio permanece na aba do navegador. Mas ambientes de navegador têm limitações fundamentais.
Restrições de memória forçam modelos menores. A maioria dos navegadores limita a memória WebAssembly a cerca de 4GB, o que restringe o tamanho do modelo que pode ser executado. JavaScript adiciona overhead de processamento comparado ao código nativo. Um único crash de aba perde seu trabalho sem opção de recuperação.
Ferramentas baseadas em navegador também carecem de integração com o sistema. Não podem rodar em segundo plano enquanto você usa outros aplicativos. Não podem acessar aceleração de hardware eficientemente. São páginas web que fazem transcrição, não software de transcrição.
| Processamento | WebAssembly/TensorFlow.js no navegador |
| Tamanho do modelo | Limitado pela memória do navegador (~4GB) |
| Velocidade | Mais lento devido ao overhead do JavaScript |
| Privacidade | Melhor que nuvem, mas navegador tem acesso |
| Confiabilidade | Aba pode crashar, sem processamento em segundo plano |
Apps nativos: acesso direto ao hardware
Whisper Notes é compilado especificamente para macOS e iOS. Acessa o Neural Engine da Apple diretamente — o mesmo chip dedicado que alimenta Face ID e fotografia computacional.
Isto não é uma página web embrulhada num shell de app. É código nativo otimizado para o seu hardware específico. É por isso que os números de velocidade nesta página são sequer possíveis: num M4 Pro, o Parakeet V3 despacha 35 minutos de áudio em cerca de 18 segundos.
Apps nativos podem rodar em segundo plano, integrar com serviços do sistema e recuperar graciosamente de interrupções. São sandboxed pelo sistema operacional, o que significa que não podem acessar dados de outros apps. E não existe nenhum caminho de upload para o seu áudio nem para a transcrição: ligue o modo avião e a transcrição continua a funcionar à mesma velocidade.
| Processamento | Acesso direto ao Neural Engine da Apple |
| Tamanho do modelo | Whisper Large V3 Turbo, cerca de 1,5GB |
| Velocidade | Parakeet V3 a cerca de 60x o tempo real no nosso M5 Air |
| Privacidade | Sandboxed, sem permissões de rede |
| Confiabilidade | Processamento em segundo plano, integração de sistema |
APIs de nuvem: máximo poder, máxima exposição
Serviços de nuvem podem rodar os maiores modelos Whisper porque recursos de servidor são efetivamente ilimitados. Podem oferecer precisão marginalmente maior e recursos como transcrição em tempo real que requerem poder de computação substancial.
O trade-off: toda gravação é carregada para infraestrutura que você não controla. Seu áudio atravessa a internet, é processado em servidores remotos e pode ser armazenado de acordo com políticas de retenção que você não escolheu.
Para terapeutas vinculados por requisitos de confidencialidade, advogados lidando com comunicações privilegiadas, jornalistas protegendo fontes ou qualquer pessoa trabalhando com informações sensíveis, processamento na nuvem é frequentemente um fator desqualificante independente dos benefícios de precisão.
| Processamento | Servidores remotos (computação ilimitada) |
| Tamanho do modelo | Maiores modelos disponíveis |
| Velocidade | Depende da internet e fila do servidor |
| Privacidade | Áudio carregado e potencialmente armazenado |
| Confiabilidade | Requer internet, sujeito a limites de taxa |
Nossa decisão arquitetônica
Escolhemos arquitetura de app nativo porque era a única maneira de eliminar o caminho por onde os seus dados de voz poderiam sair do dispositivo. Não "processado localmente depois sincronizado". Não "cifrado em trânsito". Não há caminho de envio nenhum.
Esta escolha tem custos. Não podemos oferecer transcrição em tempo real durante a gravação. Não podemos rodar modelos maiores do que cabe no seu dispositivo. Não podemos fornecer recursos colaborativos que requerem um servidor.
Fizemos este trade-off intencionalmente. Para os casos de uso onde privacidade importa — e na nossa experiência, isso inclui a maioria da transcrição profissional — a ausência de caminho de envio pesa mais do que as funcionalidades que exigem infraestrutura na nuvem.
Que modelo está a fazer o trabalho?
Três motores, e como escolher um
Especificações
| Modelos de IA | Parakeet V3 (predefinido), Whisper Large V3 Turbo (Mac) ou Whisper Small (iPhone), SenseVoice |
| Idiomas | 101 opções via Whisper, 25 europeus via Parakeet V3, 6 via SenseVoice |
| Formatos de áudio | MP3, WAV, M4A, FLAC, AAC, OGG, WMA |
| Velocidade de processamento | Parakeet V3 a cerca de 60x o tempo real no nosso M5 Air; a via Whisper Turbo a cerca de 11x |
| Limite de tamanho de ficheiro | Nenhum limite imposto pela app |
| Plataformas | iOS 18+, macOS 11+ (otimizado para Apple Silicon) |
O que é que a app faz, na prática?
Três coisas sustentam quase todo o uso diário: meter o áudio lá dentro, tirar o texto cá para fora, e a restrição que mantém ambos no dispositivo.
Importação de arquivo offline
Importe arquivos de áudio ou gravações completas para transcrição AI offline de alta precisão. Este app de conversão offline de voz para texto processa arquivos usando análise de contexto completo para maximizar a precisão, fornecendo resultados superiores comparado aos serviços online de conversão de voz para texto.
- ✓Importe arquivos de áudio de várias fontes (Arquivos, Memos de Voz, etc.)
- ✓Grave áudio primeiro, depois transcreva para precisão ideal
- ✓Processamento offline de voz para texto em segundo plano enquanto usa outros apps
- ✓Organização automática de arquivos e gerenciamento de transcrição
Opções de exportação avançadas
Formatos de saída de nível profissional adaptados para diferentes casos de uso, desde documentos de texto simples até arquivos de legendas para conteúdo de vídeo.
- ✓Texto simples com formatação personalizável
- ✓Arquivos de legenda SRT e VTT para vídeo
- ✓Transcrições com timestamp para referência
- ✓Identificação e rotulagem de falante
- ✓Segmentação personalizada de parágrafos
Privacidade completa: verdadeiro processamento offline de voz para texto
A app foi construída de modo que o seu áudio não possa sair do dispositivo: não existe caminho de envio, e isso confirma-se em modo de avião.
- ✓Processamento completo offline de voz para texto (sem transmissão de dados)
- ✓Sem subcontratante externo: transcrição privada para saúde, área jurídica e empresas
- ✓Armazenamento local criptografado para toda transcrição AI offline
- ✓Sem dependências de nuvem - verdadeiro software de transcrição offline
- ✓Trilha de auditoria para ambientes empresariais de conversão offline de voz para texto
Qual é a precisão e de onde vem esse número?
Benchmarks publicados, mais as nossas próprias medições numa máquina que identificamos
Não fazemos um estudo de precisão próprio: um fabricante que corrige o seu próprio teste vale pouco. As taxas de erro abaixo vêm do Hugging Face Open ASR Leaderboard e do benchmark FLEURS. Ambos são públicos e mantidos por pessoas que não ganham nada com esta app. Os números de velocidade são nossos, medidos numa máquina que identificamos.
Taxa de erro de palavras por modelo
| Modelo | Fonte | Taxa de erro | Nota |
|---|---|---|---|
| Parakeet V3 (predefinido no Mac) | Open ASR Leaderboard | 6,32% WER (inglês) | 25 idiomas europeus; 12,0% de média entre eles no FLEURS |
| Whisper Large V3 Turbo | Open ASR Leaderboard | 7,83% WER (inglês) | A cobertura mais ampla das três: 101 opções de idioma |
| SenseVoice Small | Teste nosso, M4 Pro | Podcast de 27 minutos em 13,83 s | Feito para chinês, japonês, coreano e cantonês |
Key Findings
- •O Parakeet V3 transcreve 35 minutos de áudio em 18 segundos num M4 Pro; o Whisper Turbo demora cerca de três minutos no mesmo ficheiro
- •Em inglês, menos de dois pontos de taxa de erro separam os três modelos
- •A medição é feita sobre fala lida e preparada. As suas próprias gravações ficam pior, e o microfone ou as pessoas a falar por cima pesam mais do que a escolha do modelo
Os grandes modelos na nuvem mantêm uma pequena vantagem com áudio limpo, porque correm num tamanho que nenhum telemóvel ou portátil comporta. Essa distância é o preço de o áudio nunca sair do dispositivo. Se o seu trabalho não exige o último ponto de precisão, a troca costuma compensar. Se exige, o honesto é recomendar um serviço na nuvem.
Como se compara às alternativas?
Contra serviços na nuvem, as ferramentas que já tem no dispositivo, e software empresarial
A maior parte desta tabela verifica-se em poucos minutos. A linha da precisão é a que convém ler com atenção, porque as quatro categorias não são medidas no mesmo benchmark.
Comparação de funcionalidades
| Recurso | App Whisper Notes | Serviços de nuvem | Ferramentas integradas | Software empresarial |
|---|---|---|---|---|
| Precisão (WER em inglês) | 6,32-7,83% (Open ASR Leaderboard) | Reportado pelo fornecedor, quase nunca nesse leaderboard | Não publicado | Não publicado |
| Onde o áudio é processado | No seu dispositivo | Servidores do fornecedor | Varia consoante o fornecedor | Opção on-premise |
| Custo | $7,99 iPhone, $14 Mac, pago uma vez | $0.006-0.40/min | Grátis (limitado) | $500-2000/licença |
| Idiomas | 101 opções | 50-100 idiomas | 10-30 idiomas | 20-50 idiomas |
| Internet necessária | Não | Sim | Às vezes | On-premise: Não |
| Limite de duração do ficheiro | Nenhum limite imposto pela app | Geralmente 1-2 horas | 5-10 minutos | Varia |
Market Position: Uma API de topo na nuvem continua a ser um pouco mais precisa com áudio limpo, e custa entre $0,006 e $0,40 por minuto com a sua gravação no disco de outra pessoa. A transcrição empresarial on-premise mantém o áudio dentro da sua rede e começa à volta de $500 por posto. O Whisper Notes corre os modelos abertos em hardware que já tem, por $7,99 no iPhone ou $14 no Mac, e abdica de legendagem em direto, edição partilhada e da última fração de precisão para o conseguir. Se alguma dessas três estiver na sua lista, uma das outras duas é a melhor compra.
Para que trabalhos é que isto serve bem?
Três tipos de trabalho em que a gravação não pode viajar
Saúde
Profissionais de saúde usam o Whisper Notes para documentação de doentes, notas clínicas e entrevistas de investigação. Como o áudio nunca chega a um servidor nosso, não há subcontratante externo para cobrir num contrato de subcontratação. Se todo o fluxo de trabalho cumpre o RGPD ou a HIPAA continua a depender da forma como o próprio dispositivo está protegido — e se os colegas precisam de abrir e comentar a mesma nota, um serviço na nuvem com contrato assinado é a resposta mais prática.
Use Cases
- •Documentação de consultas
- •Notas de procedimentos médicos
- •Transcrição de entrevistas de investigação
- •Registos de sessões de telemedicina
- •Conteúdos de formação clínica
Benefits
- ✓Não há política de partilha de dados em que confiar, porque nada é enviado
- ✓Vocabulário personalizado para termos clínicos e nomes de medicamentos
- ✓Nenhum dado clínico sai do dispositivo, porque não existe caminho de envio
- ✓Uma consulta de 20 minutos transcreve-se em bem menos de um minuto num Mac com Apple Silicon
Jurídico
Advogados usam o Whisper Notes para depoimentos, entrevistas com clientes e preparação de processos. A gravação fica no dispositivo, portanto não há fornecedor com uma cópia. O que isso não resolve são as suas próprias obrigações: se um determinado fluxo de trabalho cumpre as regras de sigilo da sua jurisdição continua a depender de como o dispositivo, as suas cópias de segurança e as exportações são tratados.
Use Cases
- •Documentação de entrevistas com clientes
- •Transcrição de depoimentos
- •Notas de investigação de processos
- •Registos de procedimentos legais
- •Entrevistas de investigação
Benefits
- ✓Não guardamos cópia da gravação nem da transcrição
- ✓Vocabulário personalizado para nomes de processos e termos jurídicos
- ✓Transcrições com marcação temporal, exportadas em texto, SRT, VTT ou JSON
- ✓$7,99 no iPhone ou $14 no Mac, pago uma vez, contra transcrição subcontratada ao minuto
Jornalismo
Jornalistas usam o Whisper Notes para entrevistas com fontes e gravações no terreno. Não há servidor a guardar o áudio, portanto as únicas cópias estão nos seus próprios dispositivos — o que desloca a proteção da fonte da nossa política de retenção, que não pode verificar, para a segurança do seu equipamento, que pode. Se a redação precisar de várias pessoas a editar a mesma transcrição durante um acontecimento em direto, isso é trabalho para uma ferramenta na nuvem.
Use Cases
- •Transcrição de entrevistas com fontes
- •Tratamento de gravações no terreno
- •Notas de conferências de imprensa
- •Arquivo de entrevistas de investigação
- •Produção de podcasts
Benefits
- ✓Nada da gravação nem da transcrição é enviado para lado nenhum
- ✓Funciona com o dispositivo offline, que é também a forma de confirmar esta afirmação
- ✓Sem conta, portanto sem histórico de sessões a ligar uma entrevista a si
- ✓Exporta para texto, SRT, VTT ou JSON, para as ferramentas que a redação já usa
Quão rápida é, e onde fica aquém?
Os números que medimos, e as coisas que o desenho exclui
O que medimos, e em quê
A velocidade depende da máquina e do motor que escolher, por isso um multiplicador único para "a app" seria enganador. Estes são ensaios nossos, tempo de relógio do início ao texto final, em hardware que identificamos.
Parakeet V3, o motor predefinido
Uma gravação de reunião de 17,5 minutos ficou pronta em 16,7 segundos no nosso M5 Air — cerca de 60x o tempo real
25 idiomas europeus; ensaio nosso, uma máquina
A via Whisper Turbo
O Whisper Large V3 Turbo anda mais perto de 11x o tempo real no mesmo percurso, e esse é o preço das suas 101 opções de idioma
Ensaios nossos; o Turbo é a via de cobertura ampla, não a rápida
Aparelhos mais antigos e mais pequenos
Um iPhone percorre um ficheiro mais devagar do que um Mac com Apple Silicon, e a diferença aumenta com a idade do chip. Ficheiros longos chegam ao fim na mesma; levam proporcionalmente mais tempo
iPhone 12 ou posterior, ou um Mac com Apple Silicon
Armazenamento
As transcrições são minúsculas, cerca de 0,1MB por hora de áudio. Os modelos é que ocupam espaço: o Whisper Large V3 Turbo tem cerca de 1,5GB e os outros dois são mais pequenos
O Parakeet V3 vem integrado na app do iPhone; os outros modelos descarregam-se dentro da app
Limitações conhecidas
Correr os modelos no dispositivo impõe limites rígidos, e esses são mais fáceis de verificar antes de comprar do que depois. É precisamente por isso que o plano gratuito no Mac cobre 5 000 palavras por semana.
Requisitos de dispositivo
Requer um iPhone 12 ou posterior, ou um Mac com Apple Silicon. Hardware mais antigo não tem o desempenho de Neural Engine que torna isto prático.
Impact: Não é compatível com dispositivos com mais de 4-5 anos
Tempo de processamento
O tempo de processamento acompanha a duração da gravação. Não há forma de contornar a física do cálculo no dispositivo.
Impact: Às velocidades acima, um ficheiro de quatro horas são minutos num Mac e mais tempo num iPhone
Dependência da qualidade do áudio
Áudio fraco ou ruído de fundo alto reduzem a precisão, e o modelo não consegue recuperar informação que não está no sinal.
Impact: A colocação do microfone e as pessoas a falar por cima mexem mais na taxa de erro do que a escolha do modelo
Sem legendagem em direto
A app transcreve uma gravação depois de esta terminar, em vez de legendar enquanto fala. Legendagem em direto com essa qualidade exige uma classe de modelo que não cabe num telemóvel, e processar o ficheiro inteiro dá também mais contexto ao modelo.
Impact: Se precisa de legendas no ecrã durante o acontecimento, esta é a ferramenta errada
Um idioma por gravação
Mudar de idioma rapidamente dentro da mesma gravação reduz a precisão. O modelo funciona melhor com um idioma consistente do princípio ao fim.
Impact: Melhores resultados com um idioma principal por ficheiro
Conclusão: o melhor app de conversão offline de voz para texto para uso profissional
Experimente o melhor app de conversão offline de voz para texto
Junte-se a milhares de profissionais que confiam no Whisper Notes para transcrição AI offline precisa e privada
Melhor app de conversão offline de voz para texto disponível no iOS e macOS • Compra única $7.99 • Sem assinaturas ou taxas contínuas para transcrição AI offline