Votre voix ne quitte jamais votre appareil

La plupart des apps Whisper uploadent vos enregistrements vers des serveurs cloud. On a construit Whisper Notes pour fonctionner entièrement sur l'appareil — pas d'internet, pas de collecte de données, aucun compromis.

Mis à jour Janvier 2026•10 min de lecture

Pourquoi on a créé une app Whisper local-first

Quand on a commencé à développer Whisper Notes, on a dû faire un choix : utiliser l'infrastructure cloud pour la transcription (plus simple à construire, meilleure précision) ou tout faire tourner sur l'appareil (plus difficile à construire, confidentialité totale). On a choisi le traitement sur appareil.

La raison est simple. Les enregistrements vocaux contiennent des données biométriques qu'on ne peut pas changer après exposition. Contrairement à un mot de passe, vous ne pouvez pas réinitialiser votre voix. Une fois uploadé vers un service cloud, votre audio existe sur une infrastructure que vous ne contrôlez pas — exposé aux fuites, aux pipelines de données d'entraînement, et à des politiques de rétention que vous ne verrez peut-être jamais.

Whisper Notes utilise le modèle Whisper Large V3 Turbo d'OpenAI tournant nativement sur Apple Silicon. Votre audio est traité par le Neural Engine de votre appareil. Aucune connexion internet requise. Aucune donnée transmise. L'app ne peut littéralement pas envoyer de données — elle n'a pas de serveur à appeler.

Le coût caché des apps Whisper "gratuites"

Dans notre expérience, les outils de transcription « gratuits » suivent un schéma récurrent : ils uploadent votre audio vers des serveurs cloud, le traitent à distance, et conservent les données pour améliorer leurs modèles. Le produit n'est pas le logiciel — c'est votre voix.

Les données vocales sont permanentes

Contrairement aux mots de passe ou numéros de carte bancaire, la biométrie vocale ne peut pas être changée après compromission. Quelques secondes d'enregistrement capturent des signatures acoustiques qui vous identifient dans différents contextes.

La technologie de clonage vocal ne nécessite maintenant que trois à cinq secondes d'échantillon audio. La précision de détection humaine pour les deepfakes vocaux de haute qualité reste à seulement 24,5%. En 2025, un clone vocal du ministre italien de la Défense a été utilisé pour extorquer près d'un million d'euros. Ce n'est pas un risque théorique.

Quand vous uploadez de l'audio vers un service de transcription cloud, vous créez un enregistrement permanent de votre identité biométrique sur une infrastructure que vous ne contrôlez pas.

Le paysage des fuites de transcription cloud

Les incidents de sécurité liés à l'IA ont augmenté de 56,4% en 2024. Quatre-vingt-deux pour cent des fuites impliquent maintenant l'infrastructure cloud. Le secteur santé a vu l'exposition d'informations de santé protégées via des agents de transcription, intégrations de dossiers médicaux électroniques, et data lakes mal configurés.

Le schéma est prévisible : des données sensibles affluent dans les systèmes d'IA, la visibilité diminue, et des attaquants ou accidents exposent ce qui devait rester privé. Les transcriptions de centres d'appels sont streamées vers des modèles tandis que les numéros de compte atterrissent dans des logs de debug sans masquage.

Le premier semestre 2025 a vu une forte augmentation des fuites de données majeures impliquant des catégories de données plus sensibles. Au lieu de simples noms d'utilisateur et mots de passe, les fuites exposent maintenant des profils génétiques, enregistrements vocaux, et identifiants biométriques.

La direction du voyage

En mars 2025, Amazon a annoncé l'abandon du paramètre « Ne pas envoyer les enregistrements vocaux » sur les appareils Echo. Toutes les interactions utilisateur avec les appareils Alexa sont maintenant enregistrées et envoyées aux serveurs d'Amazon par défaut, sans option de refus.

Ce n'est pas une décision isolée. Les grandes plateformes s'orientent vers plus de collecte de données, pas moins. Les incitations économiques du développement IA favorisent l'accumulation de données d'entraînement. Les options de confidentialité qui existent aujourd'hui pourraient ne plus exister demain.

On a construit Whisper Notes avec l'architecture opposée : il n'y a pas de serveur vers lequel envoyer des données. Ce n'est pas un paramètre qu'on peut changer. C'est une contrainte fondamentale de la façon dont l'app est construite.

Le vrai prix du "gratuit"

Les outils Whisper web gratuits utilisent souvent votre audio pour améliorer leurs modèles. C'est divulgué dans des conditions d'utilisation que peu d'utilisateurs lisent. Les services cloud par minute à $0,006-$0,40 par minute s'accumulent à des centaines de dollars annuellement pour les utilisateurs réguliers.

Les services par abonnement comme Otter.ai coûtent environ $99 par an. Sur cinq ans, ça fait $495—pour un service qui traite votre audio sur des serveurs distants.

Whisper Notes coûte $7,99 une fois. Pas d'abonnement. Pas de frais par minute. Pas de collecte de données. Le business model est simple : vous payez pour le logiciel, vous possédez le logiciel.

Coût par an

Type de serviceAnnée 1Année 2Année 3Traitement des données
Whisper Notes$7,99$0$0Ne quitte jamais l'appareil
Service par abonnement$99$99$99Traitement cloud
API cloud par minute$120-480$120-480$120-480Traitement cloud
Outils web "gratuits"$0$0$0Utilisé pour l'entraînement IA

Quand il vaut mieux utiliser un service cloud

Sur un audio propre, les grands modèles cloud restent un peu plus précis, parce qu'ils tournent à une taille qu'aucun téléphone ni aucun ordinateur portable ne peut contenir, et ils savent sous-titrer la parole en direct, ce que la transcription sur l'appareil n'égale pas encore. Ce sont de vrais avantages, et nous n'allons pas faire semblant du contraire.

Si vous avez besoin de sous-titres en direct, si plusieurs personnes doivent corriger la même transcription pendant que la réunion se déroule, ou si la dernière fraction de précision compte plus que l'endroit où se trouve l'audio, un service cloud est le meilleur outil et nous préférons que vous l'utilisiez.

Ce que nous contestons, c'est de traiter cet écart de précision comme le seul chiffre de la décision. Pour un travail soumis au secret professionnel — notes cliniques, pièces couvertes par le secret, entretiens avec des sources — « où va l'audio ? » est une question à laquelle vous devez pouvoir répondre, et la réponse la plus courte qui tienne, c'est qu'il n'est allé nulle part.

Pourquoi l'architecture compte : apps natives vs. web wrappers

Quand vous cherchez « Whisper app », vous trouverez trois catégories : des outils web tournant dans votre navigateur, des APIs cloud nécessitant internet, et des apps natives compilées spécifiquement pour votre appareil. La différence d'architecture compte pour la confidentialité et la performance.

Web wrappers et outils basés navigateur

Beaucoup d'outils Whisper basés navigateur revendiquent le « traitement local », ce qui est techniquement exact. Votre audio reste dans l'onglet du navigateur. Mais les environnements navigateur ont des limitations fondamentales.

Les contraintes mémoire forcent l'utilisation de modèles plus petits. La plupart des navigateurs limitent la mémoire WebAssembly à environ 4GB, ce qui restreint la taille des modèles exécutables. JavaScript ajoute un overhead de traitement par rapport au code natif. Un crash d'onglet perd votre travail sans option de récupération.

Les outils basés navigateur manquent aussi d'intégration système. Ils ne peuvent pas tourner en arrière-plan pendant que vous utilisez d'autres applications. Ils ne peuvent pas accéder efficacement à l'accélération matérielle. Ce sont des pages web qui font de la transcription, pas des logiciels de transcription.

TraitementWebAssembly/TensorFlow.js dans le navigateur
Taille du modèleLimitée par la mémoire navigateur (~4GB)
VitessePlus lent à cause de l'overhead JavaScript
ConfidentialitéMieux que le cloud, mais le navigateur a accès
FiabilitéL'onglet peut crasher, pas de traitement en arrière-plan

Apps natives : accès direct au matériel

Whisper Notes est compilé spécifiquement pour macOS et iOS. Il accède directement au Neural Engine d'Apple — la même puce dédiée qui alimente Face ID et la photographie computationnelle.

Ce n'est pas une page web enveloppée dans une coquille d'app. C'est du code natif optimisé pour votre matériel spécifique. C'est aussi toute la raison pour laquelle les chiffres de vitesse de cette page sont possibles : sur un M4 Pro, Parakeet V3 traverse 35 minutes d'audio en environ 18 secondes.

Les apps natives peuvent tourner en arrière-plan, s'intégrer aux services système, et récupérer élégamment des interruptions. Elles sont sandboxées par le système d'exploitation, ce qui signifie qu'elles ne peuvent pas accéder aux données d'autres apps. Et comme Whisper Notes ne demande pas de permissions réseau, il ne peut littéralement pas transmettre de données même s'il était compromis.

TraitementAccès direct au Neural Engine Apple
Taille du modèleWhisper Large V3 Turbo, environ 1,5 Go
VitesseParakeet V3 à environ 60x le temps réel sur notre M5 Air
ConfidentialitéSandboxé, pas de permissions réseau
FiabilitéTraitement en arrière-plan, intégration système

APIs cloud : puissance maximale, exposition maximale

Les services cloud peuvent exécuter les plus grands modèles Whisper car les ressources serveur sont effectivement illimitées. Ils peuvent offrir une précision marginalement supérieure et des fonctionnalités comme la transcription en temps réel qui nécessitent une puissance de calcul substantielle.

Le compromis : chaque enregistrement est uploadé vers une infrastructure que vous ne contrôlez pas. Votre audio traverse internet, est traité sur des serveurs distants, et peut être stocké selon des politiques de rétention que vous n'avez pas choisies.

Pour les thérapeutes liés par des exigences de confidentialité, les avocats traitant des communications privilégiées, les journalistes protégeant leurs sources, ou quiconque travaille avec des informations sensibles, le traitement cloud est souvent un facteur disqualifiant indépendamment des avantages de précision.

TraitementServeurs distants (calcul illimité)
Taille du modèlePlus grands modèles disponibles
VitesseDépend d'internet et de la file d'attente serveur
ConfidentialitéAudio uploadé et potentiellement stocké
FiabilitéInternet requis, sujet aux limites de taux

Notre choix architectural

On a choisi l'architecture app native parce que c'est la seule façon de rendre la promesse structurelle plutôt que contractuelle : vos données vocales restent sur votre appareil. Pas « traité localement puis synchronisé ». Pas « chiffré en transit ». Jamais uploadé, point final.

Ce choix a des coûts. On ne peut pas offrir la transcription en temps réel pendant l'enregistrement. On ne peut pas exécuter des modèles plus grands que ce qui tient sur votre appareil. On ne peut pas fournir de fonctionnalités collaboratives nécessitant un serveur.

On a fait ce compromis intentionnellement. Pour les cas d'usage où la confidentialité compte — et dans notre expérience, ça inclut la plupart des transcriptions professionnelles — le fait que le traitement reste sur l'appareil l'emporte sur les fonctionnalités qui nécessitent une infrastructure cloud.

Quel modèle fait le travail ?

Trois moteurs, et comment choisir

Whisper Notes embarque trois moteurs de reconnaissance vocale et les exécute tous sur l'appareil. Parakeet V3 est le moteur par défaut. La voie Whisper, c'est Whisper Large V3 Turbo sur le Mac et Whisper Small sur iPhone : les mêmes 101 choix de langues, dans un modèle taillé pour le téléphone. SenseVoice est le moteur que vous sélectionnez pour le chinois, le cantonais, le japonais et le coréen. Rien ne bascule dessus automatiquement, donc si vous travaillez dans ces langues, changer de moteur est la première chose à faire après l'installation.
À quoi sert chacun : Parakeet V3 couvre 25 langues européennes et affiche 6,32 % de taux d'erreur sur mots en anglais sur l'Open ASR Leaderboard, le plus bas des trois sur ce benchmark. Sur nos propres essais, il traverse un fichier environ cinq fois plus vite que Whisper Large V3 Turbo. L'argument de Turbo, c'est l'étendue : 101 choix de langues, à 7,83 % de WER anglais sur le même classement. SenseVoice couvre six choix — anglais, chinois simplifié et traditionnel, cantonais, japonais et coréen. Sur nos essais, il avance à environ 52 fois le temps réel, et c'est ce qui en fait le moteur à choisir pour le CJK.
Comment ça tourne sur l'appareil : Les modèles sont convertis au format Core ML d'Apple et s'exécutent sur le Neural Engine, la même puce que celle qui fait tourner Face ID et la photographie computationnelle. Aucun serveur de transcription ne se trouve sur le chemin, donc aucune requête réseau n'est émise pendant la transcription d'un fichier. C'est une affirmation que vous pouvez vérifier plutôt que croire : activez le mode avion avant de commencer.
Pourquoi trois moteurs plutôt qu'un : Aucun modèle ouvert n'est aujourd'hui le meilleur partout. Le plus rapide sur les langues européennes n'est pas celui qui en couvre une centaine, et aucun des deux n'est celui conçu pour le chinois et le japonais. Embarquer les trois et vous laisser choisir est moins net que de désigner un seul meilleur modèle, et c'est la raison pour laquelle l'app tient la route en dehors d'une seule famille de langues.

Spécifications techniques

Modèles IAParakeet V3 (par défaut), Whisper Large V3 Turbo (Mac) ou Whisper Small (iPhone), SenseVoice
Langues101 choix via Whisper, 25 langues européennes via Parakeet V3, 6 via SenseVoice
Formats audioMP3, WAV, M4A, FLAC, AAC, OGG, WMA
Vitesse de traitementParakeet V3 à environ 60x le temps réel sur notre M5 Air ; la voie Whisper Turbo autour de 11x
Taille fichierAucune limite imposée par l'app
PlateformesiOS 18+, macOS 11+ (optimisé Apple Silicon)

Qu'est-ce qu'elle sait vraiment faire ?

Trois choses portent l'essentiel de l'usage quotidien : faire entrer l'audio, faire sortir le texte, et la contrainte qui garde les deux sur l'appareil.

Import de fichiers

Importez vos fichiers audio pour une transcription hors ligne. L'app Whisper Notes traite les fichiers en utilisant le contexte complet pour une meilleure précision.

  • ✓Import depuis Fichiers, Mémos Vocaux, n'importe où
  • ✓Enregistrez d'abord, transcrivez après pour une meilleure précision
  • ✓Traitement en arrière-plan pendant que vous utilisez d'autres apps
  • ✓Organisation automatique des fichiers

Options d'export

Plusieurs formats de sortie, du texte aux sous-titres.

  • ✓Texte brut avec formatage
  • ✓Fichiers de sous-titres SRT et VTT
  • ✓Transcriptions horodatées
  • ✓Étiquettes de locuteurs
  • ✓Sauts de paragraphes personnalisés

Confidentialité totale

Votre audio ne quitte jamais votre appareil. Traitement hors ligne uniquement.

  • ✓Aucune transmission de données - hors ligne seulement
  • ✓Aucun sous-traitant tiers : transcription privée pour la santé, le droit et l'entreprise
  • ✓Stockage local chiffré
  • ✓Pas de cloud - tout sur votre appareil
  • ✓Piste d'audit pour usage entreprise

Quelle est sa précision, et d'où vient ce chiffre ?

Des benchmarks publiés, plus nos propres mesures sur une machine nommée

Nous ne menons pas notre propre étude de précision : un éditeur qui corrige sa propre copie ne vaut pas grand-chose. Les taux d'erreur ci-dessous viennent du Hugging Face Open ASR Leaderboard et du benchmark FLEURS. Les deux sont publics et tenus par des gens qui n'ont aucun intérêt dans cette application. Les chiffres de vitesse sont les nôtres, mesurés sur une machine que nous nommons.

Taux d'erreur sur mots par modèle

ModèleSourceTaux d'erreurRemarque
Parakeet V3 (par défaut sur Mac)Open ASR Leaderboard6,32 % WER (anglais)25 langues européennes ; 12,0 % de moyenne sur FLEURS
Whisper Large V3 TurboOpen ASR Leaderboard7,83 % WER (anglais)La couverture la plus large des trois : 101 choix de langues
SenseVoice SmallNotre test, M4 ProPodcast de 27 minutes en 13,83 sConçu pour le chinois, le japonais, le coréen et le cantonais

Key Findings

  • •Parakeet V3 transcrit 35 minutes d'audio en 18 secondes sur un M4 Pro ; Whisper Turbo met environ trois minutes sur le même fichier
  • •En anglais, moins de deux points de taux d'erreur séparent les trois modèles
  • •La mesure porte sur de la parole lue et préparée. Vos propres enregistrements feront moins bien, et le micro comme les gens qui se coupent la parole pèsent plus lourd que le choix du modèle

Les gros modèles cloud gardent une légère avance sur un audio propre, parce qu'ils tournent à une taille qu'aucun téléphone ni portable ne peut contenir. Cet écart est le prix à payer pour que l'audio ne quitte jamais l'appareil. Si votre travail n'exige pas le dernier point de précision, l'échange en vaut généralement la peine. S'il l'exige, un service cloud est la recommandation honnête.

Comment se compare-t-elle aux alternatives ?

Face aux services cloud, aux outils déjà présents sur votre appareil et aux logiciels d'entreprise

L'essentiel de ce tableau se vérifie en quelques minutes. La ligne sur la précision est celle à lire attentivement, parce que les quatre catégories ne sont pas mesurées sur le même benchmark.

Comparatif des fonctionnalités

FonctionnalitéWhisper NotesServices cloudOutils intégrésLogiciel entreprise
Précision (WER anglais)6,32-7,83 % (Open ASR Leaderboard)Chiffres annoncés par l'éditeur, le plus souvent absents de ce classementNon publiéNon publié
Où l'audio est traitéSur votre appareilServeurs de l'éditeurVariable selon l'éditeurOption sur site
Prix7,99$ sur iPhone, 14$ sur Mac, payé une fois0,006$-0,40$/minGratuit (limité)500$-2000$/licence
Langues101 choix50-100 langues10-30 langues20-50 langues
Internet requisNonOuiParfoisSur site: Non
Limite de longueur de fichierAucune limite imposée par l'appGénéralement 1-2 heures5-10 minutesVariable

Market Position: Le compromis devient lisible dès que les trois options sont côte à côte. Une API cloud de pointe reste un peu plus précise sur un audio propre, et elle coûte de 0,006$ à 0,40$ la minute, avec votre enregistrement sur le disque de quelqu'un d'autre. La transcription d'entreprise sur site garde l'audio à l'intérieur de votre réseau et démarre autour de 500$ par poste. Whisper Notes fait tourner les modèles ouverts sur du matériel que vous possédez déjà, pour 7,99$ sur iPhone ou 14$ sur Mac, et renonce pour cela au sous-titrage en direct, à l'édition partagée et à la dernière fraction de précision. Si l'un de ces trois points figure sur votre liste, l'un des deux autres est le meilleur achat.

À quels métiers cette app convient-elle ?

Trois types de travail où l'enregistrement ne peut pas voyager

Santé

Les professionnels de santé utilisent Whisper Notes pour la documentation patient, les notes cliniques et les entretiens de recherche. Comme l'audio n'atteint jamais un serveur de notre côté, il n'y a aucun sous-traitant tiers à couvrir par un BAA. Que l'ensemble du flux de travail soit conforme HIPAA dépend encore de la façon dont l'appareil lui-même est sécurisé. Et si des collègues doivent ouvrir et commenter la même note, un service cloud avec un BAA signé est la réponse la plus pratique.

Use Cases
  • •Documentation des consultations patients
  • •Notes et observations des procédures médicales
  • •Transcription des interviews de recherche
  • •Enregistrements des sessions de télémédecine
  • •Contenu de formation et éducation médicale
Benefits
  • ✓Aucune politique de partage de données à croire sur parole, puisque rien n'est envoyé
  • ✓Vocabulaire personnalisé pour les termes cliniques et les noms de médicaments
  • ✓Aucune donnée de santé ne quitte l'appareil, puisqu'il n'existe pas de chemin d'upload
  • ✓Une consultation de 20 minutes se transcrit en bien moins d'une minute sur un Mac Apple Silicon

Juridique

Les avocats utilisent Whisper Notes pour les dépositions, les entretiens clients et la préparation de dossiers. L'enregistrement reste sur l'appareil, donc aucun prestataire n'en détient de copie. Ce que cela ne règle pas, ce sont vos propres obligations : savoir si un flux de travail donné satisfait les règles de confidentialité de votre juridiction dépend encore de la façon dont l'appareil, ses sauvegardes et ses exports sont gérés.

Use Cases
  • •Documentation des interviews clients
  • •Transcription des dépositions et audiences
  • •Notes de recherche et préparation d'affaires
  • •Enregistrements des procédures juridiques
  • •Transcription des interviews d'enquête
Benefits
  • ✓Nous ne détenons aucune copie de l'enregistrement ni de la transcription
  • ✓Vocabulaire personnalisé pour les noms d'affaires et les termes juridiques
  • ✓Transcriptions horodatées, exportables en texte, SRT, VTT ou JSON
  • ✓7,99$ sur iPhone ou 14$ sur Mac, payé une fois, face à une transcription externalisée facturée à la minute

Journalisme

Les reporters utilisent Whisper Notes pour leurs entretiens avec des sources et leurs enregistrements de terrain. Aucun serveur ne détient l'audio, donc les seules copies sont celles qui se trouvent sur vos propres appareils. Cela déplace la protection des sources : elle ne repose plus sur notre politique de rétention, que vous ne pouvez pas vérifier, mais sur la sécurité de votre appareil, que vous pouvez vérifier. Si la rédaction a besoin que plusieurs personnes éditent une même transcription pendant un direct, c'est le travail d'un outil cloud.

Use Cases
  • •Transcription des entretiens avec les sources
  • •Documentation des enregistrements de terrain
  • •Notes de conférences de presse
  • •Archives d'entretiens de recherche
  • •Production de podcasts
Benefits
  • ✓Rien de l'enregistrement ni de la transcription n'est envoyé où que ce soit
  • ✓Fonctionne appareil hors ligne, ce qui est aussi la façon de vérifier l'affirmation
  • ✓Aucun compte, donc aucun historique de connexion reliant un entretien à vous
  • ✓Export en texte, SRT, VTT ou JSON, pour les outils que la rédaction utilise déjà

Quelle est sa vitesse, et où pèche-t-elle ?

Les chiffres que nous avons mesurés, et ce que la conception exclut

Ce que nous avons mesuré, et sur quoi

La vitesse dépend de la machine et du moteur choisi. Un multiplicateur unique pour « l'app » serait donc trompeur. Voici nos propres essais, chronométrés du lancement au texte final, sur du matériel que nous nommons.

Parakeet V3, le moteur par défaut

Un enregistrement de réunion de 17,5 minutes terminé en 16,7 secondes sur notre M5 Air, soit environ 60x le temps réel

25 langues européennes ; notre propre essai, sur une seule machine

La voie Whisper Turbo

Whisper Large V3 Turbo tourne plutôt autour de 11x le temps réel sur le même chemin, ce qui est le prix de ses 101 choix de langues

Nos propres essais ; Turbo est la voie de la couverture large, pas celle de la vitesse

Appareils plus anciens et plus petits

Un iPhone traverse un fichier plus lentement qu'un Mac Apple Silicon, et l'écart se creuse avec l'âge de la puce. Les longs fichiers aboutissent quand même ; ils prennent proportionnellement plus de temps

iPhone 12 ou plus récent, ou un Mac Apple Silicon

Stockage

Les transcriptions sont minuscules, environ 0,1 Mo par heure d'audio. Ce sont les modèles qui pèsent : Whisper Large V3 Turbo fait environ 1,5 Go, et les deux autres sont plus petits

Parakeet V3 est intégré à l'app iPhone ; les autres modèles se téléchargent depuis l'app

Limites connues

Faire tourner les modèles sur l'appareil impose des limites dures, et elles sont plus faciles à vérifier avant l'achat qu'après. L'offre gratuite sur Mac couvre 5 000 mots par semaine exactement pour cette raison.

Matériel requis

Nécessite un iPhone 12 ou plus récent, ou un Mac Apple Silicon. Le matériel plus ancien n'a pas les performances de Neural Engine qu'il faudrait pour que ce soit praticable.

Impact: Incompatible avec les appareils de plus de 4-5 ans

Temps de traitement

Le temps de traitement augmente avec la durée de l'enregistrement. On ne contourne pas la physique du calcul sur appareil.

Impact: Aux vitesses ci-dessus, un fichier de quatre heures se compte en minutes sur un Mac, et davantage sur un iPhone

Dépendance à la qualité audio

Un audio médiocre ou un fort bruit de fond fait baisser la précision, et le modèle ne peut pas récupérer une information qui n'est pas dans le signal.

Impact: Le placement du micro et les gens qui se coupent la parole pèsent plus lourd sur le taux d'erreur que le choix du modèle

Pas de sous-titrage en direct

L'app transcrit un enregistrement une fois qu'il est terminé, au lieu de le sous-titrer pendant que vous parlez. Un sous-titrage en direct de cette qualité demande une classe de modèles qui ne tient pas sur un téléphone, et traiter le fichier entier donne aussi au modèle plus de contexte.

Impact: S'il vous faut des sous-titres à l'écran pendant l'événement, ce n'est pas le bon outil

Une seule langue par enregistrement

Difficulté avec la commutation rapide entre langues dans un même enregistrement

Impact: Meilleurs résultats avec un usage linguistique cohérent tout au long de l'enregistrement

Conclusion

L'app Whisper Notes fait tourner Parakeet V3, Whisper Large V3 Turbo et SenseVoice sur votre propre appareil, pour la parole vers texte hors ligne sur iPhone et Mac. Parakeet V3 est le moteur par défaut. Votre audio reste sur votre appareil — aucun upload dans le cloud.
Forces : • 6,32 % à 7,83 % de WER anglais (Open ASR Leaderboard) • Traitement hors ligne uniquement : votre audio n'a aucun chemin d'upload • Seulement 7,99$ une fois vs 0,006$-0,40$/min pour les services cloud • 101 choix de langues via Whisper, 25 langues européennes via Parakeet V3 • Pas d'abonnements ou de coûts continus
Idéal pour : • Santé (notes cliniques) • Juridique (infos clients sensibles) • Journalisme (entretiens avec des sources) • Chercheurs (données d'entretiens) • Créateurs de contenu (transcription à coût maîtrisé)
L'app Whisper Notes : seulement 7,99$ une fois vs services cloud à la minute ou logiciel entreprise à 500$-2000$. Pour les pros qui ont besoin de confidentialité et de transcription régulière, ça offre une excellente valeur.
Limitations : exigences matérielles, temps de traitement pour l'audio très long, et pas de sous-titrage en direct. C'est le prix du traitement sur l'appareil.
L'app Whisper Notes montre que la transcription IA hors ligne peut fonctionner à prix grand public sans qu'aucun audio ne quitte l'appareil, ce que vous pouvez vérifier vous-même en mode avion.

Télécharger l'app Whisper Notes

Parole vers texte hors ligne pour iPhone et Mac. Transcription qui respecte votre confidentialité.

App Whisper Notes sur iOS et macOS • Seulement 7,99$ une fois • Pas d'abonnements