Votre voix ne quitte jamais votre appareil
La plupart des apps Whisper uploadent vos enregistrements vers des serveurs cloud. On a construit Whisper Notes pour fonctionner entièrement sur l'appareil — pas d'internet, pas de collecte de données, aucun compromis.
Pourquoi on a créé une app Whisper local-first
Quand on a commencé à développer Whisper Notes, on a dû faire un choix : utiliser l'infrastructure cloud pour la transcription (plus simple à construire, meilleure précision) ou tout faire tourner sur l'appareil (plus difficile à construire, confidentialité totale). On a choisi le traitement sur appareil.
La raison est simple. Les enregistrements vocaux contiennent des données biométriques qu'on ne peut pas changer après exposition. Contrairement à un mot de passe, vous ne pouvez pas réinitialiser votre voix. Une fois uploadé vers un service cloud, votre audio existe sur une infrastructure que vous ne contrôlez pas — exposé aux fuites, aux pipelines de données d'entraînement, et à des politiques de rétention que vous ne verrez peut-être jamais.
Whisper Notes utilise le modèle Whisper Large V3 Turbo d'OpenAI tournant nativement sur Apple Silicon. Votre audio est traité par le Neural Engine de votre appareil. Aucune connexion internet requise. Aucune donnée transmise. L'app ne peut littéralement pas envoyer de données — elle n'a pas de serveur à appeler.
Le coût caché des apps Whisper "gratuites"
Dans notre expérience, les outils de transcription « gratuits » suivent un schéma récurrent : ils uploadent votre audio vers des serveurs cloud, le traitent à distance, et conservent les données pour améliorer leurs modèles. Le produit n'est pas le logiciel — c'est votre voix.
Les données vocales sont permanentes
Contrairement aux mots de passe ou numéros de carte bancaire, la biométrie vocale ne peut pas être changée après compromission. Quelques secondes d'enregistrement capturent des signatures acoustiques qui vous identifient dans différents contextes.
La technologie de clonage vocal ne nécessite maintenant que trois à cinq secondes d'échantillon audio. La précision de détection humaine pour les deepfakes vocaux de haute qualité reste à seulement 24,5%. En 2025, un clone vocal du ministre italien de la Défense a été utilisé pour extorquer près d'un million d'euros. Ce n'est pas un risque théorique.
Quand vous uploadez de l'audio vers un service de transcription cloud, vous créez un enregistrement permanent de votre identité biométrique sur une infrastructure que vous ne contrôlez pas.
Le paysage des fuites de transcription cloud
Les incidents de sécurité liés à l'IA ont augmenté de 56,4% en 2024. Quatre-vingt-deux pour cent des fuites impliquent maintenant l'infrastructure cloud. Le secteur santé a vu l'exposition d'informations de santé protégées via des agents de transcription, intégrations de dossiers médicaux électroniques, et data lakes mal configurés.
Le schéma est prévisible : des données sensibles affluent dans les systèmes d'IA, la visibilité diminue, et des attaquants ou accidents exposent ce qui devait rester privé. Les transcriptions de centres d'appels sont streamées vers des modèles tandis que les numéros de compte atterrissent dans des logs de debug sans masquage.
Le premier semestre 2025 a vu une forte augmentation des fuites de données majeures impliquant des catégories de données plus sensibles. Au lieu de simples noms d'utilisateur et mots de passe, les fuites exposent maintenant des profils génétiques, enregistrements vocaux, et identifiants biométriques.
La direction du voyage
En mars 2025, Amazon a annoncé l'abandon du paramètre « Ne pas envoyer les enregistrements vocaux » sur les appareils Echo. Toutes les interactions utilisateur avec les appareils Alexa sont maintenant enregistrées et envoyées aux serveurs d'Amazon par défaut, sans option de refus.
Ce n'est pas une décision isolée. Les grandes plateformes s'orientent vers plus de collecte de données, pas moins. Les incitations économiques du développement IA favorisent l'accumulation de données d'entraînement. Les options de confidentialité qui existent aujourd'hui pourraient ne plus exister demain.
On a construit Whisper Notes avec l'architecture opposée : il n'y a pas de serveur vers lequel envoyer des données. Ce n'est pas un paramètre qu'on peut changer. C'est une contrainte fondamentale de la façon dont l'app est construite.
Le vrai prix du "gratuit"
Les outils Whisper web gratuits utilisent souvent votre audio pour améliorer leurs modèles. C'est divulgué dans des conditions d'utilisation que peu d'utilisateurs lisent. Les services cloud par minute à $0,006-$0,40 par minute s'accumulent à des centaines de dollars annuellement pour les utilisateurs réguliers.
Les services par abonnement comme Otter.ai coûtent environ $99 par an. Sur cinq ans, ça fait $495—pour un service qui traite votre audio sur des serveurs distants.
Whisper Notes coûte $7,99 une fois. Pas d'abonnement. Pas de frais par minute. Pas de collecte de données. Le business model est simple : vous payez pour le logiciel, vous possédez le logiciel.
Coût par an
| Type de service | Année 1 | Année 2 | Année 3 | Traitement des données |
|---|---|---|---|---|
| Whisper Notes | $7,99 | $0 | $0 | Ne quitte jamais l'appareil |
| Service par abonnement | $99 | $99 | $99 | Traitement cloud |
| API cloud par minute | $120-480 | $120-480 | $120-480 | Traitement cloud |
| Outils web "gratuits" | $0 | $0 | $0 | Utilisé pour l'entraînement IA |
Quand il vaut mieux utiliser un service cloud
Sur un audio propre, les grands modèles cloud restent un peu plus précis, parce qu'ils tournent à une taille qu'aucun téléphone ni aucun ordinateur portable ne peut contenir, et ils savent sous-titrer la parole en direct, ce que la transcription sur l'appareil n'égale pas encore. Ce sont de vrais avantages, et nous n'allons pas faire semblant du contraire.
Si vous avez besoin de sous-titres en direct, si plusieurs personnes doivent corriger la même transcription pendant que la réunion se déroule, ou si la dernière fraction de précision compte plus que l'endroit où se trouve l'audio, un service cloud est le meilleur outil et nous préférons que vous l'utilisiez.
Ce que nous contestons, c'est de traiter cet écart de précision comme le seul chiffre de la décision. Pour un travail soumis au secret professionnel — notes cliniques, pièces couvertes par le secret, entretiens avec des sources — « où va l'audio ? » est une question à laquelle vous devez pouvoir répondre, et la réponse la plus courte qui tienne, c'est qu'il n'est allé nulle part.
Pourquoi l'architecture compte : apps natives vs. web wrappers
Quand vous cherchez « Whisper app », vous trouverez trois catégories : des outils web tournant dans votre navigateur, des APIs cloud nécessitant internet, et des apps natives compilées spécifiquement pour votre appareil. La différence d'architecture compte pour la confidentialité et la performance.
Web wrappers et outils basés navigateur
Beaucoup d'outils Whisper basés navigateur revendiquent le « traitement local », ce qui est techniquement exact. Votre audio reste dans l'onglet du navigateur. Mais les environnements navigateur ont des limitations fondamentales.
Les contraintes mémoire forcent l'utilisation de modèles plus petits. La plupart des navigateurs limitent la mémoire WebAssembly à environ 4GB, ce qui restreint la taille des modèles exécutables. JavaScript ajoute un overhead de traitement par rapport au code natif. Un crash d'onglet perd votre travail sans option de récupération.
Les outils basés navigateur manquent aussi d'intégration système. Ils ne peuvent pas tourner en arrière-plan pendant que vous utilisez d'autres applications. Ils ne peuvent pas accéder efficacement à l'accélération matérielle. Ce sont des pages web qui font de la transcription, pas des logiciels de transcription.
| Traitement | WebAssembly/TensorFlow.js dans le navigateur |
| Taille du modèle | Limitée par la mémoire navigateur (~4GB) |
| Vitesse | Plus lent à cause de l'overhead JavaScript |
| Confidentialité | Mieux que le cloud, mais le navigateur a accès |
| Fiabilité | L'onglet peut crasher, pas de traitement en arrière-plan |
Apps natives : accès direct au matériel
Whisper Notes est compilé spécifiquement pour macOS et iOS. Il accède directement au Neural Engine d'Apple — la même puce dédiée qui alimente Face ID et la photographie computationnelle.
Ce n'est pas une page web enveloppée dans une coquille d'app. C'est du code natif optimisé pour votre matériel spécifique. C'est aussi toute la raison pour laquelle les chiffres de vitesse de cette page sont possibles : sur un M4 Pro, Parakeet V3 traverse 35 minutes d'audio en environ 18 secondes.
Les apps natives peuvent tourner en arrière-plan, s'intégrer aux services système, et récupérer élégamment des interruptions. Elles sont sandboxées par le système d'exploitation, ce qui signifie qu'elles ne peuvent pas accéder aux données d'autres apps. Et comme Whisper Notes ne demande pas de permissions réseau, il ne peut littéralement pas transmettre de données même s'il était compromis.
| Traitement | Accès direct au Neural Engine Apple |
| Taille du modèle | Whisper Large V3 Turbo, environ 1,5 Go |
| Vitesse | Parakeet V3 à environ 60x le temps réel sur notre M5 Air |
| Confidentialité | Sandboxé, pas de permissions réseau |
| Fiabilité | Traitement en arrière-plan, intégration système |
APIs cloud : puissance maximale, exposition maximale
Les services cloud peuvent exécuter les plus grands modèles Whisper car les ressources serveur sont effectivement illimitées. Ils peuvent offrir une précision marginalement supérieure et des fonctionnalités comme la transcription en temps réel qui nécessitent une puissance de calcul substantielle.
Le compromis : chaque enregistrement est uploadé vers une infrastructure que vous ne contrôlez pas. Votre audio traverse internet, est traité sur des serveurs distants, et peut être stocké selon des politiques de rétention que vous n'avez pas choisies.
Pour les thérapeutes liés par des exigences de confidentialité, les avocats traitant des communications privilégiées, les journalistes protégeant leurs sources, ou quiconque travaille avec des informations sensibles, le traitement cloud est souvent un facteur disqualifiant indépendamment des avantages de précision.
| Traitement | Serveurs distants (calcul illimité) |
| Taille du modèle | Plus grands modèles disponibles |
| Vitesse | Dépend d'internet et de la file d'attente serveur |
| Confidentialité | Audio uploadé et potentiellement stocké |
| Fiabilité | Internet requis, sujet aux limites de taux |
Notre choix architectural
On a choisi l'architecture app native parce que c'est la seule façon de rendre la promesse structurelle plutôt que contractuelle : vos données vocales restent sur votre appareil. Pas « traité localement puis synchronisé ». Pas « chiffré en transit ». Jamais uploadé, point final.
Ce choix a des coûts. On ne peut pas offrir la transcription en temps réel pendant l'enregistrement. On ne peut pas exécuter des modèles plus grands que ce qui tient sur votre appareil. On ne peut pas fournir de fonctionnalités collaboratives nécessitant un serveur.
On a fait ce compromis intentionnellement. Pour les cas d'usage où la confidentialité compte — et dans notre expérience, ça inclut la plupart des transcriptions professionnelles — le fait que le traitement reste sur l'appareil l'emporte sur les fonctionnalités qui nécessitent une infrastructure cloud.
Quel modèle fait le travail ?
Trois moteurs, et comment choisir
Spécifications techniques
| Modèles IA | Parakeet V3 (par défaut), Whisper Large V3 Turbo (Mac) ou Whisper Small (iPhone), SenseVoice |
| Langues | 101 choix via Whisper, 25 langues européennes via Parakeet V3, 6 via SenseVoice |
| Formats audio | MP3, WAV, M4A, FLAC, AAC, OGG, WMA |
| Vitesse de traitement | Parakeet V3 à environ 60x le temps réel sur notre M5 Air ; la voie Whisper Turbo autour de 11x |
| Taille fichier | Aucune limite imposée par l'app |
| Plateformes | iOS 18+, macOS 11+ (optimisé Apple Silicon) |
Qu'est-ce qu'elle sait vraiment faire ?
Trois choses portent l'essentiel de l'usage quotidien : faire entrer l'audio, faire sortir le texte, et la contrainte qui garde les deux sur l'appareil.
Import de fichiers
Importez vos fichiers audio pour une transcription hors ligne. L'app Whisper Notes traite les fichiers en utilisant le contexte complet pour une meilleure précision.
- ✓Import depuis Fichiers, Mémos Vocaux, n'importe où
- ✓Enregistrez d'abord, transcrivez après pour une meilleure précision
- ✓Traitement en arrière-plan pendant que vous utilisez d'autres apps
- ✓Organisation automatique des fichiers
Options d'export
Plusieurs formats de sortie, du texte aux sous-titres.
- ✓Texte brut avec formatage
- ✓Fichiers de sous-titres SRT et VTT
- ✓Transcriptions horodatées
- ✓Étiquettes de locuteurs
- ✓Sauts de paragraphes personnalisés
Confidentialité totale
Votre audio ne quitte jamais votre appareil. Traitement hors ligne uniquement.
- ✓Aucune transmission de données - hors ligne seulement
- ✓Aucun sous-traitant tiers : transcription privée pour la santé, le droit et l'entreprise
- ✓Stockage local chiffré
- ✓Pas de cloud - tout sur votre appareil
- ✓Piste d'audit pour usage entreprise
Quelle est sa précision, et d'où vient ce chiffre ?
Des benchmarks publiés, plus nos propres mesures sur une machine nommée
Nous ne menons pas notre propre étude de précision : un éditeur qui corrige sa propre copie ne vaut pas grand-chose. Les taux d'erreur ci-dessous viennent du Hugging Face Open ASR Leaderboard et du benchmark FLEURS. Les deux sont publics et tenus par des gens qui n'ont aucun intérêt dans cette application. Les chiffres de vitesse sont les nôtres, mesurés sur une machine que nous nommons.
Taux d'erreur sur mots par modèle
| Modèle | Source | Taux d'erreur | Remarque |
|---|---|---|---|
| Parakeet V3 (par défaut sur Mac) | Open ASR Leaderboard | 6,32 % WER (anglais) | 25 langues européennes ; 12,0 % de moyenne sur FLEURS |
| Whisper Large V3 Turbo | Open ASR Leaderboard | 7,83 % WER (anglais) | La couverture la plus large des trois : 101 choix de langues |
| SenseVoice Small | Notre test, M4 Pro | Podcast de 27 minutes en 13,83 s | Conçu pour le chinois, le japonais, le coréen et le cantonais |
Key Findings
- •Parakeet V3 transcrit 35 minutes d'audio en 18 secondes sur un M4 Pro ; Whisper Turbo met environ trois minutes sur le même fichier
- •En anglais, moins de deux points de taux d'erreur séparent les trois modèles
- •La mesure porte sur de la parole lue et préparée. Vos propres enregistrements feront moins bien, et le micro comme les gens qui se coupent la parole pèsent plus lourd que le choix du modèle
Les gros modèles cloud gardent une légère avance sur un audio propre, parce qu'ils tournent à une taille qu'aucun téléphone ni portable ne peut contenir. Cet écart est le prix à payer pour que l'audio ne quitte jamais l'appareil. Si votre travail n'exige pas le dernier point de précision, l'échange en vaut généralement la peine. S'il l'exige, un service cloud est la recommandation honnête.
Comment se compare-t-elle aux alternatives ?
Face aux services cloud, aux outils déjà présents sur votre appareil et aux logiciels d'entreprise
L'essentiel de ce tableau se vérifie en quelques minutes. La ligne sur la précision est celle à lire attentivement, parce que les quatre catégories ne sont pas mesurées sur le même benchmark.
Comparatif des fonctionnalités
| Fonctionnalité | Whisper Notes | Services cloud | Outils intégrés | Logiciel entreprise |
|---|---|---|---|---|
| Précision (WER anglais) | 6,32-7,83 % (Open ASR Leaderboard) | Chiffres annoncés par l'éditeur, le plus souvent absents de ce classement | Non publié | Non publié |
| Où l'audio est traité | Sur votre appareil | Serveurs de l'éditeur | Variable selon l'éditeur | Option sur site |
| Prix | 7,99$ sur iPhone, 14$ sur Mac, payé une fois | 0,006$-0,40$/min | Gratuit (limité) | 500$-2000$/licence |
| Langues | 101 choix | 50-100 langues | 10-30 langues | 20-50 langues |
| Internet requis | Non | Oui | Parfois | Sur site: Non |
| Limite de longueur de fichier | Aucune limite imposée par l'app | Généralement 1-2 heures | 5-10 minutes | Variable |
Market Position: Le compromis devient lisible dès que les trois options sont côte à côte. Une API cloud de pointe reste un peu plus précise sur un audio propre, et elle coûte de 0,006$ à 0,40$ la minute, avec votre enregistrement sur le disque de quelqu'un d'autre. La transcription d'entreprise sur site garde l'audio à l'intérieur de votre réseau et démarre autour de 500$ par poste. Whisper Notes fait tourner les modèles ouverts sur du matériel que vous possédez déjà, pour 7,99$ sur iPhone ou 14$ sur Mac, et renonce pour cela au sous-titrage en direct, à l'édition partagée et à la dernière fraction de précision. Si l'un de ces trois points figure sur votre liste, l'un des deux autres est le meilleur achat.
À quels métiers cette app convient-elle ?
Trois types de travail où l'enregistrement ne peut pas voyager
Santé
Les professionnels de santé utilisent Whisper Notes pour la documentation patient, les notes cliniques et les entretiens de recherche. Comme l'audio n'atteint jamais un serveur de notre côté, il n'y a aucun sous-traitant tiers à couvrir par un BAA. Que l'ensemble du flux de travail soit conforme HIPAA dépend encore de la façon dont l'appareil lui-même est sécurisé. Et si des collègues doivent ouvrir et commenter la même note, un service cloud avec un BAA signé est la réponse la plus pratique.
Use Cases
- •Documentation des consultations patients
- •Notes et observations des procédures médicales
- •Transcription des interviews de recherche
- •Enregistrements des sessions de télémédecine
- •Contenu de formation et éducation médicale
Benefits
- ✓Aucune politique de partage de données à croire sur parole, puisque rien n'est envoyé
- ✓Vocabulaire personnalisé pour les termes cliniques et les noms de médicaments
- ✓Aucune donnée de santé ne quitte l'appareil, puisqu'il n'existe pas de chemin d'upload
- ✓Une consultation de 20 minutes se transcrit en bien moins d'une minute sur un Mac Apple Silicon
Juridique
Les avocats utilisent Whisper Notes pour les dépositions, les entretiens clients et la préparation de dossiers. L'enregistrement reste sur l'appareil, donc aucun prestataire n'en détient de copie. Ce que cela ne règle pas, ce sont vos propres obligations : savoir si un flux de travail donné satisfait les règles de confidentialité de votre juridiction dépend encore de la façon dont l'appareil, ses sauvegardes et ses exports sont gérés.
Use Cases
- •Documentation des interviews clients
- •Transcription des dépositions et audiences
- •Notes de recherche et préparation d'affaires
- •Enregistrements des procédures juridiques
- •Transcription des interviews d'enquête
Benefits
- ✓Nous ne détenons aucune copie de l'enregistrement ni de la transcription
- ✓Vocabulaire personnalisé pour les noms d'affaires et les termes juridiques
- ✓Transcriptions horodatées, exportables en texte, SRT, VTT ou JSON
- ✓7,99$ sur iPhone ou 14$ sur Mac, payé une fois, face à une transcription externalisée facturée à la minute
Journalisme
Les reporters utilisent Whisper Notes pour leurs entretiens avec des sources et leurs enregistrements de terrain. Aucun serveur ne détient l'audio, donc les seules copies sont celles qui se trouvent sur vos propres appareils. Cela déplace la protection des sources : elle ne repose plus sur notre politique de rétention, que vous ne pouvez pas vérifier, mais sur la sécurité de votre appareil, que vous pouvez vérifier. Si la rédaction a besoin que plusieurs personnes éditent une même transcription pendant un direct, c'est le travail d'un outil cloud.
Use Cases
- •Transcription des entretiens avec les sources
- •Documentation des enregistrements de terrain
- •Notes de conférences de presse
- •Archives d'entretiens de recherche
- •Production de podcasts
Benefits
- ✓Rien de l'enregistrement ni de la transcription n'est envoyé où que ce soit
- ✓Fonctionne appareil hors ligne, ce qui est aussi la façon de vérifier l'affirmation
- ✓Aucun compte, donc aucun historique de connexion reliant un entretien à vous
- ✓Export en texte, SRT, VTT ou JSON, pour les outils que la rédaction utilise déjà
Quelle est sa vitesse, et où pèche-t-elle ?
Les chiffres que nous avons mesurés, et ce que la conception exclut
Ce que nous avons mesuré, et sur quoi
La vitesse dépend de la machine et du moteur choisi. Un multiplicateur unique pour « l'app » serait donc trompeur. Voici nos propres essais, chronométrés du lancement au texte final, sur du matériel que nous nommons.
Parakeet V3, le moteur par défaut
Un enregistrement de réunion de 17,5 minutes terminé en 16,7 secondes sur notre M5 Air, soit environ 60x le temps réel
25 langues européennes ; notre propre essai, sur une seule machine
La voie Whisper Turbo
Whisper Large V3 Turbo tourne plutôt autour de 11x le temps réel sur le même chemin, ce qui est le prix de ses 101 choix de langues
Nos propres essais ; Turbo est la voie de la couverture large, pas celle de la vitesse
Appareils plus anciens et plus petits
Un iPhone traverse un fichier plus lentement qu'un Mac Apple Silicon, et l'écart se creuse avec l'âge de la puce. Les longs fichiers aboutissent quand même ; ils prennent proportionnellement plus de temps
iPhone 12 ou plus récent, ou un Mac Apple Silicon
Stockage
Les transcriptions sont minuscules, environ 0,1 Mo par heure d'audio. Ce sont les modèles qui pèsent : Whisper Large V3 Turbo fait environ 1,5 Go, et les deux autres sont plus petits
Parakeet V3 est intégré à l'app iPhone ; les autres modèles se téléchargent depuis l'app
Limites connues
Faire tourner les modèles sur l'appareil impose des limites dures, et elles sont plus faciles à vérifier avant l'achat qu'après. L'offre gratuite sur Mac couvre 5 000 mots par semaine exactement pour cette raison.
Matériel requis
Nécessite un iPhone 12 ou plus récent, ou un Mac Apple Silicon. Le matériel plus ancien n'a pas les performances de Neural Engine qu'il faudrait pour que ce soit praticable.
Impact: Incompatible avec les appareils de plus de 4-5 ans
Temps de traitement
Le temps de traitement augmente avec la durée de l'enregistrement. On ne contourne pas la physique du calcul sur appareil.
Impact: Aux vitesses ci-dessus, un fichier de quatre heures se compte en minutes sur un Mac, et davantage sur un iPhone
Dépendance à la qualité audio
Un audio médiocre ou un fort bruit de fond fait baisser la précision, et le modèle ne peut pas récupérer une information qui n'est pas dans le signal.
Impact: Le placement du micro et les gens qui se coupent la parole pèsent plus lourd sur le taux d'erreur que le choix du modèle
Pas de sous-titrage en direct
L'app transcrit un enregistrement une fois qu'il est terminé, au lieu de le sous-titrer pendant que vous parlez. Un sous-titrage en direct de cette qualité demande une classe de modèles qui ne tient pas sur un téléphone, et traiter le fichier entier donne aussi au modèle plus de contexte.
Impact: S'il vous faut des sous-titres à l'écran pendant l'événement, ce n'est pas le bon outil
Une seule langue par enregistrement
Difficulté avec la commutation rapide entre langues dans un même enregistrement
Impact: Meilleurs résultats avec un usage linguistique cohérent tout au long de l'enregistrement
Conclusion
Télécharger l'app Whisper Notes
Parole vers texte hors ligne pour iPhone et Mac. Transcription qui respecte votre confidentialité.
App Whisper Notes sur iOS et macOS • Seulement 7,99$ une fois • Pas d'abonnements