Whisper Notes reconnaît désormais les locuteurs

28 juillet 2026
·
8 min read
·Whisper Notes Team

Une transcription restitue ce qui a été dit. Pour un entretien, une réunion ou un podcast, il faut aussi savoir qui parle : ce problème porte un nom en recherche vocale : la diarisation des locuteurs. Depuis les versions iPhone 1.8.5, Mac App Store 1.3.2 et Mac en téléchargement direct 1.5.1, Whisper Notes exécute cette diarisation entièrement sur l’appareil.

Cet article explique le fonctionnement de la fonction, présente les résultats de notre benchmark face à une référence produite dans le cloud, puis détaillons le cas d’échec que nous n’avons pas pu éliminer par l’ingénierie — et la réponse que nous avons retenue.

Ce que fait la fonction

Ouvrez une note — un enregistrement, un fichier audio ou vidéo importé, ou un enregistrement de réunion — puis appuyez sur le bouton des locuteurs. Quelques secondes plus tard, chaque paragraphe affiche une étiquette de locuteur et un horodatage.

Diarisation locale des locuteurs dans Whisper Notes pour Mac : transcription de podcast avec étiquettes et horodatages, traitée sur l’appareil Étiquettes de locuteurs dans Whisper Notes pour iPhone : transcription avec noms et horodatages pour chaque personne

Étiquettes de locuteurs sur Mac et iPhone. Appuyez sur une phrase pour reprendre la lecture à cet instant.

Les étiquettes commencent par Locuteur 1 et Locuteur 2. Il suffit d’en renommer une pour mettre toute la transcription à jour. Touchez n’importe quelle phrase pour placer la lecture exactement au bon moment : vérifier une citation par rapport à la voix d’origine devient immédiat.

Renommer un locuteur dans Whisper Notes : l’étiquette est mise à jour dans toute la transcription

Renommer un locuteur met à jour chaque paragraphe de la note.

Pour les réunions enregistrées, l’identification des locuteurs démarre automatiquement à la fin de l’appel ; elle peut être désactivée dans les Paramètres. Les étiquettes sont conservées à l’export : Copier la transcription avec les locuteurs les place dans le presse-papiers, tandis que les fichiers SRT et VTT les intègrent aux sous-titres.

La diarisation travaille sur les voix, pas sur les mots. Elle fonctionne donc de la même façon dans les plus de 100 langues que l’app transcrit.

Un modèle de 19 MB sur le Neural Engine

La diarisation répond à la question « qui parle quand ? » en trois étapes. L’audio est découpé en segments de parole. Chaque segment devient une empreinte vocale, c’est-à-dire un vecteur compact qui décrit la voix plutôt que les mots. Les empreintes sont ensuite regroupées : les segments d’un même groupe reçoivent la même étiquette.

Whisper Notes utilise le pipeline community-1 de pyannote, converti en Core ML pour exécuter ses deux étapes sur le Neural Engine. Le téléchargement unique pèse 19 MB, et une conversation de 5.7 minutes est traitée en 2 à 4 secondes sur un Mac à puce M.

Audio → segments de parole → empreintes vocales → groupes → étiquettes

Chaque étape est exécutée localement.

Cette architecture compte encore plus pour la diarisation que pour la transcription. Une empreinte vocale est une donnée biométrique : elle peut identifier une personne comme le ferait une empreinte digitale. Avec un traitement local, les empreintes de votre voix, de vos collègues et des personnes interrogées sont calculées, regroupées puis supprimées sur l’appareil. Elles ne sont jamais envoyées ailleurs.

Ce que nous avons mesuré

Nous conservons un benchmark fixe de deux fichiers pour la diarisation. La référence provient d’un service cloud de transcription et de diarisation (ElevenLabs), puis elle est vérifiée à la main. Le score attribue chaque tranche de 10 ms de parole à un locuteur et retient la meilleure correspondance entre le résultat et la référence. Deux fichiers constituent un petit échantillon : nous considérons donc ces chiffres comme des indications, pas comme une conclusion.

Le premier fichier correspond au cas habituel : un podcast anglais de cinq minutes, avec deux voix nettement différentes. La plupart des entretiens, podcasts et réunions à deux ressemblent à cela.

Podcast anglais à deux locuteurs (5 min) Résultat
Attribution trame par trame (résolution de 10 ms) 96.7%
Précision par phrase (ce que vous lisez) 99.1%
Temps de traitement, Neural Engine des puces M 2–4 s

Les 0.9% restants correspondent à trois écarts aux limites des phrases, soit 3.4 secondes au total — l’ordre de grandeur de la résolution de la référence elle-même. Sur ce type d’audio, le résultat sur l’appareil rejoint le service cloud qui a produit notre référence.

Le cas le plus difficile

Le second fichier est difficile par choix : deux voix masculines proches dans une pièce réverbérante, avec un animateur qui intervient 19 fois, pendant 2.3 secondes en moyenne. L’invité parle 272 secondes ; l’animateur, 43. C’est le profil acoustique qui fait échouer la diarisation dans toutes les langues : des voix similaires qui enchaînent de courtes prises de parole.

Ici, le regroupement automatique échoue. Les deux empreintes vocales sont assez proches pour que l’algorithme les fusionne et attribue presque toute la conversation à une seule étiquette. Il se trouve que l’enregistrement est une émission d’entretien en chinois, ce qui nous a permis de tester l’hypothèse évidente : un modèle spécialisé dans la langue ferait-il mieux ? Nous avons exécuté, dans un pipeline CPU, deux modèles de locuteurs entraînés spécifiquement sur de la parole chinoise :

Modèle Podcast anglais Cas difficile* Temps (audio de 5.7 min)
pyannote community-1 (notre modèle, Neural Engine) 96.7% 81–82% 2–4 s
CAM++ (entraîné en chinois, CPU) 93.9% 81.2% 36–103 s
ERes2NetV2 (entraîné en chinois, CPU) 80.5% 220–290 s

* Attribution trame par trame sur le fichier difficile avec un nombre de locuteurs imposé. Sans cette information, tous les modèles convergent vers un seul locuteur.

Les deux échouent de la même manière, avec 10 à 100 fois plus de calcul. La difficulté est acoustique, pas linguistique : la limite tient à ce que les représentations vocales actuelles peuvent distinguer, quelle que soit la langue.

Ce résultat a éliminé la solution la plus évidente et nous en a montré une autre : fournir au pipeline le fait qu’il ne peut pas déduire, à savoir le nombre de personnes dans la pièce. Quand ce nombre est fixé (une option de menu de 2 à 6), le fichier difficile passe de l’échec à 89% de précision par phrase. La détection automatique reste l’option par défaut, car elle fonctionne sur les enregistrements ordinaires.

Relancer la détection des locuteurs dans Whisper Notes avec un nombre précis, puis exporter des SRT et VTT avec étiquettes

Relancer la détection avec le nombre exact de locuteurs. Le même menu exporte les SRT et VTT avec leurs étiquettes.

Corriger les interventions courtes

Une fois le nombre fixé, environ la moitié des erreurs restantes se trouvent dans des interventions de moins de trois secondes. Un extrait de deux secondes donne très peu de signal au modèle de représentation ; dans un échange rapide, son empreinte vocale capte aussi une partie de la voix voisine.

Après le regroupement, le pipeline réexamine donc chaque phrase de moins de 3.5 secondes. Il recalcule l’empreinte avec un masque couvrant exactement les trames de cette phrase, la compare à l’ancrage de chaque locuteur — la moyenne de ses interventions les plus longues — puis ne change l’étiquette que si l’écart est net. Le modèle existant est réutilisé ; aucun téléchargement supplémentaire n’est nécessaire.

Précision par phrase de bout en bout Avant correction Après
Cas difficile (nombre de locuteurs indiqué) 89.0% 94.8%
Podcast anglais (automatique) 98.5% 99.1%

Le seuil est volontairement prudent : sur les deux fichiers, le correcteur a changé 21 étiquettes sans introduire de nouvelle erreur.

Limites

• Les étiquettes apparaissent après la fin de l’enregistrement, pas pendant l’appel. Si vous avez besoin de sous-titres en direct avec le nom des locuteurs pendant une réunion, un service cloud comme Otter ou Notta est plus adapté.

• Quand deux personnes parlent en même temps, chaque phrase ne reçoit qu’une étiquette.

• Les voix proches restent difficiles. Le score de 94.8% obtenu sur notre fichier difficile est le plafond actuel avec le nombre de locuteurs indiqué, pas un problème résolu.

Disponibilité

L’identification des locuteurs est comprise dans l’achat unique de $6.99, avec les trois moteurs de transcription de l’app — Parakeet V3, Whisper Large V3 Turbo et SenseVoice — ainsi que l’édition locale par IA. Il n’y a ni formule distincte ni compte.

iPhone : App Store, version 1.8.5 ou ultérieure.

Mac App Store : version 1.3.2 ou ultérieure.

Téléchargement direct sur Mac (DMG) : version 1.5.1 ou ultérieure sur whispernotes.app, avec une période d’essai gratuite.

Pour en savoir plus sur l’enregistrement de réunions, lisez notre article sur la transcription hors ligne des réunions.