Whisper Notes identifie désormais les locuteurs

28 juillet 2026
·
8 min read
·Whisper Notes Team

Une transcription indique ce qui a été dit. Pour un entretien, une réunion ou un podcast, il faut aussi savoir qui parle : c’est ce que les chercheurs en parole appellent la diarisation des locuteurs. Depuis les versions iPhone 1.8.5, Mac App Store 1.3.2 et Mac en téléchargement direct 1.5.1, Whisper Notes exécute cette diarisation entièrement sur l’appareil.

Nous expliquons ici son fonctionnement, publions les résultats de notre benchmark face à une référence produite dans le cloud, puis détaillons le cas d’échec que nous n’avons pas pu éliminer par l’ingénierie — et la réponse que nous avons retenue.

Ce que fait la fonction

Ouvrez une note — un enregistrement, un fichier audio ou vidéo importé, ou un enregistrement de réunion — puis touchez le bouton des locuteurs. Quelques secondes plus tard, chaque paragraphe porte une étiquette de locuteur et un horodatage.

Diarisation locale des locuteurs dans Whisper Notes pour Mac : transcription de podcast avec étiquettes et horodatages, traitée sur l’appareil Étiquettes de locuteurs dans Whisper Notes pour iPhone : transcription avec noms et horodatages pour chaque personne

Étiquettes de locuteurs sur Mac et iPhone. Touchez une phrase pour reprendre la lecture à cet instant.

Les étiquettes commencent par Locuteur 1 et Locuteur 2. Renommez-en une, et toute la transcription est mise à jour. Touchez n’importe quelle phrase pour placer la lecture exactement au bon moment : vérifier une citation par rapport à la voix d’origine devient immédiat.

Renommer un locuteur dans Whisper Notes : l’étiquette est mise à jour dans toute la transcription

Renommer un locuteur met à jour chaque paragraphe de la note.

Pour les réunions enregistrées, l’identification des locuteurs démarre automatiquement à la fin de l’appel ; elle peut être désactivée dans les Réglages. Les étiquettes sont conservées à l’export : Copier la transcription avec les locuteurs les place dans le presse-papiers, tandis que les fichiers SRT et VTT les intègrent aux sous-titres.

La diarisation travaille sur les voix, pas sur les mots. Son fonctionnement est donc le même dans les plus de 100 langues que l’app transcrit.

Un modèle de 19 MB sur le Neural Engine

La diarisation répond à la question « qui parle quand ? » en trois étapes. L’audio est découpé en segments de parole. Chaque segment devient une empreinte vocale, c’est-à-dire un vecteur compact qui décrit la voix plutôt que les mots. Les empreintes sont ensuite regroupées : les segments d’un même groupe reçoivent la même étiquette.

Whisper Notes utilise le pipeline community-1 de pyannote, converti en Core ML pour exécuter ses deux étapes sur le Neural Engine. Le téléchargement unique pèse 19 MB, et une conversation de 5.7 minutes est traitée en 2 à 4 secondes sur un Mac à puce M.

Audio → segments de parole → empreintes vocales → groupes → étiquettes

Chaque étape s’exécute sur l’appareil.

Cette architecture compte encore plus pour la diarisation que pour la transcription. Une empreinte vocale est une donnée biométrique : elle peut identifier une personne comme le ferait une empreinte digitale. Avec un traitement local, les empreintes de votre voix, de vos collègues et des personnes interrogées sont calculées, regroupées puis supprimées sur l’appareil. Elles ne sont jamais envoyées ailleurs.

Ce que nous avons mesuré

Nous conservons un benchmark fixe de deux fichiers pour la diarisation. La référence provient d’un service cloud de transcription et de diarisation (ElevenLabs), puis elle est vérifiée à la main. Le score attribue chaque tranche de 10 ms de parole à un locuteur et retient la meilleure correspondance entre le résultat et la référence. Deux fichiers restent un petit échantillon : ces chiffres sont indicatifs, pas définitifs.

Le premier fichier représente le cas courant : un podcast anglais de cinq minutes, avec deux voix nettement différentes. La plupart des entretiens, podcasts et réunions à deux ressemblent à cela.

Podcast anglais à deux locuteurs (5 min) Résultat
Attribution trame par trame (résolution de 10 ms) 96.7%
Précision par phrase (ce que vous lisez) 99.1%
Temps de traitement, Neural Engine des puces M 2–4 s

Les 0.9% restants correspondent à trois écarts aux limites des phrases, soit 3.4 secondes au total — l’ordre de grandeur de la résolution de la référence elle-même. Sur ce type d’audio, le résultat sur l’appareil rejoint le service cloud qui a produit notre référence.

Le cas difficile

Le second fichier est difficile par choix : deux voix masculines proches dans une pièce réverbérante, avec un animateur qui intervient 19 fois, pendant 2.3 secondes en moyenne. L’invité parle 272 secondes ; l’animateur, 43. C’est le profil acoustique qui fait échouer la diarisation dans toutes les langues : des voix similaires qui enchaînent de courtes prises de parole.

Le regroupement automatique s’effondre ici. Les deux empreintes vocales sont assez proches pour que l’algorithme les fusionne et attribue presque toute la conversation à une seule étiquette. Il se trouve que l’enregistrement est une émission d’entretien en chinois, ce qui nous a permis de tester l’hypothèse évidente : un modèle spécialisé dans la langue ferait-il mieux ? Nous avons exécuté, dans un pipeline CPU, deux modèles de locuteurs entraînés spécifiquement sur de la parole chinoise :

Modèle Podcast anglais Cas difficile* Temps (audio de 5.7 min)
pyannote community-1 (notre modèle, Neural Engine) 96.7% 81–82% 2–4 s
CAM++ (entraîné en chinois, CPU) 93.9% 81.2% 36–103 s
ERes2NetV2 (entraîné en chinois, CPU) 80.5% 220–290 s

* Attribution trame par trame sur le fichier difficile avec un nombre de locuteurs imposé. Sans cette information, tous les modèles convergent vers un seul locuteur.

Les deux échouent de la même manière, avec 10 à 100 fois plus de calcul. La difficulté est acoustique, pas linguistique : la limite tient à ce que les représentations vocales actuelles peuvent distinguer, quelle que soit la langue.

Cette comparaison a écarté la solution évidente et en a indiqué une autre : fournir au pipeline le fait qu’il ne peut pas déduire, à savoir le nombre de personnes dans la pièce. Quand ce nombre est fixé (une option de menu de 2 à 6), le fichier difficile passe de l’échec à 89% de précision par phrase. La détection automatique reste l’option par défaut, car elle fonctionne sur les enregistrements ordinaires.

Relancer la détection des locuteurs dans Whisper Notes avec un nombre précis, puis exporter des SRT et VTT avec étiquettes

Relancer la détection avec le nombre exact de locuteurs. Le même menu exporte les SRT et VTT avec leurs étiquettes.

Corriger les interventions courtes

Une fois le nombre fixé, environ la moitié des erreurs restantes se trouvent dans des interventions de moins de trois secondes. Un extrait de deux secondes donne très peu de signal au modèle de représentation ; dans un échange rapide, son empreinte vocale capte aussi une partie de la voix voisine.

Après le regroupement, le pipeline réexamine donc chaque phrase de moins de 3.5 secondes. Il recalcule l’empreinte avec un masque couvrant exactement les trames de cette phrase, la compare à l’ancrage de chaque locuteur — la moyenne de ses interventions les plus longues — puis ne change l’étiquette que si l’écart est net. Le modèle existant est réutilisé ; aucun téléchargement supplémentaire n’est nécessaire.

Précision par phrase de bout en bout Avant correction Après
Cas difficile (nombre de locuteurs indiqué) 89.0% 94.8%
Podcast anglais (automatique) 98.5% 99.1%

Le seuil est volontairement prudent : sur les deux fichiers, le correcteur a changé 21 étiquettes sans introduire de nouvelle erreur.

Limites

• Les étiquettes apparaissent après la fin de l’enregistrement, pas pendant l’appel. Pour obtenir des sous-titres en direct avec le nom des locuteurs pendant une réunion, un service cloud comme Otter ou Notta est plus adapté.

• Quand deux personnes parlent en même temps, chaque phrase ne reçoit qu’une étiquette.

• Les voix proches restent difficiles. Le score de 94.8% obtenu sur notre fichier difficile est le plafond actuel avec le nombre de locuteurs indiqué, pas un problème résolu.

Disponibilité

L’identification des locuteurs est comprise dans l’achat unique de $6.99, avec les trois moteurs de transcription de l’app — Parakeet V3, Whisper Large V3 Turbo et SenseVoice — ainsi que l’édition locale par IA. Il n’y a ni formule distincte ni compte.

iPhone : App Store, version 1.8.5 ou ultérieure.

Mac App Store : version 1.3.2 ou ultérieure.

Téléchargement direct sur Mac (DMG) : version 1.5.1 ou ultérieure sur whispernotes.app, avec un essai gratuit.

Pour comprendre le fonctionnement de l’enregistrement de réunion, consultez notre article sur la transcription hors ligne des réunions.