Whisper Notes ara identifica els parlants

28 de juliol de 2026
·
8 min read
·Whisper Notes Team

Una transcripció diu què s’ha dit. En entrevistes, reunions i pòdcasts, l’altra meitat de la feina és saber qui ho ha dit: en recerca de la parla, aquest problema s’anomena diarització de parlants. Des de les versions iPhone 1.8.5, Mac App Store 1.3.2 i Mac de descàrrega directa 1.5.1, Whisper Notes executa la diarització íntegrament al dispositiu.

En aquest article expliquem com funciona, publiquem els resultats del nostre benchmark davant d’una referència generada al núvol i descrivim l’únic cas d’error que no hem pogut eliminar amb enginyeria, juntament amb la solució que hi hem aplicat.

Què fa

Obre una nota — una gravació, un fitxer d’àudio o vídeo importat o una gravació de reunió — i toca el botó dels parlants. Uns segons després, cada paràgraf mostra una etiqueta de parlant i una marca de temps.

Diarització local de parlants a Whisper Notes per a Mac: transcripció d’un pòdcast amb etiquetes i marques de temps, processada al dispositiu Etiquetes de parlants a Whisper Notes per a iPhone: transcripció amb noms i marques de temps per a cada veu

Etiquetes de parlants al Mac i a l’iPhone. Toca una frase per moure la reproducció fins a aquell moment.

Les etiquetes comencen com a Parlant 1 i Parlant 2. Si en canvies el nom d’una, s’actualitza tota la transcripció. Toca qualsevol frase per portar la reproducció d’àudio al moment exacte; així pots contrastar una citació amb la veu original.

Canviar el nom d’un parlant a Whisper Notes actualitza l’etiqueta a tota la transcripció

Canviar el nom d’un parlant actualitza tots els paràgrafs de la nota.

A les gravacions de reunions, la identificació dels parlants s’executa automàticament quan s’acaba la trucada; es pot desactivar a la configuració. Les etiquetes es conserven en exportar: Copia la transcripció amb parlants les porta al porta-retalls, i els fitxers SRT i VTT les inclouen als subtítols.

La diarització treballa amb veus, no amb paraules. Per això es comporta igual en els més de 100 idiomes que l’app transcriu.

Un model de 19 MB al Neural Engine

La diarització respon «qui ha parlat i quan?» en tres passos. Primer divideix l’àudio en segments amb veu. Després converteix cada segment en una empremta vocal: un vector compacte que descriu la veu, no les paraules. Finalment, agrupa les empremtes; els segments del mateix grup reben la mateixa etiqueta.

Whisper Notes utilitza el pipeline community-1 de pyannote, convertit a Core ML perquè totes dues fases s’executin al Neural Engine. La descàrrega única ocupa 19 MB, i una conversa de 5.7 minuts triga entre 2 i 4 segons en un Mac amb xip de la sèrie M.

Àudio → segments amb veu → empremtes vocals → grups → etiquetes

Cada pas s’executa al dispositiu.

Això importa encara més per a la diarització que per a la transcripció. Una empremta vocal és una dada biomètrica: identifica una persona com ho fa una empremta dactilar. Amb el processament local, les empremtes de la teva veu, dels teus companys i de les persones que entrevistes es calculen, s’agrupen i s’eliminen al dispositiu. No s’envien mai enlloc.

Què hem mesurat

Mantenim un benchmark fix de dos fitxers per a la diarització. La referència prové d’un servei al núvol d’ASR i diarització (ElevenLabs), revisat manualment. La puntuació assigna cada 10 ms de parla a un parlant i tria la millor correspondència entre el resultat i la referència. Dos fitxers són una mostra petita: considerem aquestes xifres orientatives, no definitives.

El primer fitxer representa el cas habitual: un pòdcast en anglès de cinc minuts, amb dues veus clarament diferents. La majoria d’entrevistes, pòdcasts i reunions entre dues persones s’hi assemblen.

Pòdcast en anglès amb dos parlants (5 min) Resultat
Atribució per fotograma (resolució de 10 ms) 96.7%
Precisió per frase (allò que llegeixes) 99.1%
Temps de processament, Neural Engine de la sèrie M 2–4 s

El 0.9% restant correspon a tres oscil·lacions als límits de les frases que sumen 3.4 segons, dins la resolució de la referència mateixa. En aquest tipus de material, el resultat al dispositiu iguala el servei al núvol que ha generat la referència.

El cas difícil

El segon fitxer és difícil expressament: dues veus masculines semblants en una sala amb reverberació i un presentador que intervé 19 vegades, durant una mitjana de 2.3 segons cada cop. El convidat parla 272 segons; el presentador, 43. Aquest és el perfil acústic que fa fallar la diarització en qualsevol idioma: veus semblants que alternen intervencions breus.

Aquí, l’agrupament automàtic col·lapsa. Les dues empremtes vocals són tan properes que l’algoritme les fusiona i assigna gairebé tota la conversa a una sola etiqueta. Resulta que l’enregistrament és un programa d’entrevistes en xinès, cosa que ens va permetre provar la hipòtesi evident: que un model especialitzat en l’idioma funcionaria millor. Per això vam executar, en un pipeline de CPU, dos models de parlants entrenats específicament amb parla xinesa:

Model Pòdcast en anglès Cas difícil* Temps (àudio de 5.7 min)
pyannote community-1 (el nostre, Neural Engine) 96.7% 81–82% 2–4 s
CAM++ (entrenat en xinès, CPU) 93.9% 81.2% 36–103 s
ERes2NetV2 (entrenat en xinès, CPU) 80.5% 220–290 s

* Atribució per fotograma en el fitxer difícil amb el nombre de parlants indicat. Sense aquesta dada, tots els models col·lapsen cap a un sol parlant.

Tots dos col·lapsen de la mateixa manera i requereixen entre 10 i 100 vegades més càlcul. La dificultat és acústica, no lingüística: el límit és allò que les representacions vocals actuals poden distingir, en qualsevol idioma.

Això va descartar la solució òbvia i en va assenyalar una altra: donar al pipeline una dada que no pot inferir, el nombre de persones que hi ha a la sala. Quan s’indica el nombre (una opció del menú entre 2 i 6), el fitxer difícil passa del col·lapse a un 89% de precisió per frase. La detecció automàtica continua sent l’opció per defecte, perquè encerta amb el material habitual.

Tornar a executar la detecció de parlants a Whisper Notes amb un nombre concret i exportar SRT i VTT amb etiquetes

Repetir la detecció amb el nombre exacte de parlants. El mateix menú exporta SRT i VTT amb les etiquetes.

Corregir les intervencions breus

Amb el nombre fixat, prop de la meitat dels errors restants es trobava en intervencions de menys de tres segons. Un fragment de dos segons dona molt poc senyal al model de representació; en intercanvis ràpids, la seva empremta també absorbeix part de la veu del parlant adjacent.

Després de l’agrupament, el pipeline torna a examinar cada frase de menys de 3.5 segons. Recalcula l’empremta amb una màscara que cobreix exactament els fotogrames d’aquella frase, la compara amb l’ancoratge de cada parlant — la mitjana de les seves intervencions més llargues — i només canvia l’etiqueta quan el marge és concloent. Es reutilitza el model existent; no cal cap descàrrega addicional.

Precisió per frase d’extrem a extrem Abans de la correcció Després
Cas difícil (nombre de parlants indicat) 89.0% 94.8%
Pòdcast en anglès (automàtic) 98.5% 99.1%

El llindar és conservador: entre tots dos fitxers, el corrector va canviar 21 etiquetes sense introduir cap error nou.

Limitacions

• Les etiquetes apareixen quan s’acaba la gravació, no durant la trucada. Si necessites subtítols en directe amb els noms dels parlants mentre la reunió encara està en curs, un servei al núvol com Otter o Notta és l’eina adequada.

• Quan dues persones parlen alhora, cada frase rep una sola etiqueta.

• Les veus semblants continuen sent difícils. El 94.8% del nostre fitxer difícil és el límit actual amb el nombre de parlants indicat, no un problema resolt.

Disponibilitat

La identificació de parlants està inclosa en la compra única de $6.99, juntament amb els tres motors de transcripció de l’app — Parakeet V3, Whisper Large V3 Turbo i SenseVoice — i l’edició local amb IA. No hi ha cap pla a part ni cal tenir un compte.

iPhone: App Store, versió 1.8.5 o posterior.

Mac App Store: versió 1.3.2 o posterior.

Descàrrega directa per a Mac (DMG): versió 1.5.1 o posterior a whispernotes.app, amb una prova gratuïta.

Per saber com funciona la gravació de reunions, llegeix el nostre article sobre transcripció offline de reunions.