Whisper Notes kan nu identifiera talare

28 juli 2026
·
8 min read
·Whisper Notes Team

Ett transkript visar vad som sades. För intervjuer, möten och poddar är det lika viktigt att veta vem som sade det — problemet kallas talardiarisering. Från iPhone 1.8.5, Mac App Store 1.3.2 och Mac DMG 1.5.1 kör Whisper Notes hela diariseringsflödet på enheten.

Här förklarar vi hur det fungerar, redovisar benchmarkresultat mot molnbaserad referensdata och beskriver ett svårt fall som inte gick att lösa genom att bara byta modell — samt vad vi gjorde i stället.

Vad funktionen gör

Öppna en anteckning — en inspelning, en importerad ljud- eller videofil eller en mötesinspelning — och tryck på talarknappen. Några sekunder senare har varje stycke en talaretikett och tidsstämpel.

Lokal talardiarisering i Whisper Notes för Mac: ett poddtranskript med talaretiketter och tidsstämplar Talaretiketter i Whisper Notes för iPhone: talarnamn och tidsstämplar i transkriptet

Talaretiketter på Mac och iPhone. Tryck på en mening för att flytta uppspelningen dit.

Etiketterna börjar som ”Talare 1” och ”Talare 2”. Byter du namn på en etikett uppdateras hela transkriptet. Ett tryck på valfri mening flyttar ljudet till exakt rätt ögonblick, så att ett citat enkelt kan kontrolleras mot originalrösten.

Byt namn på en talare i Whisper Notes och uppdatera etiketten i hela transkriptet

När en talare döps om uppdateras varje stycke i anteckningen.

För mötesinspelningar körs talaridentifieringen automatiskt när samtalet är slut; det kan stängas av i Inställningar. Etiketterna följer med vid export: Kopiera transkript med talare tar dem till urklipp, och SRT- och VTT-filer behåller dem i undertexterna.

Diarisering analyserar röster, inte ord, och fungerar därför likadant för de över 100 språk som appen kan transkribera.

En 19 MB-modell på Neural Engine

Diarisering svarar på frågan ”vem talade när” i tre steg. Ljudet delas i segment med tal. Varje segment omvandlas till ett röstavtryck — en kompakt vektor som beskriver rösten, inte orden. Sedan grupperas avtrycken: segment i samma kluster får samma etikett.

Whisper Notes använder pyannote community-1, konverterad till Core ML så att båda stegen körs på Neural Engine. Engångsnedladdningen är 19 MB, och ett samtal på 5.7 minuter tar 2–4 sekunder på en Mac i M-serien.

Ljud → talsegment → röstavtryck → kluster → etiketter

Varje steg körs på enheten.

Det är särskilt viktigt för diarisering. Ett röstavtryck är biometriskt — det identifierar en person på samma sätt som ett fingeravtryck. Med lokal bearbetning beräknas, grupperas och raderas röstavtrycken för dig, dina kollegor och intervjupersoner på enheten. De skickas aldrig någonstans.

Vad vi mätte

Vi använder ett fast diariseringsbenchmark med två filer. Referensen kommer från ElevenLabs molntjänst för ASR och diarisering och kontrolleras manuellt. Mätningen tilldelar varje 10 ms tal till en talare och väljer den bästa mappningen mellan resultat och referens. Två filer är ett litet urval, så siffrorna är vägledande, inte slutgiltiga.

Den första filen är ett vanligt fall: en fem minuter lång engelsk podd med två tydligt olika röster. De flesta intervjuer, poddar och enskilda möten liknar detta.

Engelsk podd med två talare (5 min)Resultat
Tilldelning per bildruta (10 ms upplösning)96.7%
Meningsprecision (det du läser)99.1%
Bearbetningstid, Neural Engine i M-serien2–4 s

Återstående 0.9% är tre gränsförskjutningar på totalt 3.4 sekunder, vilket ligger inom referensens egen upplösning. För den här typen av material matchar det lokala resultatet molntjänsten som skapade referensen.

Det svåra fallet

Den andra filen är avsiktligt svår: två liknande mansröster i ett rum med efterklang och en programledare som avbryter 19 gånger, i genomsnitt 2.3 sekunder åt gången. Gästen talar i 272 sekunder, programledaren i 43. Det här är den akustiska profil som får talardiarisering att misslyckas på alla språk: liknande röster som turas om i korta inlägg.

Automatisk klustring kollapsar här. Röstavtrycken ligger så nära varandra att algoritmen slår ihop dem och ger nästan hela samtalet en etikett. Inspelningen råkar vara en kinesisk intervju, vilket lät oss pröva den uppenbara hypotesen — att en språkspecialiserad modell skulle fungera bättre. Vi körde två talarmodeller tränade specifikt på kinesiskt tal i en CPU-pipeline:

ModellEngelsk poddSvårt fall*Tid (5.7 min ljud)
pyannote community-1 (vår, Neural Engine)96.7%81–82%2–4 s
CAM++ (tränad på kinesiska, CPU)93.9%81.2%36–103 s
ERes2NetV2 (tränad på kinesiska, CPU)80.5%220–290 s

* Tilldelning per bildruta på den svåra filen med angivet antal talare. Utan det går alla modeller mot en enda talare.

Båda modellerna kollapsar på samma sätt trots 10–100 gånger mer beräkning. Svårigheten är akustisk, inte språklig — gränsen går vid vad dagens röstembeddingar kan skilja åt, på vilket språk som helst.

Vi gav därför flödet ett faktum som det inte kan härleda säkert: hur många personer som finns i rummet. Med 2 till 6 talare angivna i menyn går den svåra filen från kollaps till 89% meningsprecision. Automatisk identifiering är fortfarande standard eftersom den fungerar för typiskt material.

Kör talaridentifiering igen i Whisper Notes med exakt antal talare och exportera SRT och VTT med etiketter

Kör identifieringen igen med exakt antal talare. Samma meny exporterar SRT och VTT med talaretiketter.

Förfining av korta inpass

När antalet talare var fast låg ungefär hälften av de återstående felen i inpass under tre sekunder. Ett tvåsekundersklipp ger embeddingmodellen lite signal, och i snabba samtal tar röstavtrycket med en del av den intilliggande talaren.

Efter klustringen granskar flödet därför varje mening kortare än 3.5 sekunder igen: det räknar om röstavtrycket med en mask över exakt meningens bildrutor, jämför det med varje talares ankare — genomsnittet av personens längsta turer — och byter bara etikett när marginalen är tydlig. Samma modell återanvänds; ingen extra nedladdning behövs.

Slutlig meningsprecisionFöre förfiningEfter
Svårt fall (antal angivet)89.0%94.8%
Engelsk podd (automatiskt)98.5%99.1%

Tröskeln är försiktig: förfiningen ändrade 21 etiketter i de två filerna och införde inga nya fel.

Begränsningar

• Etiketterna visas efter att inspelningen avslutats, inte under samtalet. För livetextning med talarnamn medan mötet pågår passar en molntjänst som Otter eller Notta bättre.

• Överlappande tal får en etikett per mening.

• Liknande röster är fortfarande svåra. 94.8% i vår svåra fil är dagens tak med angivet talarantal, inte ett löst problem.

Tillgänglighet

Talaridentifiering ingår i engångsköpet på $6.99 tillsammans med appens tre transkriberingsmotorer — Parakeet V3, Whisper Large V3 Turbo och SenseVoice — samt lokal AI-redigering. Det finns ingen separat nivå och inget konto.

iPhone: App Store, version 1.8.5 eller senare.

Mac App Store: version 1.3.2 eller senare.

Direktnedladdning för Mac (DMG): version 1.5.1 eller senare från whispernotes.app, med gratis provperiod.

Hur själva mötesinspelningen fungerar beskrivs i vårt inlägg om offline-transkribering av möten.