Whisper Notes teraz rozpozná hovoriacich

28. júla 2026
·
8 min read
·Whisper Notes Team

Prepis hovorí, čo zaznelo. Pri rozhovoroch, poradách a podcastoch je rovnako dôležité vedieť, kto to povedal — v spracovaní reči sa táto úloha nazýva diarizácia hovoriacich. Od verzií iPhone 1.8.5, Mac App Store 1.3.2 a Mac DMG 1.5.1 vykonáva Whisper Notes diarizáciu kompletne v zariadení.

Vysvetlíme, ako funkcia pracuje, ukážeme výsledky benchmarku voči cloudovým referenčným dátam a opíšeme jeden náročný prípad, ktorý nevyriešila ani výmena modelu — vrátane nášho praktického riešenia.

Čo diarizácia robí

Otvorte poznámku — nahrávku, importovaný audio- či videosúbor alebo záznam porady — a ťuknite na tlačidlo hovoriacich. O niekoľko sekúnd bude mať každý odsek štítok hovoriaceho a časovú značku.

Lokálna diarizácia hovoriacich vo Whisper Notes pre Mac: prepis podcastu so štítkami hovoriacich a časovými značkami Štítky hovoriacich vo Whisper Notes pre iPhone: mená hovoriacich a časové značky v prepise

Štítky hovoriacich na Macu a iPhone. Ťuknutie na vetu presunie prehrávanie na daný okamih.

Štítky začínajú ako „Hovoriaci 1“ a „Hovoriaci 2“. Premenovanie jedného aktualizuje celý prepis. Ťuknutie na ľubovoľnú vetu presunie zvuk presne na jej začiatok, takže citát ľahko overíte podľa pôvodného hlasu.

Premenovanie hovoriaceho vo Whisper Notes aktualizuje štítok v celom prepise

Premenovanie hovoriaceho aktualizuje každý odsek poznámky.

Pri záznamoch porád sa rozpoznanie hovoriacich spúšťa automaticky po skončení hovoru; v Nastaveniach ho možno vypnúť. Štítky zostanú aj pri exporte: Kopírovať prepis s hovoriacimi ich prenesie do schránky a súbory SRT a VTT ich zachovajú v titulkoch.

Diarizácia pracuje s hlasmi, nie so slovami, preto sa správa rovnako vo viac ako 100 jazykoch, ktoré aplikácia dokáže prepisovať.

Model 19 MB na Neural Engine

Diarizácia odpovedá na otázku „kto kedy hovoril“ v troch krokoch. Zvuk sa rozdelí na úseky s rečou. Každý úsek sa prevedie na hlasový odtlačok — kompaktný vektor opisujúci hlas, nie slová. Odtlačky sa potom zoskupia: úseky v rovnakom zhluku dostanú rovnaký štítok.

Whisper Notes používa pipeline pyannote community-1 prevedenú do Core ML, takže oba kroky bežia na Neural Engine. Jednorazovo sťahovaný model má 19 MB a konverzáciu dlhú 5.7 minúty spracuje Mac radu M za 2–4 sekundy.

Zvuk → úseky reči → hlasové odtlačky → zhluky → štítky

Každý krok prebieha v zariadení.

Pri diarizácii je to obzvlášť dôležité. Hlasový odtlačok je biometrický údaj — človeka identifikuje podobne ako odtlačok prsta. Pri lokálnom spracovaní sa odtlačky vás, kolegov aj účastníkov rozhovoru vypočítajú, zoskupia a zahodia v zariadení. Nikam sa neposielajú.

Čo sme merali

Pre diarizáciu používame stály benchmark s dvoma súbormi. Referenčné dáta vytvára cloudová služba ASR a diarizácie ElevenLabs a následne ich ručne kontrolujeme. Hodnotenie priradí každých 10 ms reči hovoriacemu a zvolí najlepšie mapovanie výstupu na referenciu. Dva súbory sú malá vzorka, preto čísla berieme ako orientačné, nie definitívne.

Prvý súbor predstavuje bežný prípad: päťminútový anglický podcast, dvaja ľudia s jasne odlišnými hlasmi. Tak vyzerá väčšina rozhovorov, podcastov a porád medzi dvoma ľuďmi.

Anglický podcast s dvoma hovoriacimi (5 min) Výsledok
Priradenie po snímkach (rozlíšenie 10 ms) 96.7%
Presnosť viet (to, čo čítate) 99.1%
Čas spracovania, Neural Engine radu M 2–4 s

Zvyšných 0.9% tvoria tri posuny hraníc s celkovou dĺžkou 3.4 sekundy, čo zodpovedá rozlíšeniu samotnej referencie. Pri takomto materiáli sa lokálny výsledok vyrovná cloudovej službe, ktorá vytvorila referenčné dáta.

Náročný prípad

Druhý súbor je zámerne náročný: dva podobné mužské hlasy v miestnosti s ozvenou a moderátor, ktorý 19-krát vstúpi do reči, priemerne na 2.3 sekundy. Hosť hovorí 272 sekúnd, moderátor 43. Práve tento akustický profil spôsobuje zlyhanie diarizácie v akomkoľvek jazyku: podobné hlasy sa striedajú v krátkych replikách.

Automatické zhlukovanie tu zlyhá. Dva hlasové odtlačky sú tak blízko, že ich algoritmus zlúči a takmer celý rozhovor priradí jedinému štítku. Nahrávka je zhodou okolností čínsky rozhovor, čo nám umožnilo otestovať zrejmú hypotézu — či jazykovo špecializovaný model dosiahne lepší výsledok. Cez CPU pipeline sme spustili dva modely natrénované priamo na čínskej reči:

Model Anglický podcast Náročný prípad* Čas (audio 5.7 min)
pyannote community-1 (náš, Neural Engine) 96.7% 81–82% 2–4 s
CAM++ (trénovaný na čínštine, CPU) 93.9% 81.2% 36–103 s
ERes2NetV2 (trénovaný na čínštine, CPU) 80.5% 220–290 s

* Priradenie po snímkach pri náročnom súbore so zadaným počtom hovoriacich. Bez neho všetky modely smerujú k jedinému hovoriacemu.

Oba modely zlyhajú rovnako, hoci potrebujú 10–100-krát viac výpočtov. Náročnosť je akustická, nie jazyková — limitom je to, čo súčasné hlasové embeddingy dokážu rozlíšiť v akomkoľvek jazyku.

Pipeline sme teda dodali údaj, ktorý nedokáže spoľahlivo odvodiť: počet ľudí v miestnosti. Keď v ponuke zadáte 2 až 6 hovoriacich, presnosť viet v náročnom súbore po zlyhaní stúpne na 89%. Automatická detekcia zostáva predvolená, pretože pri bežných nahrávkach funguje správne.

Opakované rozpoznanie hovoriacich vo Whisper Notes so zadaným počtom a export SRT a VTT so štítkami

Opakované rozpoznanie s presným počtom hovoriacich. Rovnaká ponuka exportuje SRT a VTT so štítkami.

Spresnenie krátkych vstupov

Po zadaní počtu hovoriacich sa približne polovica zvyšných chýb týkala vstupov kratších než tri sekundy. Dvojsekundový úsek dáva modelu embeddingov málo signálu a pri rýchlom striedaní reči hlasový odtlačok zachytí aj časť susedného hovoriaceho.

Po zhlukovaní preto pipeline opäť preverí každú vetu kratšiu než 3.5 sekundy: prepočíta odtlačok s maskou presne nad snímkami danej vety, porovná ho s kotvou každého hovoriaceho — priemerom jeho najdlhších vstupov — a štítok zmení len pri jasnej prevahe. Používa rovnaký model, nič ďalšie sa nesťahuje.

Konečná presnosť viet Pred spresnením Po spresnení
Náročný prípad (počet zadaný) 89.0% 94.8%
Anglický podcast (automaticky) 98.5% 99.1%

Prahová hodnota je konzervatívna: v dvoch súboroch spresnenie zmenilo 21 štítkov a nevytvorilo žiadnu novú chybu.

Obmedzenia

• Štítky sa zobrazia až po skončení nahrávania, nie počas hovoru. Ak potrebujete živé titulky s menami hovoriacich ešte počas porady, vhodnejšia je cloudová služba ako Otter alebo Notta.

• Prekrývajúca sa reč dostane jeden štítok na vetu.

• Podobné hlasy zostávajú náročné. 94.8% v našom náročnom súbore je súčasný strop pri zadanom počte hovoriacich, nie vyriešený problém.

Dostupnosť

Rozpoznanie hovoriacich je súčasťou jednorazového nákupu za $6.99 spolu s troma prepisovacími enginmi — Parakeet V3, Whisper Large V3 Turbo a SenseVoice — a lokálnymi úpravami pomocou AI. Neexistuje osobitný tarif ani účet.

iPhone: App Store, verzia 1.8.5 alebo novšia.

Mac App Store: verzia 1.3.2 alebo novšia.

Priame stiahnutie pre Mac (DMG): verzia 1.5.1 alebo novšia z whispernotes.app, s bezplatnou skúšobnou verziou.

Ako funguje samotné nahrávanie porád, opisuje náš článok o offline prepise porád.