Whisper Notes nyní rozpozná mluvčí

28. července 2026
·
8 min read
·Whisper Notes Team

Přepis říká, co zaznělo. U rozhovorů, schůzek a podcastů je stejně důležité vědět, kdo to řekl — v oboru zpracování řeči se tomu říká diarizace mluvčích. Od verzí iPhone 1.8.5, Mac App Store 1.3.2 a Mac DMG 1.5.1 provádí Whisper Notes diarizaci kompletně v zařízení.

Vysvětlíme, jak funkce pracuje, ukážeme výsledky benchmarku proti cloudovým referenčním datům a popíšeme jeden obtížný případ, který nevyřešila ani výměna modelu — včetně našeho praktického řešení.

Co diarizace dělá

Otevřete poznámku — nahrávku, importovaný audio- či videosoubor nebo záznam schůzky — a klepněte na tlačítko mluvčích. Za několik sekund bude mít každý odstavec štítek mluvčího a časovou značku.

Lokální diarizace mluvčích ve Whisper Notes pro Mac: přepis podcastu se štítky mluvčích a časovými značkami Štítky mluvčích ve Whisper Notes pro iPhone: jména mluvčích a časové značky v přepisu

Štítky mluvčích na Macu a iPhonu. Klepnutí na větu přesune přehrávání na daný okamžik.

Štítky začínají jako „Mluvčí 1“ a „Mluvčí 2“. Přejmenování jednoho aktualizuje celý přepis. Klepnutí na libovolnou větu přesune zvuk přesně na její začátek, takže citaci snadno ověříte proti původnímu hlasu.

Přejmenování mluvčího ve Whisper Notes aktualizuje štítek v celém přepisu

Přejmenování mluvčího aktualizuje každý odstavec poznámky.

U záznamů schůzek se rozpoznání mluvčích spouští automaticky po skončení hovoru; v Nastavení ho lze vypnout. Štítky zůstanou i při exportu: Kopírovat přepis s mluvčími je přenese do schránky a soubory SRT a VTT je zachovají v titulcích.

Diarizace pracuje s hlasy, nikoli se slovy, proto se chová stejně ve více než 100 jazycích, které aplikace umí přepisovat.

Model 19 MB na Neural Engine

Diarizace odpovídá na otázku „kdo kdy mluvil“ ve třech krocích. Zvuk se rozdělí na úseky s řečí. Každý úsek se převede na hlasový otisk — kompaktní vektor popisující hlas, ne slova. Otisky se pak seskupí: úseky ve stejném shluku dostanou stejný štítek.

Whisper Notes používá pipeline pyannote community-1 převedenou do Core ML, takže oba kroky běží na Neural Engine. Jednorázově stahovaný model má 19 MB a konverzaci dlouhou 5.7 minuty zpracuje Mac řady M za 2–4 sekundy.

Zvuk → úseky řeči → hlasové otisky → shluky → štítky

Každý krok probíhá v zařízení.

U diarizace je to obzvlášť důležité. Hlasový otisk je biometrický údaj — člověka identifikuje podobně jako otisk prstu. Při lokálním zpracování se otisky vás, kolegů i účastníků rozhovoru vypočítají, seskupí a zahodí v zařízení. Nikam se neodesílají.

Co jsme měřili

Pro diarizaci používáme stálý benchmark se dvěma soubory. Referenční data vytváří cloudová služba ASR a diarizace ElevenLabs a následně je ručně kontrolujeme. Hodnocení přiřadí každých 10 ms řeči mluvčímu a zvolí nejlepší mapování výstupu na referenci. Dva soubory jsou malý vzorek, proto čísla bereme jako orientační, ne definitivní.

První soubor představuje běžný případ: pětiminutový anglický podcast, dva lidé s jasně odlišnými hlasy. Tak vypadá většina rozhovorů, podcastů a schůzek jeden na jednoho.

Anglický podcast se dvěma mluvčími (5 min) Výsledek
Přiřazení po snímcích (rozlišení 10 ms) 96.7%
Přesnost vět (to, co čtete) 99.1%
Doba zpracování, Neural Engine řady M 2–4 s

Zbývajících 0.9% tvoří tři posuny hranic o celkové délce 3.4 sekundy, což odpovídá rozlišení samotné reference. U takového materiálu se lokální výsledek vyrovná cloudové službě, která vytvořila referenční data.

Obtížný případ

Druhý soubor je záměrně obtížný: dva podobné mužské hlasy v místnosti s ozvěnou a moderátor, který 19krát vstoupí do řeči, průměrně na 2.3 sekundy. Host mluví 272 sekund, moderátor 43. Právě tento akustický profil způsobuje selhání diarizace v jakémkoli jazyce: podobné hlasy se střídají v krátkých replikách.

Automatické shlukování zde selže. Dva hlasové otisky jsou tak blízko, že je algoritmus sloučí a téměř celý rozhovor přiřadí jedinému štítku. Nahrávka je shodou okolností čínský rozhovor, což nám umožnilo otestovat zřejmou hypotézu — zda jazykově specializovaný model dosáhne lepšího výsledku. Přes CPU pipeline jsme spustili dva modely vytrénované přímo na čínské řeči:

Model Anglický podcast Obtížný případ* Čas (audio 5.7 min)
pyannote community-1 (náš, Neural Engine) 96.7% 81–82% 2–4 s
CAM++ (trénovaný na čínštině, CPU) 93.9% 81.2% 36–103 s
ERes2NetV2 (trénovaný na čínštině, CPU) 80.5% 220–290 s

* Přiřazení po snímcích u obtížného souboru při zadaném počtu mluvčích. Bez něj všechny modely směřují k jedinému mluvčímu.

Oba modely selžou stejně, přestože potřebují 10–100krát více výpočtů. Obtíž je akustická, ne jazyková — limitem je to, co současné hlasové embeddingy dokážou rozlišit v jakémkoli jazyce.

Dodali jsme tedy pipeline údaj, který nedokáže spolehlivě odvodit: počet lidí v místnosti. Když v nabídce zadáte 2 až 6 mluvčích, přesnost vět v obtížném souboru po selhání stoupne na 89%. Automatická detekce zůstává výchozí, protože u běžných nahrávek funguje správně.

Opakované rozpoznání mluvčích ve Whisper Notes se zadaným počtem a export SRT a VTT se štítky

Opakované rozpoznání s přesným počtem mluvčích. Stejná nabídka exportuje SRT a VTT se štítky.

Zpřesnění krátkých vstupů

Po zadání počtu mluvčích se přibližně polovina zbývajících chyb týkala vstupů kratších než tři sekundy. Dvousekundový úsek dává modelu embeddingů málo signálu a při rychlém střídání řeči hlasový otisk zachytí i část sousedního mluvčího.

Po shlukování proto pipeline znovu prověří každou větu kratší než 3.5 sekundy: přepočítá otisk s maskou přesně nad snímky dané věty, porovná jej s kotvou každého mluvčího — průměrem jeho nejdelších vstupů — a štítek změní jen při jasné převaze. Používá stejný model, nic dalšího se nestahuje.

Konečná přesnost vět Před zpřesněním Po zpřesnění
Obtížný případ (počet zadán) 89.0% 94.8%
Anglický podcast (automaticky) 98.5% 99.1%

Prahová hodnota je konzervativní: ve dvou souborech zpřesnění změnilo 21 štítků a nevneslo žádnou novou chybu.

Omezení

• Štítky se objeví až po skončení nahrávání, ne během hovoru. Pokud potřebujete živé titulky se jmény mluvčích ještě během schůzky, vhodnější je cloudová služba jako Otter nebo Notta.

• Překrývající se řeč dostane jeden štítek na větu.

• Podobné hlasy zůstávají obtížné. 94.8% v našem náročném souboru je současný strop při zadaném počtu mluvčích, ne vyřešený problém.

Dostupnost

Rozpoznání mluvčích je součástí jednorázového nákupu za $6.99 spolu se třemi přepisovacími enginy — Parakeet V3, Whisper Large V3 Turbo a SenseVoice — a lokálními úpravami pomocí AI. Neexistuje zvláštní tarif ani účet.

iPhone: App Store, verze 1.8.5 nebo novější.

Mac App Store: verze 1.3.2 nebo novější.

Přímé stažení pro Mac (DMG): verze 1.5.1 nebo novější z whispernotes.app, s bezplatnou zkušební verzí.

Jak funguje samotné nahrávání schůzek, popisuje náš článek o offline přepisu schůzek.