Whisper Notes тепер визначає мовців

28 липня 2026 р.
·
8 min read
·Whisper Notes Team

Транскрипція показує, що було сказано. Для інтерв'ю, зустрічей і подкастів не менш важливо знати, хто саме це сказав. У дослідженнях мовлення це називають діаризацією мовців. Починаючи з версій iPhone 1.8.5, Mac App Store 1.3.2 і Mac DMG 1.5.1, Whisper Notes виконує діаризацію повністю на пристрої.

Нижче пояснюємо, як це працює, наводимо результати тесту з хмарною еталонною розміткою та описуємо один складний випадок, який не вдалося усунути заміною моделі, — і наше практичне рішення.

Що робить діаризація

Відкрийте нотатку — запис, імпортований аудіо- чи відеофайл або запис зустрічі — і натисніть кнопку мовців. За кілька секунд кожен абзац матиме мітку мовця та часову позначку.

Локальна діаризація мовців у Whisper Notes для Mac: транскрипція подкасту з мітками мовців і часовими позначками Мітки мовців у Whisper Notes для iPhone: імена та часові позначки в транскрипції

Мітки мовців на Mac та iPhone. Дотик до речення переводить відтворення на потрібний момент.

Спочатку мітки мають назви «Мовець 1» і «Мовець 2». Перейменування однієї з них оновлює всю транскрипцію. Дотик до будь-якого речення одразу переводить аудіо на відповідний момент, тож цитату легко звірити з оригінальним голосом.

Перейменування мовця у Whisper Notes: мітка оновлюється в усій транскрипції

Після перейменування мітка змінюється в кожному абзаці нотатки.

Для записів зустрічей розпізнавання мовців запускається автоматично після завершення дзвінка; це можна вимкнути в налаштуваннях. Мітки зберігаються під час експорту: команда Копіювати транскрипцію з мовцями переносить їх у буфер обміну, а файли SRT і VTT — у субтитри.

Діаризація аналізує голоси, а не слова, тому однаково працює для понад 100 мов, які застосунок може транскрибувати.

Модель 19 MB на Neural Engine

Діаризація відповідає на запитання «хто й коли говорив» у три кроки. Аудіо ділиться на фрагменти з мовленням. Кожен фрагмент перетворюється на голосовий відбиток — компактний вектор, що описує сам голос, а не слова. Потім відбитки кластеризуються: фрагменти в одному кластері отримують ту саму мітку.

Whisper Notes використовує конвеєр pyannote community-1, перетворений на Core ML, тому обидва етапи працюють на Neural Engine. Модель завантажується один раз і займає 19 MB; розмова тривалістю 5.7 хвилини обробляється на Mac із чипом серії M за 2–4 секунди.

Аудіо → фрагменти мовлення → голосові відбитки → кластери → мітки

Кожен крок виконується на пристрої.

Для діаризації це особливо важливо. Голосовий відбиток є біометричною ознакою: він ідентифікує людину подібно до відбитка пальця. За локальної обробки відбитки ваші, колег та учасників інтерв'ю обчислюються, групуються й видаляються на пристрої. Вони нікуди не надсилаються.

Що ми вимірювали

Для діаризації ми використовуємо незмінний тест із двох файлів. Еталонну розмітку створює хмарний сервіс розпізнавання мовлення та діаризації ElevenLabs, після чого ми перевіряємо її вручну. Під час оцінювання кожні 10 ms мовлення відносяться до мовця й вибирається найкраще зіставлення результату з еталоном. Два файли — мала вибірка, тому цифри показують орієнтир, а не остаточний висновок.

Перший файл відтворює типовий сценарій: п'ятихвилинний англомовний подкаст, двоє людей із добре відмінними голосами. Так звучить більшість інтерв'ю, подкастів і зустрічей один на один.

Англійський подкаст із двома мовцями (5 хв) Результат
Точність на рівні кадрів (крок 10 ms) 96.7%
Точність на рівні речень (те, що читає користувач) 99.1%
Час обробки на Neural Engine серії M 2–4 с

Решта 0.9% — три зсуви меж загальною тривалістю 3.4 секунди, тобто в межах роздільності самої еталонної розмітки. На такому матеріалі локальний результат відповідає хмарному сервісу, який створив еталон.

Складний випадок

Другий файл навмисно складний: два схожі чоловічі голоси в кімнаті з реверберацією та ведучий, який перебиває гостя 19 разів — у середньому на 2.3 секунди. Гість говорить 272 секунди, ведучий — 43. Саме такий акустичний профіль ламає діаризацію будь-якою мовою: схожі голоси обмінюються короткими репліками.

Автоматична кластеризація тут схлопується. Голосові відбитки настільки близькі, що алгоритм об'єднує їх і призначає майже всю розмову одній мітці. Запис випадково виявився китайським інтерв'ю, що дало змогу перевірити очевидну гіпотезу: модель, спеціалізована для певної мови, спрацює краще. Через конвеєр CPU ми запустили дві моделі, спеціально навчені на китайському мовленні:

Модель Англійський подкаст Складний випадок* Час (аудіо 5.7 хв)
pyannote community-1 (наша модель, Neural Engine) 96.7% 81–82% 2–4 с
CAM++ (навчена китайською, CPU) 93.9% 81.2% 36–103 с
ERes2NetV2 (навчена китайською, CPU) 80.5% 220–290 с

* Покадрова точність на складному файлі із заданою кількістю мовців. Без неї всі моделі сходяться до одного мовця.

Обидві моделі схлопуються однаково, хоча потребують у 10–100 разів більше обчислень. Складність акустична, а не мовна — межу визначає те, що сучасні голосові ембеддинги можуть розрізнити будь-якою мовою.

Тому ми дали конвеєру факт, який він не може надійно вивести сам: кількість людей у кімнаті. Якщо в меню вказати від 2 до 6 мовців, точність речень у складному файлі після схлопування піднімається до 89%. Для звичайних записів типовим лишається автоматичне визначення.

Повторне визначення мовців у Whisper Notes із точною кількістю та експорт SRT і VTT з мітками

Повторний запуск із точною кількістю мовців. У тому самому меню експортуються SRT і VTT з мітками.

Уточнення коротких реплік

Після фіксації кількості мовців приблизно половина решти помилок припала на репліки коротші за три секунди. У двосекундному фрагменті моделі ембеддингів бракує сигналу, а під час швидкої розмови голосовий відбиток захоплює частину сусіднього мовця.

Після кластеризації конвеєр повторно перевіряє кожне речення коротше за 3.5 секунди: знову обчислює голосовий відбиток за маскою, яка точно охоплює кадри речення, порівнює його з опорним відбитком кожного мовця — середнім за його найдовшими репліками — і змінює мітку лише за переконливої переваги. Використовується та сама модель, додаткового завантаження немає.

Підсумкова точність речень До уточнення Після
Складний випадок (кількість задано) 89.0% 94.8%
Англійський подкаст (автоматично) 98.5% 99.1%

Поріг обрано обережно: на двох файлах уточнення змінило 21 мітку й не внесло жодної нової помилки.

Обмеження

• Мітки з'являються після завершення запису, а не під час дзвінка. Якщо потрібні живі субтитри з іменами до завершення зустрічі, краще підійде хмарний сервіс на кшталт Otter або Notta.

• Під час одночасного мовлення кожному реченню призначається одна мітка.

• Схожі голоси лишаються складними. 94.8% на нашому важкому файлі — поточна межа із заданою кількістю мовців, а не розв'язана задача.

Доступність

Визначення мовців входить до разової покупки за $6.99 разом із трьома рушіями транскрипції — Parakeet V3, Whisper Large V3 Turbo і SenseVoice — та локальним AI-редагуванням. Окремого тарифу й облікового запису немає.

iPhone: App Store, версія 1.8.5 або новіша.

Mac App Store: версія 1.3.2 або новіша.

Пряме завантаження для Mac (DMG): версія 1.5.1 або новіша із сайту whispernotes.app, доступна безкоштовна пробна версія.

Як працює сам запис зустрічей, читайте в нашій статті про офлайн-транскрипцію зустрічей.