Whisper Notes artık konuşmacıları tanımlıyor

28 Temmuz 2026
·
8 min read
·Whisper Notes Team

Transkript ne söylendiğini gösterir. Röportaj, toplantı ve podcast'lerde kimin söylediğini bilmek de işin diğer yarısıdır; konuşma araştırmalarında buna konuşmacı diarizasyonu denir. iPhone 1.8.5, Mac App Store 1.3.2 ve Mac DMG 1.5.1 sürümlerinden itibaren Whisper Notes diarizasyonu tamamen cihaz üzerinde çalıştırıyor.

Nasıl çalıştığını açıklıyor, bulutta oluşturulan referans veriye karşı benchmark sonuçlarını paylaşıyor ve yalnızca model değiştirerek gideremediğimiz bir zor örneği, bunun için geliştirdiğimiz pratik çözümle birlikte anlatıyoruz.

Ne yapıyor

Bir notu — kayıt, içe aktarılan ses veya video dosyası ya da toplantı kaydı — açıp konuşmacılar düğmesine dokunun. Birkaç saniye sonra her paragrafta konuşmacı etiketi ve zaman damgası görünür.

Mac için Whisper Notes'ta cihaz üzerinde konuşmacı diarizasyonu: konuşmacı etiketli ve zaman damgalı podcast transkripti iPhone için Whisper Notes'ta konuşmacı etiketleri: transkriptte konuşmacı adları ve zaman damgaları

Mac ve iPhone'da konuşmacı etiketleri. Bir cümleye dokununca oynatma o ana gider.

Etiketler önce “Konuşmacı 1” ve “Konuşmacı 2” olarak görünür. Birini yeniden adlandırmak tüm transkripti günceller. Herhangi bir cümleye dokunmak sesi tam o ana götürür; böylece bir alıntıyı özgün sesle kolayca karşılaştırabilirsiniz.

Whisper Notes'ta konuşmacıyı yeniden adlandırma: etiket tüm transkriptte güncellenir

Konuşmacıyı yeniden adlandırmak nottaki her paragrafı günceller.

Toplantı kayıtlarında konuşmacı tanıma, görüşme bitince otomatik çalışır; Ayarlar'dan kapatılabilir. Etiketler dışa aktarımda korunur: Konuşmacılarla Transkripti Kopyala panoya, SRT ve VTT dosyaları ise altyazılara taşır.

Diarizasyon sözcükleri değil sesleri işler; bu nedenle uygulamanın yazıya döktüğü 100'den fazla dilde aynı şekilde çalışır.

Neural Engine'de 19 MB model

Diarizasyon “kim ne zaman konuştu” sorusunu üç adımda yanıtlar. Ses, konuşma bölümlerine ayrılır. Her bölüm, sözcükleri değil sesin kendisini tanımlayan küçük bir vektöre, yani ses izine dönüştürülür. Sonra ses izleri kümelenir; aynı kümeye düşen bölümler aynı etiketi alır.

Whisper Notes, iki aşamanın da Neural Engine'de çalışması için Core ML'e dönüştürülmüş pyannote community-1 hattını kullanır. Tek seferlik indirme 19 MB'dir; 5.7 dakikalık bir konuşma M serisi Mac'te 2–4 saniye sürer.

Ses → konuşma bölümleri → ses izleri → kümeler → etiketler

Her adım cihazda çalışır.

Bu, diarizasyonda özellikle önemlidir. Ses izi biyometriktir; kişiyi parmak izi gibi tanımlar. Yerel işlem, sizin, iş arkadaşlarınızın ve röportaj yaptığınız kişilerin ses izlerinin cihazda hesaplanıp kümelenmesi ve silinmesi demektir. Hiçbir yere gönderilmez.

Neyi ölçtük

Diarizasyon için iki sabit dosyalı bir benchmark kullanıyoruz. Referans, ElevenLabs'in bulut ASR ve diarizasyon hizmetinden geliyor ve elle denetleniyor. Puanlama her 10 ms konuşmayı bir konuşmacıya atıyor ve sonuç ile referans arasındaki en iyi eşlemeyi seçiyor. İki dosya küçük bir örneklem; sayıları kesin hüküm değil gösterge olarak ele alıyoruz.

İlk dosya olağan durumu temsil ediyor: belirgin biçimde farklı iki sesin yer aldığı beş dakikalık İngilizce podcast. Çoğu röportaj, podcast ve bire bir toplantı buna benzer.

İki konuşmacılı İngilizce podcast (5 dk)Sonuç
Kare düzeyinde atama (10 ms çözünürlük)96.7%
Cümle düzeyinde doğruluk (okuduğunuz sonuç)99.1%
İşleme süresi, M serisi Neural Engine2–4 sn

Kalan 0.9%, toplam 3.4 saniyelik üç sınır kaymasıdır; bu da referansın kendi çözünürlüğü içindedir. Bu tür kayıtlarda cihazdaki sonuç, referansı üreten bulut hizmetiyle eşleşir.

Zor örnek

İkinci dosya özellikle zor seçildi: yankılı bir odada benzer iki erkek sesi ve ortalama 2.3 saniyelik 19 kısa araya girişi olan bir sunucu. Konuk 272 saniye, sunucu 43 saniye konuşuyor. Bu, hangi dilde olursa olsun konuşmacı diarizasyonunu bozan akustik profildir: benzer sesler kısa konuşma turlarıyla birbirini takip eder.

Otomatik kümeleme burada çöküyor. İki ses izi birbirine o kadar yakın ki algoritma bunları birleştirip konuşmanın neredeyse tamamını tek etikete atıyor. Kayıt tesadüfen Çince bir röportajdı; bu da dil için özelleştirilmiş bir modelin daha iyi olacağı yönündeki bariz hipotezi test etmemizi sağladı. Özellikle Çince konuşmayla eğitilmiş iki konuşmacı modelini CPU hattında çalıştırdık:

Modelİngilizce podcastZor örnek*Süre (5.7 dk ses)
pyannote community-1 (bizimki, Neural Engine)96.7%81–82%2–4 sn
CAM++ (Çince eğitimli, CPU)93.9%81.2%36–103 sn
ERes2NetV2 (Çince eğitimli, CPU)80.5%220–290 sn

* Zor kayıtta konuşmacı sayısı belirtilerek kare düzeyinde atama. Belirtilmediğinde her model tek konuşmacıya doğru çöker.

İki model de 10–100 kat fazla hesaplamaya rağmen aynı şekilde çöküyor. Zorluk dille değil akustikle ilgili — sınır, güncel ses embedding'lerinin herhangi bir dilde neyi ayırt edebildiğinde.

Bu nedenle hatta kendisinin güvenilir biçimde çıkaramadığı bir bilgi verdik: odadaki kişi sayısı. Menüden 2 ile 6 konuşmacı seçildiğinde zor dosya çöküşten 89% cümle doğruluğuna çıkıyor. Tipik kayıtlarda doğru olduğu için otomatik algılama varsayılan kalıyor.

Whisper Notes'ta belirli konuşmacı sayısıyla algılamayı yeniden çalıştırma ve etiketli SRT ile VTT dışa aktarma

Tam konuşmacı sayısıyla algılamayı yeniden çalıştırma. Aynı menü etiketli SRT ve VTT de dışa aktarır.

Kısa araya girişleri düzeltme

Konuşmacı sayısı sabitlenince kalan hataların yaklaşık yarısı üç saniyeden kısa araya girişlerdeydi. İki saniyelik kesit embedding modeline az sinyal verir; hızlı konuşmada ses izi komşu konuşmacıdan da bir parça alır.

Bu yüzden kümelemeden sonra hat, 3.5 saniyeden kısa her cümleyi yeniden inceler: yalnızca o cümlenin karelerini örten maskeyle ses izini tekrar hesaplar, her konuşmacının en uzun konuşma bölümlerinin ortalaması olan referansıyla karşılaştırır ve etiketi sadece fark belirginse değiştirir. Mevcut model yeniden kullanılır; ek indirme yoktur.

Uçtan uca cümle doğruluğuDüzeltme öncesiSonrası
Zor örnek (konuşmacı sayısı verildi)89.0%94.8%
İngilizce podcast (otomatik)98.5%99.1%

Eşik ihtiyatlıdır: düzeltici iki dosyada 21 etiketi değiştirdi ve yeni hata eklemedi.

Sınırlamalar

• Etiketler görüşme sırasında değil, kayıt bittikten sonra görünür. Toplantı sürerken konuşmacı adlarıyla canlı altyazı gerekiyorsa Otter veya Notta gibi bir bulut hizmeti daha uygundur.

• Üst üste konuşma, cümle başına tek etiket alır.

• Benzer sesler hâlâ zordur. Zor dosyamızdaki 94.8%, konuşmacı sayısı ipucuyla bugünkü üst sınırdır; çözülmüş bir sorun değildir.

Kullanılabilirlik

Konuşmacı tanıma, uygulamanın üç transkripsiyon motoru — Parakeet V3, Whisper Large V3 Turbo ve SenseVoice — ile yerel AI düzenleme yanında tek seferlik $6.99 satın almaya dahildir. Ayrı paket ve hesap yoktur.

iPhone: App Store, sürüm 1.8.5 veya üzeri.

Mac App Store: sürüm 1.3.2 veya üzeri.

Mac doğrudan indirme (DMG): whispernotes.app üzerinden sürüm 1.5.1 veya üzeri, ücretsiz denemeyle.

Toplantı kaydının nasıl çalıştığı için çevrimdışı toplantı transkripsiyonu yazımıza bakın.