SenseVoice: Mac'te Çince, Japonca ve Korece 52× Daha Hızlı Transkripsiyon

12 Mayıs 2026
·
7 min read
·Whisper Notes Team

KISA ÖZET — Cihaz Üzerinde Çalışan Üç Modelin Karşılaştırması

Parakeet V3 SenseVoice Small Whisper Large V3 Turbo
5 dk İngilizce 2,91s (103x) 5,8s (52x) 20,92s (14,3x)
27 dk Çince 10,10s (161x) 13,83s (118x) 2 dk 4s (13,1x)
Diller 25 (Avrupa) 5 (zh, en, ja, ko, yue) 100+
İndirme 465 MB 827 MB ~1,6 GB
Bellek ~800 MB ~700 MB ~1,6 GB
En uygun İngilizce & Avrupa dilleri Çince, Japonca, Korece, Kantonca Geri kalan her şey (100+ dil)

* Hız kıyaslamaları Apple M4 Pro, 32 GB üzerinde. 5 dakikalık İngilizce podcast ve 27 dakikalık Çince podcast. Gerçek zaman katsayısı = ses süresi ÷ işleme süresi (yüksek = daha hızlı). Kıyaslamalar Mac sürümünden; SenseVoice iPhone'da da mevcut.

Sürüm 1.5.0 (Doğrudan İndirme / DMG) ile birlikte Whisper Notes for Mac; Çince, Japonca, Korece ve Kantonca transkripsiyon için özel motor olarak SenseVoice Small ile geliyor. Qwen3-ASR'nin yerini alıyor ve CPU yerine MLX aracılığıyla Apple'ın GPU'sunda çalışıyor — 27 dakikalık bir Çince podcast'i 3 dakika 44 saniye yerine 13,83 saniyede işliyor.

Qwen3-ASR'yi Neden Değiştirdik

Qwen3-ASR sağlam bir modeldi. 30 dilin yanında 22 Çince lehçeyi destekliyordu ve Çince doğruluğu neredeyse en üst düzeydeydi. Ancak ses uzadıkça kötüleşen bir sorunu vardı: hız.

Qwen3, otoregresif bir mimari kullanıyordu — Whisper ile aynı yaklaşım; sesi kare kare işliyor, hiç ileri atlamıyordu. 27 dakikalık bir Çince podcast'te 224 saniye sürüyordu. Kullanılabilirdi, ama Parakeet V3'ün İngilizcede sunduğu anında sonuç deneyiminden uzaktı.

Daha derindeki sorun altyapımızdı. Qwen3 entegrasyonumuz, her şeyi CPU çekirdeklerinden geçiren 2.249 satırlık Swift sarmalayıcılı bir C kütüphanesi olan sherpa-onnx'u kullanıyordu. Mac'inizin CPU'su tüm işi yaparken GPU boş duruyordu.

SenseVoice iki sorunu da çözdü. Hız için otoregresif olmayan mimari. GPU hızlandırması için Apple MLX. Sonuç: aynı donanımda 16,2 kat hız artışı ve 2.249 satırdan 288'e inen bir kod tabanı.

Kıyaslama

Üç model de aynı Apple M4 Pro üzerinde, aynı ses dosyalarıyla, aynı koşullarda çalıştırıldı. Bulut yok. İnternet yok. Sadece silikon.

Model 5 dk İngilizce 27 dk Çince Hız (RTFx)
Parakeet V3 2,91s 10,10s 103–161x
SenseVoice Small 5,8s 13,83s 52–118x
Whisper Large V3 Turbo 20,92s 2 dk 4s 13–14x
Qwen3-ASR (kaldırıldı) 224s 7,2x

SenseVoice, Parakeet V3'ün kabaca yarısı hızında — yine de olağanüstü hızlı. 27 dakikalık bir podcast 14 saniyenin altında bitiyor. Yazıya dök'e basıyorsunuz, bir nefes bekliyorsunuz ve metin orada.

Bunu Whisper'ın 2 dakika 4 saniyesiyle veya eski Qwen3'ün 3 dakika 44 saniyesiyle karşılaştırın. Mimari, parametre sayısından daha önemli.

FunAudioLLM makalesinden resmi çıkarım hızı karşılaştırma tablosu: SenseVoice-Small (10 sn ses için 70 ms), Whisper-Small (518 ms) ve Whisper-Large-V3 (1281 ms) - model mimarisi, parametreler, desteklenen diller, RTF ve gecikme süresi

FunAudioLLM makalesinden resmi çıkarım kıyaslaması: SenseVoice-Small, 10 saniyelik sesi 70 ms'de işliyor (A800 GPU). Whisper-Large-V3 ise 1.281 ms. Ham çıkarım gecikmesinde 18 katlık bir fark.

Model Yükleme Süresi Bellek İndirme Boyutu
Parakeet V3 0,77s ~800 MB 465 MB
SenseVoice Small 0,81s ~700 MB 827 MB
Whisper Small 1,03s ~487 MB 600 MB
Whisper Large V3 Turbo 3,18s ~1,6 GB ~1,6 GB

* Yükleme süresi ve bellek Apple M4 Pro, 32 GB üzerinde ölçülmüştür.

SenseVoice bir saniyenin altında yüklenir ve Parakeet'ten daha az bellek kullanır. 8 GB'lık bir Mac'te diğer uygulamalarınızın yanında rahatça çalışır.

SenseVoice Neden Daha Hızlı: Mimari + Çalışma Zamanı

Qwen3-ASR ile SenseVoice arasındaki hız farkı, birbirinden bağımsız iki etkenden kaynaklanıyor.

Etken 1: Model mimarisi. Qwen3-ASR otoregresiftir — metni belirteç belirteç, her biri bir öncekine bağlı olarak üretir. SenseVoice ise tüm sesi paralel işleyen otoregresif olmayan (NAR) bir kodlayıcı kullanır. Bu mimari fark tek başına, hangi donanımda çalıştırırsanız çalıştırın SenseVoice'u temelden daha hızlı kılar.

Etken 2: Çalışma zamanı. Qwen3-ASR entegrasyonumuz CPU'da çalışan sherpa-onnx kullanıyordu. SenseVoice, hesaplamayı GPU'ya yönlendiren Apple MLX üzerinden çalışıyor. Qwen3 de MLX'te çalışabilir miydi? Evet — ama yine de SenseVoice'tan yavaş olurdu, çünkü otoregresif darboğaz çalışma zamanında değil, mimaride.

Qwen3-ASR (eski) SenseVoice (yeni)
Mimari Otoregresif (belirteç belirteç) Otoregresif olmayan (paralel)
Çalışma Zamanı sherpa-onnx (CPU) Apple MLX (GPU)
27 dk Çince 224 saniye 13,83 saniye
Toplam hızlanma referans 16,2x daha hızlı
Kod tabanı 168 MB C framework + 2.249 satır Swift 288 satır Swift Actor

* Aynı 27 dakikalık Çince podcast, Apple M4 Pro. 16,2x hızlanma, hem mimari (NAR - AR) hem çalışma zamanı (GPU - CPU) iyileştirmelerinin toplamıdır.

Kod da sadeleşti. Yeni SenseVoice uygulaması, 168 MB'lık bir C framework'ünün yerini alan ve doğrudan MLX ile konuşan tek bir 288 satırlık Swift Actor. Daha az kod, daha az hata, daha küçük uygulama.

Beş Dil, Hakkıyla

SenseVoice her şeyi yapmaya çalışmıyor. Beş dili işliyor:

Dil SenseVoice-Small Whisper-Large-V3 Kazanan
Çince (zh-CN) %10,78 CER %12,55 CER SenseVoice (-%14)
Kantonca (yue) %7,09 CER %10,41 CER SenseVoice (-%32)
Japonca (ja) %11,96 CER %10,34 CER Whisper (az farkla)
Korece (ko) %8,28 CER %5,59 CER Whisper
İngilizce (en) %14,71 WER %9,39 WER Whisper (Parakeet kullanın)

* CommonVoice kıyaslaması, CER = Karakter Hata Oranı, WER = Kelime Hata Oranı. Düşük daha iyidir. Kaynak: FunAudioLLM makalesi (2024). SenseVoice-Small çıkarım gecikmesi: 10 sn ses için 70 ms (A800 GPU), Whisper-Large-V3'ten 15 kattan fazla hızlı.

CommonVoice kıyaslamasında SenseVoice ile Whisper doğruluk karşılaştırması: Çince, Kantonca, İngilizce, Japonca, Korece ve 25 diğer dil - WER/CER çubuk grafiği

CommonVoice kıyaslaması: SenseVoice-Small (sarı), Whisper-Small (mavi), Whisper-Large-V3 (turuncu). Düşük daha iyidir. Kaynak: FunAudioLLM makalesi

Rakamlar dürüst bir hikâye anlatıyor. SenseVoice, Çince ve Kantonca doğrulukta Whisper'ı belirgin bir farkla geçiyor; Japonca, Korece ve İngilizcede ise Whisper daha doğru. Ama SenseVoice, Whisper-Large-V3'ten 15 kattan fazla hızlı. Gerçek dünya kullanımının çoğunda hız farkı, birkaç puanlık doğruluk farkından daha önemli.

Kantonca sonucu ayrıca vurgulanmayı hak ediyor. Whisper-Small, Kantoncada %38,97 CER alıyor — neredeyse kullanılamaz. Whisper-Large-V3 bile ancak %10,41'i görüyor. SenseVoice %7,09'a ulaşıyor. SenseVoice'tan önce, Mac'te Kantoncayı yerel olarak yazıya dökmenin iyi bir yolu yoktu. Kantonca konuşuyorsanız, bu model sizin için var.

Whisper Notes for Mac'te SenseVoice Korece transkripsiyon sonucu: bir videodan doğru Korece metin

SenseVoice ile Korece transkripsiyon: zaman damgalı altyazılarla video içe aktarma

Gerçek Dünya Testi: 27 Dakikalık Çince Podcast

Bir Çince söyleşi podcast'i olan Thirteen Invitations (十三邀) programının 27 dakikalık bir bölümünü, aynı M4 Pro üzerinde hem SenseVoice hem Whisper Large V3 Turbo ile yazıya döktük. Referans olarak ElevenLabs Scribe (bulut) kullanıldı. Cihaz üzerinde çalışan iki model de kabaca aynı sayıda hata yapıyor, ama farklı türde:

SenseVoice Whisper Large V3
Süre 13,83s 2 dk 4s
Hata (5 dk örneklem) ~15–20 ~12–15
En kötü hata 时差→食堂 (saat farkı→yemekhane) 西昌→西藏 (Xichang şehri→Tibet, 4.000 km sapma)
Hata deseni Eş sesli kelime karışmaları Coğrafi/olgusal hatalar

* ElevenLabs Scribe (bulut referansı, o da kusursuz değil) ile elle karşılaştırma. Cihaz üzerindeki iki model de Scribe'ın yanlış yazdığı "根深蒂固" ifadesini doğru yazdı.

Karşılaştırılabilir doğruluk. 9 kat hız. Gerçek dünya Çince transkripsiyonunda SenseVoice, Whisper daha yüklenmeyi bitirmeden size kullanılabilir bir transkript veriyor.

Hangi Modeli Ne Zaman Kullanmalı

Whisper Notes for Mac artık dört konuşma modeliyle geliyor. Her biri farklı senaryolar için optimize edildi:

İhtiyacınız... Bu modeli kullanın Neden
İngilizce veya Avrupa dilleri, azami hız Parakeet V3 103x gerçek zamanlı, en düşük hata oranı. Varsayılan.
Çince, Japonca, Korece veya Kantonca SenseVoice Small 52–118x gerçek zamanlı. Kantonca desteği olan tek model.
100'den fazla dilden herhangi biri (Arapça, Tayca, Rusça vb.) Whisper Large V3 Turbo En geniş dil desteği. Daha yavaş ama evrensel.
Daha az bellek kullanımı (eski Mac'ler) Whisper Small 487 MB bellek. Başka uygulamalar çalıştıran 8 GB Mac'ler için iyi.
Whisper Notes Mac model seçicisi: Parakeet V3, SenseVoice Small, Whisper Small ve Whisper Large V3 Turbo, indirme boyutları ve dil desteğiyle

Ayarlar → Transkripsiyon Modeli: dilinize uygun motoru seçin

Ayarlardaki model seçici, dört seçeneği de indirme boyutları, dil sayıları ve bellek gereksinimleriyle gösterir. SenseVoice ilk kullanımda indirilir (~827 MB) ve cihazınızda kalır.

Ödünleşimler

SenseVoice evrensel bir model değil. İşte yapamadıkları:

Yalnızca 5 dil. Tayca, Rusça, Arapça, Hintçe veya SenseVoice'un CJK odağı dışındaki başka bir dile ihtiyacınız varsa Whisper'da kalın.

Güncelleme: SenseVoice başlangıçta Apple MLX ile yalnızca Mac'te sunulmuştu, ama artık iPhone'da da mevcut — iOS, Mac ile aynı model kadrosunu destekliyor: Parakeet V3, Whisper ve SenseVoice.

Sessiz ses tuhaflığı. Çok kısa veya çok sessiz bölümlerde SenseVoice, seçilen dilden bağımsız olarak bazen Çince çıktıya dönebilir. Dili elle ayarlamak ("Otomatik" yerine) bunu azaltır.

Akış yok. Whisper'ın akış modunun aksine SenseVoice, tüm sesi kayıttan sonra işler. Uzun dosyalarda sessizlik noktalarında otomatik bölütler ve sonuçları aşamalı olarak gösterir.

Bunlar mimari kısıtlar, hata değil. 5 dil üzerinde eğitilmiş bir model, o 5 dili son derece iyi yapar. Whisper'ın 100'den fazla dillik kapsamı ise daha düşük hız ve diller arasında dengesiz doğrulukla birlikte gelir.

Tüm yerel seçenekleri mi karşılaştırıyorsunuz? Cihaz üzerinde çalışan her konuşmadan metne model — Whisper varyantları, Parakeet V3, SenseVoice ve Voxtral — Whisper modelleri karşılaştırma sayfamızda yan yana inceleniyor. Whisper'ın kendisine mi yenisiniz? Whisper Transkripsiyon Rehberi ile başlayın — modelin ne olduğu, çalıştırmanın her yolu ve maliyeti.

Sıkça Sorulan Sorular

Çince, Japonca ve Korece transkripsiyon için en hızlı Whisper alternatifi nedir?

SenseVoice Small, Whisper Notes'ta hem Mac hem iPhone'da mevcut. M4 Pro'daki Mac testimizde 27 dakikalık bir Çince podcast'i 13,83 saniyede yazıya döktü (52–118x gerçek zamanlı); Whisper Large V3 Turbo aynı dosya için 2 dakikadan fazla sürdü.

Çince için SenseVoice, Whisper'dan daha mı iyi?

Çince ve Kantonca için evet. CommonVoice kıyaslamasında SenseVoice, Çincede %10,78 CER alıyor; Whisper-Large-V3 ise %12,55 — ve SenseVoice 15 kattan fazla hızlı. Japonca ve Korecede Whisper bir miktar daha doğru kalıyor.

Mac'te Kantoncayı yerel olarak yazıya dökebilir miyim?

Evet. SenseVoice, Kantoncada %7,09 CER alıyor; Whisper-Large-V3'te bu %10,41, Whisper-Small'da ise neredeyse kullanılamaz olan %38,97. SenseVoice'tan önce, Mac'te Kantoncayı yerel olarak yazıya dökmenin iyi bir yolu yoktu.

SenseVoice iPhone'da çalışıyor mu?

Evet. iPhone'daki Whisper Notes, Mac ile aynı model kadrosunu destekliyor — Parakeet V3, Whisper ve SenseVoice — böylece Çince, Japonca, Korece ve Kantoncayı iPhone'unuzda da yerel olarak yazıya dökebilirsiniz.

Deneyin

SenseVoice, Whisper Notes for Mac v1.5.0 (Doğrudan İndirme / DMG) ve sonrasında ve güncel iPhone uygulamasında mevcut. Mac'te Ayarlar → Transkripsiyon Modeli → SenseVoice Small (~827 MB) yolundan indirin. Mac sürümü Apple Silicon (M1 veya sonrası) gerektirir.

Parakeet V3 kullanıyorsanız ve çoğunlukla İngilizce dikte ediyorsanız, geçiş yapmanıza gerek yok. SenseVoice; Çince, Japonca, Korece veya Kantoncaya ihtiyaç duyduğunuz — ve hızlı istediğiniz — durumlar için.

Mac için indir

Değişiklik günlüğünün tamamı: whispernotes.app/changelog

Soru veya geri bildirim: mac@whispernotes.app