OpenAI'nin Whisper Large-v3 Turbo modeli, dekoderi 32 katmandan 4'e indirerek parametre sayısını 1.55B'den 809M'ye düşürüyor. Apple Silicon testlerimizde aynı sesi, neredeyse aynı doğrulukla yaklaşık 5× daha hızlı yazıya döktü. Whisper Notes bu modeli Mac ve iPhone'da sunuyor.
V3 Turbo ve V3: Ne Değişti
Turbo yeni bir mimari değil. Dekoderi 32 katmandan 4'e budanmış, ardından doğruluğu geri kazanmak için ince ayar yapılmış, birebir aynı Whisper Large-v3 modeli. Kodlayıcıya (encoder) dokunulmamış.
| Large-v3 Turbo | Large-v3 | |
|---|---|---|
| Parametreler | 809M | 1,550M |
| Dekoder katmanları | 4 | 32 |
| Diller | 100'den fazla | 100'den fazla |
| Çeviri görevi | Desteklenmiyor | Destekleniyor |
| Lisans | MIT | Apache 2.0 |
Yöntem: aynı 10 dakikalık ses dosyası, adı geçen her cihazda aynı Whisper Notes sürümüyle yazıya döküldü. Süreler, transkripsiyonun başlamasından nihai metne kadar geçen duvar saati saniyeleridir; V3 ile Turbo arasında yalnızca model değişti.
Çeviri görevi, Turbo'nun eğitim verisinden bilinçli olarak çıkarıldı. Tam Large-v3 modeli bunu destekler, ancak Whisper Notes yalnızca Turbo'yu sunar — çeviri, Apple Intelligence aracılığıyla ayrıca yapılır.
Temel Model: Whisper Large-v3 Nedir?
Whisper Large-v3, OpenAI'nin Kasım 2023'te yayımladığı amiral gemisi açık kaynaklı konuşma tanıma modelidir. 1.55B parametreye sahiptir, 128 mel-bin'lik spektrogram girişi kullanır, 5 milyon saat ses üzerinde eğitilmiştir (1M zayıf etiketli + 4M sözde etiketli) ve 100'den fazla dili destekler. Hugging Face Open ASR Leaderboard'da ortalama ~7.4% kelime hata oranına sahiptir — bu makale boyunca Turbo'nun kıyaslandığı doğruluk tavanı budur. Large-v3'ün diğer tüm cihaz üzerinde çalışan modellerle karşılaştırması için Whisper modelleri karşılaştırmamıza bakın.
Hız Kıyaslaması: Apple Silicon'da Whisper Notes
Whisper Notes for Mac'te Turbo, Neural Engine üzerinde CoreML ile çalışır. 10 dakikalık sesin işlenmesi:
| Cihaz | Whisper V3 | V3 Turbo | Hızlanma |
|---|---|---|---|
| iPhone 15 Pro | 425 s | 82 s | 5.2× |
| iPad Pro M2 | 380 s | 71 s | 5.4× |
| MacBook Pro M2 | 316 s | 63 s | 5.0× |
5× hızlanma, Apple Silicon'daki Whisper Notes'a özgüdür; küçülen dekoder burada Neural Engine optimizasyonundan yararlanır. faster-whisper gibi framework'lerle GPU üzerinde fark ~2.7×'e iner (aşağıdaki topluluk kıyaslamalarına bakın).
Doğruluk: WER Karşılaştırması
Hugging Face Open ASR Leaderboard, iki modeli de aynı İngilizce veri kümelerinde test ediyor. Turbo'nun kelime hata oranı, her kıyaslamada V3'ün yarım puan yakınında:
| Veri kümesi | V3 Turbo WER | V3 WER |
|---|---|---|
| LibriSpeech Clean | 2.10% | 2.01% |
| LibriSpeech Other | 4.24% | 3.91% |
| GigaSpeech | 10.14% | 10.02% |
| Earnings22 | 11.63% | 11.29% |
| AMI | 16.13% | 15.95% |
| Ortalama WER | 7.83% | 7.44% |
V3 her veri kümesinde biraz daha doğru, ancak fark küçük — ortalama 0.39 yüzde puanı. Gerçek dünyadaki çoğu transkripsiyonda bu farkı duymazsınız.
YouTube-commons uzun form değerlendirmesinde (en büyük açık kaynaklı ASR kıyaslamalarından biri) Turbo 13.40% WER alıyor, V3 ise 13.20% — üstelik Turbo 129.5× gerçek zaman faktöründe çalışırken V3 55.3×'te kalıyor. Yani gerçek dünya sesinde neredeyse aynı doğrulukla 2.3× daha hızlı.
Turbo Korece, Rusça ve Diğer Dillerde Ne Kadar Doğru?
Yukarıdaki kıyaslamalar İngilizce. OpenAI'nin model kartına göre, Turbo'nun budanmış 4 katmanlı dekoderi İngilizce dışındaki dillerde İngilizceye kıyasla biraz daha fazla doğruluk kaybettiriyor; en büyük gerileme düşük kaynaklı dillerde. Rusça ve çoğu Avrupa dilinde Turbo, tam Large-v3'e yakın kalıyor — ve Whisper Notes kullanıyorsanız, Parakeet V3, Rusça ile diğer 24 Avrupa dilini Whisper'ın 10 katı hızda kapsıyor.
Korece, Japonca, Çince ve Kantonca içinse bu iş için tasarlanmış bir model hem daha hızlı hem daha iyi noktalama üretiyor: SenseVoice, ÇJK dillerini 52× gerçek zamanda yazıya döküyor. Whisper Notes, SenseVoice'u hem Mac'te hem iOS'ta Turbo'nun yanında sunar; böylece her şeyi tek modele zorlamak yerine dile göre doğru modeli seçebilirsiniz.
Topluluk Kıyaslamaları: GPU ve CPU
faster-whisper ve whisper.cpp topluluklarından bağımsız kıyaslamalar, farklı donanımlarda tutarlı sonuçlar gösteriyor. GPU üzerinde faster-whisper ile 13 dakikalık sesin yazıya dökülmesi:
| Model | Hassasiyet | Süre | GPU Belleği | WER |
|---|---|---|---|---|
| Large-v3 Turbo | fp16 | 19.2 s | 2,537 MB | 1.92% |
| Large-v3 | fp16 | 52.0 s | 4,521 MB | 2.88% |
| Large-v3 Turbo | int8 | 19.6 s | 1,545 MB | 1.92% |
| Distil-Large-v3 | fp16 | 26.1 s | 2,409 MB | 2.39% |
Kaynak: NVIDIA GPU'da faster-whisper kıyaslaması, LibriSpeech clean doğrulama bölümü. Turbo int8 yalnızca 1.5 GB VRAM kullanıyor — 2 GB'lık bir GPU'ya sığar.
RTX 3060 Laptop'ta (6 GB VRAM, int8 hassasiyet) toplu (batched) çıkarım avantajı daha da büyütüyor:
| Model | Sıralı | Toplu (10) | Toplu WER |
|---|---|---|---|
| Large-v3 Turbo | 46.1 s | 18.7 s | 7.7% |
| Large-v3 | 230.8 s | 43.0 s | 7.9% |
| Large-v2 | 178.3 s | 43.2 s | 8.8% |
| Medium | 113.3 s | 26.3 s | 8.9% |
Kaynak: NilaierMusic kıyaslaması, Intel i7-12650H + RTX 3060 Laptop 6 GB, Fransızca ses, int8 hassasiyet.
Toplu işlemeyle Turbo, test edilen tüm modeller arasında en iyi WER'e (7.7%) ulaşırken aynı zamanda en hızlısı. Üretim kullanımı için net tatlı nokta.
Turbo, Medium ve Tüm Whisper Model Boyutları
Turbo'dan önce olağan uzlaşma Medium'du: katlanılabilir hızda kabul edilebilir doğruluk. Turbo bu ödünleşimi geçersiz kıldı — 809M parametreyle Medium'dan (769M) neredeyse hiç büyük değil, ama large sınıfı doğruluğu kat kat hızla sunuyor. İşte tüm model ailesi yan yana:
| Model | Parametreler | Disk Boyutu | Göreli Hız | Doğruluk Sınıfı |
|---|---|---|---|---|
| tiny | 39M | ~75 MB | ~10× | En düşük |
| base | 74M | ~142 MB | ~7× | Düşük |
| small | 244M | ~466 MB | ~4× | Orta |
| medium | 769M | ~1.5 GB | ~2× | Yüksek |
| large-v3 | 1,550M | ~2.9 GB | 1× (referans) | En yüksek |
| large-v3-turbo | 809M | ~1.6 GB | Apple Silicon'da ~5× | En yükseğe yakın |
30 Eylül 2024'te yayımlanan Turbo 809M parametredir. Disk alanından veya hızdan tasarruf etmek için Medium'u seçiyorduysanız, Turbo artık yaklaşık aynı boyutta hem doğrulukta hem hızda onu geçiyor.
Bilinen Sınırlamalar (ve Whisper Notes Bunları Nasıl Ele Alıyor)
Yerleşik çeviri yok
Turbo, çeviri verisi olmadan eğitildi. Yalnızca kaynak dilde yazıya döker — ses→İngilizce çevirisini destekleyen Large-v3'ün aksine.
Whisper Notes — Apple Intelligence, transkriptleri seçtiğiniz dile otomatik çevirir; hangi modeli kullanırsanız kullanın iki dilli çıktı alırsınız.
Gürültülü seste daha fazla halüsinasyon
Topluluk raporları, Turbo'nun çok kısa kliplerde veya gürültülü kayıtlarda V3'e kıyasla daha fazla halüsinasyon ürettiğini gösteriyor. Küçültülmüş dekoder (32'ye karşı 4 katman) düşünüldüğünde beklenen bir durum.
Whisper Notes — transkripsiyondan önce Pyannote VAD çalıştırır; konuşma bölümlerini tespit edip sessizliği/gürültüyü ayıklar, böylece model yalnızca gerçek sesi işler.
Hangi Modeli Kullanmalısınız?
| İngilizce / Avrupa dilleri | Parakeet V3 — Whisper'dan 10× daha hızlı, daha iyi doğruluk |
| Çince / Japonca / Korece | SenseVoice — ÇJK için özel tasarım, 52× hız |
| Diğer diller | Whisper Large V3 Turbo — 100'den fazla dil, yüksek doğruluk, daha yavaş |
Whisper Large-v3 Turbo SSS
Whisper Large-v3 ile Large-v3 Turbo arasındaki fark nedir?
Large-v3 Turbo, Large-v3'ün kodlayıcısını korur ama dekoderi 32 katmandan 4'e indirir. Bu yüzden transkripsiyonda Large-v3 doğruluğuna yakın kalırken çok daha hızlıdır. Ödünleşim, Turbo'nun Whisper'ın yerleşik çeviri görevini desteklememesidir.
faster-whisper, Large-v3 Turbo'yu destekliyor mu?
Evet. faster-whisper, CTranslate2 dönüşümleri aracılığıyla Large-v3 Turbo'yu destekler ve topluluk kıyaslamaları, VRAM kısıtlıyken Turbo'nun güçlü bir seçim olduğunu gösteriyor. Yukarıdaki kıyaslamada Turbo int8 yaklaşık 1.5 GB VRAM kullandı.
whisper.cpp, Large-v3 Turbo'yu destekliyor mu?
Evet. whisper.cpp, Whisper Large-v3 Turbo'nun dönüştürülmüş GGML/GGUF sürümlerini çalıştırabilir. Kendi yerel transkripsiyon hattınızı kuruyorsanız, Turbo'yu tüketici donanımına sığdırmak çoğu zaman tam Large-v3'ten daha kolaydır.
openai/whisper-large-v3-turbo'yu nereden indirebilirim?
Resmi model ağırlıkları OpenAI tarafından Hugging Face'te sunuluyor. Whisper Notes kullanıcılarının bunları elle indirmesine gerek yok: Mac uygulaması, yerel model kurulumunu uygulama arayüzü üzerinden halleder.
Tüm yerel seçenekleri mi karşılaştırıyorsunuz? Cihaz üzerinde çalışan her konuşmadan-metne model — Whisper varyantları, Parakeet V3, SenseVoice ve Voxtral — Whisper modelleri karşılaştırma sayfamızda yan yana karşılaştırılıyor. Whisper'ın kendisine mi yenisiniz? Whisper Transkripsiyon Rehberi ile başlayın — modelin ne olduğu, çalıştırmanın tüm yolları ve maliyeti.