Mistral, transkripsiyon ve ses anlama için ilk açık ağırlıklı model ailesi Voxtral'ı yayımladı. Resmi kıyaslamalar güçlü çok dilli konuşma tanıma ve sesli soru-cevap performansı gösteriyor; iki model boyutunun donanım gereksinimleri ise birbirinden çok farklı. İşte bu sürümün gerçekte neleri desteklediği ve Whisper Notes'un tüketici sınıfı Apple donanımında neden hâlâ daha küçük, transkripsiyon odaklı modeller kullandığı.
İki Model
Mistral, Temmuz 2025'te Apache 2.0 lisanslı iki checkpoint yayımladı:
Voxtral Small 24B
- •24 milyar parametre
- •Transkripsiyon, çeviri, sesli soru-cevap ve özetleme
- •32k bağlam penceresi
- •bf16/fp16'da yaklaşık 55 GB GPU RAM
Voxtral Mini 3B
- •3 milyar parametre
- •Aynı ses-ve-metin görev ailesi, daha küçük bir checkpoint'te
- •Resmi olarak yerel ve uç (edge) dağıtım için konumlandırılmış
- •bf16/fp16'da yaklaşık 9.5 GB GPU RAM
Açık Ağırlıklar ve Lisans
2025 tarihli her iki checkpoint de Apache 2.0 lisansı altında açık ağırlıklıdır. Onları indirip kendiniz çalıştırabilirsiniz:
- ✓ Model ağırlıklarının tamamı erişilebilir
- ✓ Apache 2.0 lisansı kapsamında kendi sunucunuzda barındırın veya uyarlayın
- ✓ Kendiniz barındırdığınızda Mistral API ücreti yok; kendi işlem gücünüzün maliyeti yine size ait
- ✓ Sesi kendi sunucularınızda işleyin
Kaynaklar: Mistral'in Voxtral duyurusu, resmi Voxtral Small model kartı ve resmi Voxtral Mini model kartı.
Kıyaslamalar
Mistral'in duyurusu; İngilizce kısa ve uzun form setleri, Mozilla Common Voice, FLEURS ve Multilingual LibriSpeech üzerinde makro-ortalama kelime hata oranını (WER) karşılaştırıyor. Mistral'in bildirdiği FLEURS sonuçlarında Voxtral Small, değerlendirilen her görevde Whisper'ı geçiyor. Düşük WER daha iyidir:
Mistral'in lansman kıyaslamalarından FLEURS WER değerleri, tahmini API fiyatına karşı çizilmiştir; hem kıyaslama sonuçları hem de fiyatlar değişebilir
FLEURS, transkripsiyon kalitesinin yalnızca bir kesitidir. Bunlar üreticinin bildirdiği sonuçlardır; bir model seçmeden önce yayımlanan kıyaslama tanımlarını karşılaştırın ve kendi dillerinizi, mikrofonlarınızı ve kayıt koşullarınızı test edin.
Voxtral ve Whisper: Hangisini Kullanmalısınız?
Kıyaslamalar hikâyenin yalnızca bir kısmını anlatır. Bir modeli gerçekten kendiniz çalıştırmak istiyorsanız önemli olan faktörlerde iki model ailesi şöyle karşılaştırılıyor:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Diller | 8 birincil dil | 8 birincil dil | 100'den fazla | 100'den fazla |
| Açık kaynak | Evet | Evet | Evet | Evet |
| Model boyutu | 24B parametre; bf16/fp16'da ~55 GB GPU RAM | 3B parametre; bf16/fp16'da ~9.5 GB GPU RAM | 1.55B parametre | 809M parametre (~1.6 GB) |
| Tüketici sınıfı bir Mac'te pratik mi? | Tipik donanımda tam hassasiyetle çalışmaz | Uyumlu bir çalışma zamanıyla mümkün; Turbo'dan daha ağır | Evet | Evet |
Sonuç: Voxtral Small güçlü WER sonuçları bildiriyor ve Whisper'ın hiç denemediği ses anlama yeteneği ekliyor. Voxtral Mini, Mistral'in yerel ve uç dağıtım için konumlandırdığı checkpoint, ancak resmi model kartı bf16/fp16'da hâlâ yaklaşık 9.5 GB GPU RAM listeliyor. Tüketiciye yönelik bir transkripsiyon uygulaması için Whisper Large-v3 Turbo hâlâ daha kolay dağıtılıyor ve çok daha fazla dili kapsıyor. Whisper Notes'un şu anda Voxtral yerine Whisper Turbo'yu Parakeet V3 ve SenseVoice ile birlikte kullanmasının nedeni bu.
API ve Kendi Sunucunda Barındırma Maliyeti
10 Temmuz 2026 itibarıyla kontrol edildiğinde, Mistral'in model kartı Voxtral Small için ses girişini dakika başına $0.004 olarak listeliyor. Ses anlama istekleri için metin girişi ve üretilen metin ayrıca faturalandırılır. Apache 2.0 ağırlıklarını kendiniz barındırırsanız Mistral API ücreti yoktur, ancak donanım ve işletme maliyetlerini siz ödersiniz.
Mistral API
Kendi barındırdığınız ağırlıklar
Nasıl Çalışıyor
Resmi model kartı, Voxtral'ı bir ses kodlayıcıya ve özel bir transkripsiyon moduna sahip, dil modeli omurgalı bir sistem olarak tanımlıyor. Ürün açısından önemli sınırlar somut:
1. Çok Modlu Mimari
Voxtral, yalnızca bir konuşmadan-metne çözücü gibi davranmak yerine, aynı sohbette ses ve metin kabul eder:
- •Doğrudan transkripsiyon için özel mod
- •Sesli soru-cevap ve yapılandırılmış özetleme
- •Birden fazla ses girişi ve çok turlu sesli konuşmalar
Uzun form sınırı
32k bağlam penceresi; transkripsiyon için 30 dakikaya, daha geniş ses anlama için 40 dakikaya kadar ses destekler.
2. Diller ve Değerlendirme
Mistral, otomatik algılamayla birlikte sekiz birincil dil listeliyor:
- •İngilizce, İspanyolca, Fransızca, Portekizce, Hintçe, Almanca, Felemenkçe ve İtalyanca
- •Kıyaslamalar FLEURS, Mozilla Common Voice ve Multilingual LibriSpeech'i içeriyor
- •Duyuru ayrıca İngilizce kısa ve uzun form sesleri ayrı ayrı değerlendiriyor
3. Dağıtım Gereksinimleri
Açık ağırlıklar, her checkpoint'in her cihaza sığacak kadar küçük olduğu anlamına gelmez:
- •Voxtral Small, model kartına göre bf16/fp16'da yaklaşık 55 GB GPU RAM gerektirir
- •Voxtral Mini, yerel ve uç dağıtım için tasarlanan 3B checkpoint'tir
- •Mistral, yayımlanan checkpoint'leri sunmak için vLLM öneriyor
4. Öne Çıkan Özellikler
Bağlamsal Anlama
32k bağlam sınırı içinde, doğrudan sesten sorulara yanıt verebilir ve özetler üretebilir.
Çok Dilli
Sekiz birincil dili otomatik olarak algılar ve yazıya döker: İngilizce, İspanyolca, Fransızca, Portekizce, Hintçe, Almanca, Felemenkçe ve İtalyanca.
Gürültüyle Başa Çıkma
Resmi değerlendirme çeşitli konuşma veri kümeleri içeriyor, ancak Mistral her gürültülü kayıt için genel geçer bir garanti yayımlamıyor.
Uç Dağıtım
Voxtral Mini yerel ve uç seçenektir. Resmi model kartı bf16/fp16'da yaklaşık 9.5 GB GPU RAM listeliyor.
5. Mimari
Üç ana bileşen:
- 1. Ses kodlayıcı: Dalga formunu öğrenilmiş ses temsillerine dönüştürür
- 2. Projektör: Ses temsillerini dil modelinin gizli uzayına eşler
- 3. Dil modeli omurgası: Transkriptler, yanıtlar, özetler veya araç çağrıları üretir
Bu tasarım, Voxtral'ın neden transkripsiyondan fazlasını yapabildiğini açıklıyor; ama aynı zamanda Whisper Turbo gibi yalnızca transkripsiyona odaklanan bir modelden çok daha büyük dil modeli ağırlıkları taşıdığı anlamına da geliyor.
Whisper Notes Neden Hâlâ Mantıklı
Voxtral ve Whisper Notes farklı sorunları çözüyor. Voxtral, transkripsiyonu ses anlamayla birleştiriyor; Whisper Notes ise tüketici sınıfı Apple donanımında kolayca çalışan, gizli transkripsiyona odaklanıyor.
Whisper Notes Ne Sunuyor
Gizlilik
- •%100 çevrimdışı işleme
- •Veri iletimi yok
- •Bulut bağımlılığı yok
Performans
- •Whisper teknolojisi, kanıtlanmış doğruluk
- •Apple Silicon için optimize
- •Güvenilir sonuçlar
Maliyet
- •Tek seferlik satın alma; App Store iPhone, iPad ve Mac App Store’u kapsar, denemeli DMG ayrı satılır
- •Dakika başına ücret yok
- •Sınırsız transkripsiyon
Kullanıcı Deneyimi
- •Sade arayüz
- •Düzenli güncellemeler
- •Sürekli iyileştirmeler
Depolama Gereksinimleri
Voxtral Small, tam hassasiyette sunucu sınıfı bir modeldir: resmi kartı yaklaşık 55 GB GPU RAM listeliyor. Voxtral Mini özellikle yerel ve uç kullanım için tasarlanmış, ancak kartı bf16/fp16'da yine yaklaşık 9.5 GB GPU RAM listeliyor. Whisper Turbo'nun uygulama içi indirme boyutu ise yaklaşık 1.6 GB — mevcut Whisper Notes ürünü için çok daha uygun.
Whisper Notes, Whisper Large-v3 Turbo kullanıyor — günlük kullanım için performansı, hızı ve VRAM gereksinimlerini dengeliyor. Makul kaynak gereksinimleriyle daha iyi modeller çıktığında onlara geçeceğiz.
Sesli soru-cevap, özetleme veya kendi sunucunuzda barındırma önemliyse Voxtral cazip. Whisper Notes ise gizli transkripsiyon isteyen ve tekrarlayan abonelik istemeyen bireysel kullanıcılara yönelik.
Bu Ne Anlama Geliyor
Voxtral, sesi yazıya dökmenin yanı sıra ses üzerinde akıl yürütebildiği için, düz konuşma tanımanın ötesine geçen önemli bir açık ağırlıklı adım.
Mac ve iPhone'da gizli, çevrimdışı transkripsiyon içinse daha küçük, uzmanlaşmış motorları paketlemek ve tutarlı çalıştırmak hâlâ daha kolay.
Tüm yerel seçenekleri mi karşılaştırıyorsunuz? Cihaz üzerinde çalışan her konuşmadan-metne model — Whisper varyantları, Parakeet V3, SenseVoice ve Voxtral — Whisper modelleri karşılaştırma sayfamızda yan yana karşılaştırılıyor.
Sıkça Sorulan Sorular
Mistral Voxtral nedir?
Voxtral, Mistral'in konuşma transkripsiyonu ve ses anlama için açık ağırlıklı model ailesidir. Temmuz 2025 sürümü, sunucu sınıfı iş yükleri için Voxtral Small 24B'yi ve yerel ile uç dağıtım için Voxtral Mini 3B'yi içerir. Her iki checkpoint de Apache 2.0 lisansı kullanır.
Voxtral bir Mac'te yerel olarak çalışabilir mi?
İndirilebilir ağırlıklar kendi sunucunuzda barındırılabilir, ancak iki boyutun gereksinimleri farklıdır. Voxtral Small bf16/fp16'da yaklaşık 55 GB GPU RAM ister, dolayısıyla sunucu sınıfı bir tercihtir. Voxtral Mini yerel ve uç checkpoint'tir; model kartı bf16/fp16'da yaklaşık 9.5 GB listeler ve Mac'teki gerçek hız ile bellek kullanımı çalışma zamanına ve kuantizasyona bağlıdır.
Whisper Notes Voxtral kullanıyor mu?
Hayır. Whisper Notes; Parakeet V3 (Mac'te varsayılan), Whisper Large-v3 Turbo ve SenseVoice çalıştırır — bu modeller, Apple Silicon üzerinde günlük kullanım için performansı, hızı ve VRAM gereksinimlerini dengeledikleri için seçildi. Tüketici donanımında pratik hale gelen daha iyi modeller çıktığında onları benimseyeceğiz.
Voxtral kaç dili destekliyor?
Resmi model kartları, otomatik algılamayla birlikte sekiz birincil dil listeliyor: İngilizce, İspanyolca, Fransızca, Portekizce, Hintçe, Almanca, Felemenkçe ve İtalyanca. Mistral, FLEURS'te Arapçayı da değerlendiriyor, ancak Arapça model kartının birincil dil listesinde yer almıyor.
Mistral Voxtral ne zaman yayımlandı?
Mistral, Voxtral'ı 15 Temmuz 2025'te yayımladı. İlk Apache 2.0 checkpoint'leri Voxtral Small 24B ve Voxtral Mini 3B idi.