Mistral Voxtral vs GPT-4o | Konuşma AI Kıyaslaması

2 Ağustos 2025
·
8 min read
·Whisper Notes Team

Mistral, transkripsiyon ve ses anlama için ilk açık ağırlıklı model ailesi Voxtral'ı yayımladı. Resmi kıyaslamalar güçlü çok dilli konuşma tanıma ve sesli soru-cevap performansı gösteriyor; iki model boyutunun donanım gereksinimleri ise birbirinden çok farklı. İşte bu sürümün gerçekte neleri desteklediği ve Whisper Notes'un tüketici sınıfı Apple donanımında neden hâlâ daha küçük, transkripsiyon odaklı modeller kullandığı.

Mistral Voxtral performans kıyaslamaları

İki Model

Mistral, Temmuz 2025'te Apache 2.0 lisanslı iki checkpoint yayımladı:

Voxtral Small 24B

  • 24 milyar parametre
  • Transkripsiyon, çeviri, sesli soru-cevap ve özetleme
  • 32k bağlam penceresi
  • bf16/fp16'da yaklaşık 55 GB GPU RAM

Voxtral Mini 3B

  • 3 milyar parametre
  • Aynı ses-ve-metin görev ailesi, daha küçük bir checkpoint'te
  • Resmi olarak yerel ve uç (edge) dağıtım için konumlandırılmış
  • bf16/fp16'da yaklaşık 9.5 GB GPU RAM

Açık Ağırlıklar ve Lisans

2025 tarihli her iki checkpoint de Apache 2.0 lisansı altında açık ağırlıklıdır. Onları indirip kendiniz çalıştırabilirsiniz:

  • Model ağırlıklarının tamamı erişilebilir
  • Apache 2.0 lisansı kapsamında kendi sunucunuzda barındırın veya uyarlayın
  • Kendiniz barındırdığınızda Mistral API ücreti yok; kendi işlem gücünüzün maliyeti yine size ait
  • Sesi kendi sunucularınızda işleyin

Kaynaklar: Mistral'in Voxtral duyurusu, resmi Voxtral Small model kartı ve resmi Voxtral Mini model kartı.

Kıyaslamalar

Mistral'in duyurusu; İngilizce kısa ve uzun form setleri, Mozilla Common Voice, FLEURS ve Multilingual LibriSpeech üzerinde makro-ortalama kelime hata oranını (WER) karşılaştırıyor. Mistral'in bildirdiği FLEURS sonuçlarında Voxtral Small, değerlendirilen her görevde Whisper'ı geçiyor. Düşük WER daha iyidir:

Tüm modeller arasında Voxtral WER kıyaslama karşılaştırması

Mistral'in lansman kıyaslamalarından FLEURS WER değerleri, tahmini API fiyatına karşı çizilmiştir; hem kıyaslama sonuçları hem de fiyatlar değişebilir

FLEURS, transkripsiyon kalitesinin yalnızca bir kesitidir. Bunlar üreticinin bildirdiği sonuçlardır; bir model seçmeden önce yayımlanan kıyaslama tanımlarını karşılaştırın ve kendi dillerinizi, mikrofonlarınızı ve kayıt koşullarınızı test edin.

Voxtral ve Whisper: Hangisini Kullanmalısınız?

Kıyaslamalar hikâyenin yalnızca bir kısmını anlatır. Bir modeli gerçekten kendiniz çalıştırmak istiyorsanız önemli olan faktörlerde iki model ailesi şöyle karşılaştırılıyor:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
Diller 8 birincil dil 8 birincil dil 100'den fazla 100'den fazla
Açık kaynak Evet Evet Evet Evet
Model boyutu 24B parametre; bf16/fp16'da ~55 GB GPU RAM 3B parametre; bf16/fp16'da ~9.5 GB GPU RAM 1.55B parametre 809M parametre (~1.6 GB)
Tüketici sınıfı bir Mac'te pratik mi? Tipik donanımda tam hassasiyetle çalışmaz Uyumlu bir çalışma zamanıyla mümkün; Turbo'dan daha ağır Evet Evet

Sonuç: Voxtral Small güçlü WER sonuçları bildiriyor ve Whisper'ın hiç denemediği ses anlama yeteneği ekliyor. Voxtral Mini, Mistral'in yerel ve uç dağıtım için konumlandırdığı checkpoint, ancak resmi model kartı bf16/fp16'da hâlâ yaklaşık 9.5 GB GPU RAM listeliyor. Tüketiciye yönelik bir transkripsiyon uygulaması için Whisper Large-v3 Turbo hâlâ daha kolay dağıtılıyor ve çok daha fazla dili kapsıyor. Whisper Notes'un şu anda Voxtral yerine Whisper Turbo'yu Parakeet V3 ve SenseVoice ile birlikte kullanmasının nedeni bu.

API ve Kendi Sunucunda Barındırma Maliyeti

10 Temmuz 2026 itibarıyla kontrol edildiğinde, Mistral'in model kartı Voxtral Small için ses girişini dakika başına $0.004 olarak listeliyor. Ses anlama istekleri için metin girişi ve üretilen metin ayrıca faturalandırılır. Apache 2.0 ağırlıklarını kendiniz barındırırsanız Mistral API ücreti yoktur, ancak donanım ve işletme maliyetlerini siz ödersiniz.

Mistral API

$0.004
Voxtral Small için ses dakikası başına

Kendi barındırdığınız ağırlıklar

Apache 2.0
API ücreti yok; işlem gücü sizin sorumluluğunuzda

Nasıl Çalışıyor

Resmi model kartı, Voxtral'ı bir ses kodlayıcıya ve özel bir transkripsiyon moduna sahip, dil modeli omurgalı bir sistem olarak tanımlıyor. Ürün açısından önemli sınırlar somut:

1. Çok Modlu Mimari

Voxtral, yalnızca bir konuşmadan-metne çözücü gibi davranmak yerine, aynı sohbette ses ve metin kabul eder:

  • Doğrudan transkripsiyon için özel mod
  • Sesli soru-cevap ve yapılandırılmış özetleme
  • Birden fazla ses girişi ve çok turlu sesli konuşmalar

Uzun form sınırı

32k bağlam penceresi; transkripsiyon için 30 dakikaya, daha geniş ses anlama için 40 dakikaya kadar ses destekler.

2. Diller ve Değerlendirme

Mistral, otomatik algılamayla birlikte sekiz birincil dil listeliyor:

  • İngilizce, İspanyolca, Fransızca, Portekizce, Hintçe, Almanca, Felemenkçe ve İtalyanca
  • Kıyaslamalar FLEURS, Mozilla Common Voice ve Multilingual LibriSpeech'i içeriyor
  • Duyuru ayrıca İngilizce kısa ve uzun form sesleri ayrı ayrı değerlendiriyor

3. Dağıtım Gereksinimleri

Açık ağırlıklar, her checkpoint'in her cihaza sığacak kadar küçük olduğu anlamına gelmez:

  • Voxtral Small, model kartına göre bf16/fp16'da yaklaşık 55 GB GPU RAM gerektirir
  • Voxtral Mini, yerel ve uç dağıtım için tasarlanan 3B checkpoint'tir
  • Mistral, yayımlanan checkpoint'leri sunmak için vLLM öneriyor

4. Öne Çıkan Özellikler

Bağlamsal Anlama

32k bağlam sınırı içinde, doğrudan sesten sorulara yanıt verebilir ve özetler üretebilir.

Çok Dilli

Sekiz birincil dili otomatik olarak algılar ve yazıya döker: İngilizce, İspanyolca, Fransızca, Portekizce, Hintçe, Almanca, Felemenkçe ve İtalyanca.

Gürültüyle Başa Çıkma

Resmi değerlendirme çeşitli konuşma veri kümeleri içeriyor, ancak Mistral her gürültülü kayıt için genel geçer bir garanti yayımlamıyor.

Uç Dağıtım

Voxtral Mini yerel ve uç seçenektir. Resmi model kartı bf16/fp16'da yaklaşık 9.5 GB GPU RAM listeliyor.

5. Mimari

Üç ana bileşen:

  1. 1. Ses kodlayıcı: Dalga formunu öğrenilmiş ses temsillerine dönüştürür
  2. 2. Projektör: Ses temsillerini dil modelinin gizli uzayına eşler
  3. 3. Dil modeli omurgası: Transkriptler, yanıtlar, özetler veya araç çağrıları üretir

Bu tasarım, Voxtral'ın neden transkripsiyondan fazlasını yapabildiğini açıklıyor; ama aynı zamanda Whisper Turbo gibi yalnızca transkripsiyona odaklanan bir modelden çok daha büyük dil modeli ağırlıkları taşıdığı anlamına da geliyor.

Whisper Notes Neden Hâlâ Mantıklı

Voxtral ve Whisper Notes farklı sorunları çözüyor. Voxtral, transkripsiyonu ses anlamayla birleştiriyor; Whisper Notes ise tüketici sınıfı Apple donanımında kolayca çalışan, gizli transkripsiyona odaklanıyor.

Whisper Notes Ne Sunuyor

Gizlilik

Performans

  • Whisper teknolojisi, kanıtlanmış doğruluk
  • Apple Silicon için optimize
  • Güvenilir sonuçlar

Maliyet

  • Tek seferlik satın alma; App Store iPhone, iPad ve Mac App Store’u kapsar, denemeli DMG ayrı satılır
  • Dakika başına ücret yok
  • Sınırsız transkripsiyon

Kullanıcı Deneyimi

  • Sade arayüz
  • Düzenli güncellemeler
  • Sürekli iyileştirmeler

Depolama Gereksinimleri

Voxtral Small, tam hassasiyette sunucu sınıfı bir modeldir: resmi kartı yaklaşık 55 GB GPU RAM listeliyor. Voxtral Mini özellikle yerel ve uç kullanım için tasarlanmış, ancak kartı bf16/fp16'da yine yaklaşık 9.5 GB GPU RAM listeliyor. Whisper Turbo'nun uygulama içi indirme boyutu ise yaklaşık 1.6 GB — mevcut Whisper Notes ürünü için çok daha uygun.

Whisper Notes, Whisper Large-v3 Turbo kullanıyor — günlük kullanım için performansı, hızı ve VRAM gereksinimlerini dengeliyor. Makul kaynak gereksinimleriyle daha iyi modeller çıktığında onlara geçeceğiz.

Sesli soru-cevap, özetleme veya kendi sunucunuzda barındırma önemliyse Voxtral cazip. Whisper Notes ise gizli transkripsiyon isteyen ve tekrarlayan abonelik istemeyen bireysel kullanıcılara yönelik.

Bu Ne Anlama Geliyor

Voxtral, sesi yazıya dökmenin yanı sıra ses üzerinde akıl yürütebildiği için, düz konuşma tanımanın ötesine geçen önemli bir açık ağırlıklı adım.

Mac ve iPhone'da gizli, çevrimdışı transkripsiyon içinse daha küçük, uzmanlaşmış motorları paketlemek ve tutarlı çalıştırmak hâlâ daha kolay.

Tüm yerel seçenekleri mi karşılaştırıyorsunuz? Cihaz üzerinde çalışan her konuşmadan-metne model — Whisper varyantları, Parakeet V3, SenseVoice ve Voxtral — Whisper modelleri karşılaştırma sayfamızda yan yana karşılaştırılıyor.

Sıkça Sorulan Sorular

Mistral Voxtral nedir?

Voxtral, Mistral'in konuşma transkripsiyonu ve ses anlama için açık ağırlıklı model ailesidir. Temmuz 2025 sürümü, sunucu sınıfı iş yükleri için Voxtral Small 24B'yi ve yerel ile uç dağıtım için Voxtral Mini 3B'yi içerir. Her iki checkpoint de Apache 2.0 lisansı kullanır.

Voxtral bir Mac'te yerel olarak çalışabilir mi?

İndirilebilir ağırlıklar kendi sunucunuzda barındırılabilir, ancak iki boyutun gereksinimleri farklıdır. Voxtral Small bf16/fp16'da yaklaşık 55 GB GPU RAM ister, dolayısıyla sunucu sınıfı bir tercihtir. Voxtral Mini yerel ve uç checkpoint'tir; model kartı bf16/fp16'da yaklaşık 9.5 GB listeler ve Mac'teki gerçek hız ile bellek kullanımı çalışma zamanına ve kuantizasyona bağlıdır.

Whisper Notes Voxtral kullanıyor mu?

Hayır. Whisper Notes; Parakeet V3 (Mac'te varsayılan), Whisper Large-v3 Turbo ve SenseVoice çalıştırır — bu modeller, Apple Silicon üzerinde günlük kullanım için performansı, hızı ve VRAM gereksinimlerini dengeledikleri için seçildi. Tüketici donanımında pratik hale gelen daha iyi modeller çıktığında onları benimseyeceğiz.

Voxtral kaç dili destekliyor?

Resmi model kartları, otomatik algılamayla birlikte sekiz birincil dil listeliyor: İngilizce, İspanyolca, Fransızca, Portekizce, Hintçe, Almanca, Felemenkçe ve İtalyanca. Mistral, FLEURS'te Arapçayı da değerlendiriyor, ancak Arapça model kartının birincil dil listesinde yer almıyor.

Mistral Voxtral ne zaman yayımlandı?

Mistral, Voxtral'ı 15 Temmuz 2025'te yayımladı. İlk Apache 2.0 checkpoint'leri Voxtral Small 24B ve Voxtral Mini 3B idi.