Mistral Voxtral vs GPT-4o | Benchmark AI Suara

2 Agustus 2025
·
8 min read
·Whisper Notes Team

Mistral merilis Voxtral, keluarga model open-weight pertamanya untuk transkripsi dan pemahaman audio. Benchmark resminya menunjukkan pengenalan suara multibahasa dan tanya-jawab audio yang kuat, sementara kedua ukuran modelnya punya kebutuhan perangkat keras yang sangat berbeda. Berikut apa saja yang benar-benar didukung rilis ini dan alasan Whisper Notes tetap memakai model yang lebih kecil dan berfokus pada transkripsi di perangkat keras Apple kelas konsumen.

Benchmark performa Mistral Voxtral

Dua Model

Mistral merilis dua checkpoint berlisensi Apache 2.0 pada Juli 2025:

Voxtral Small 24B

  • 24 miliar parameter
  • Transkripsi, terjemahan, tanya-jawab audio, dan peringkasan
  • Jendela konteks 32k
  • Sekitar 55 GB RAM GPU dalam bf16/fp16

Voxtral Mini 3B

  • 3 miliar parameter
  • Rangkaian tugas audio-dan-teks yang sama dalam checkpoint yang lebih kecil
  • Secara resmi diposisikan untuk deployment lokal dan edge
  • Sekitar 9,5 GB RAM GPU dalam bf16/fp16

Bobot Terbuka dan Lisensi

Kedua checkpoint 2025 itu merupakan bobot terbuka (open weights) di bawah lisensi Apache 2.0. Anda dapat mengunduh dan menjalankannya sendiri:

  • Bobot model tersedia lengkap
  • Host sendiri atau modifikasi sesuai kebutuhan dalam batas lisensi Apache 2.0
  • Tanpa biaya API Mistral saat self-hosting; Anda tetap menanggung biaya komputasi sendiri
  • Proses audio di server Anda sendiri

Sumber: pengumuman rilis Voxtral dari Mistral, model card resmi Voxtral Small, dan model card resmi Voxtral Mini.

Benchmark

Rilis Mistral membandingkan word error rate (WER) rata-rata makro pada set bahasa Inggris bentuk pendek dan bentuk panjang, Mozilla Common Voice, FLEURS, dan Multilingual LibriSpeech. Dalam hasil FLEURS yang dilaporkan Mistral, Voxtral Small mengungguli Whisper di semua tugas yang dievaluasi. Semakin rendah WER, semakin baik:

Perbandingan benchmark WER Voxtral dengan semua model

WER FLEURS dari benchmark peluncuran Mistral yang dipetakan terhadap perkiraan harga API; baik hasil benchmark maupun harga bisa berubah

FLEURS hanyalah satu irisan dari kualitas transkripsi. Angka-angka ini adalah hasil yang dilaporkan vendor sendiri, jadi bandingkan definisi benchmark yang dipublikasikan dan uji sendiri bahasa, mikrofon, serta kondisi rekaman Anda sebelum memilih model.

Voxtral vs Whisper: Mana yang Sebaiknya Anda Pakai?

Benchmark hanya menceritakan sebagian kisah. Berikut perbandingan kedua keluarga model ini pada faktor-faktor yang benar-benar penting jika Anda ingin menjalankannya sendiri:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
Bahasa 8 bahasa utama 8 bahasa utama 100+ 100+
Open source Ya Ya Ya Ya
Ukuran model 24 miliar parameter; ~55 GB RAM GPU dalam bf16/fp16 3 miliar parameter; ~9,5 GB RAM GPU dalam bf16/fp16 1,55 miliar parameter 809 juta parameter (~1,6 GB)
Praktis di Mac konsumen Tidak, jika dijalankan full precision di perangkat keras umum Mungkin, dengan runtime yang kompatibel; lebih berat dari Turbo Ya Ya

Kesimpulannya: Voxtral Small melaporkan hasil WER yang kuat dan menambahkan pemahaman audio yang tidak dicoba oleh Whisper. Voxtral Mini adalah checkpoint yang diposisikan Mistral untuk deployment lokal dan edge, tetapi model card resminya tetap mencantumkan sekitar 9,5 GB RAM GPU dalam bf16/fp16. Untuk aplikasi transkripsi kelas konsumen, Whisper Large-v3 Turbo tetap lebih mudah dikemas dan mencakup jauh lebih banyak bahasa. Itulah alasan Whisper Notes saat ini memadukan Whisper Turbo dengan Parakeet V3 dan SenseVoice, bukan Voxtral.

Biaya API dan Self-Hosting

Per pemeriksaan pada 10 Juli 2026, model card Mistral mencantumkan harga input audio Voxtral Small sebesar $0.004 per menit. Input teks dan teks yang dihasilkan ditagih terpisah untuk permintaan pemahaman audio. Jika Anda meng-host sendiri bobot Apache 2.0-nya, tidak ada tagihan API dari Mistral, tetapi Anda membayar perangkat keras dan operasionalnya.

API Mistral

$0.004
per menit audio untuk Voxtral Small

Bobot self-host

Apache 2.0
tanpa biaya API; komputasi menjadi tanggung jawab Anda

Cara Kerjanya

Model card resminya menggambarkan Voxtral sebagai backbone model bahasa yang dilengkapi encoder audio dan mode transkripsi khusus. Batasan produk yang penting cukup konkret:

1. Arsitektur Multimodal

Voxtral menerima audio dan teks dalam percakapan yang sama, bukan sekadar berperan sebagai dekoder speech-to-text:

  • Mode khusus untuk transkripsi langsung
  • Tanya-jawab audio dan peringkasan terstruktur
  • Beberapa input audio sekaligus dan percakapan audio multi-giliran

Batas audio panjang

Jendela konteks 32k mendukung hingga 30 menit audio untuk transkripsi atau 40 menit untuk pemahaman audio yang lebih luas.

2. Bahasa dan Evaluasi

Mistral mencantumkan delapan bahasa utama dengan deteksi otomatis:

  • Inggris, Spanyol, Prancis, Portugis, Hindi, Jerman, Belanda, dan Italia
  • Benchmark-nya mencakup FLEURS, Mozilla Common Voice, dan Multilingual LibriSpeech
  • Rilis ini juga mengevaluasi audio bahasa Inggris bentuk pendek dan bentuk panjang secara terpisah

3. Kebutuhan Deployment

Bobot terbuka tidak berarti setiap checkpoint cukup kecil untuk setiap perangkat:

  • Voxtral Small membutuhkan sekitar 55 GB RAM GPU dalam bf16/fp16 menurut model card-nya
  • Voxtral Mini adalah checkpoint 3B yang ditujukan untuk deployment lokal dan edge
  • Mistral merekomendasikan vLLM untuk menyajikan checkpoint yang telah dirilis

4. Fitur Utama

Pemahaman Kontekstual

Dapat menjawab pertanyaan dan membuat ringkasan langsung dari audio, dalam batas konteks 32k.

Multibahasa

Mendeteksi dan mentranskripsikan delapan bahasa utama secara otomatis: Inggris, Spanyol, Prancis, Portugis, Hindi, Jerman, Belanda, dan Italia.

Penanganan Noise

Evaluasi resminya mencakup beragam dataset ucapan, tetapi Mistral tidak menerbitkan jaminan menyeluruh untuk setiap rekaman yang bising.

Deployment Edge

Voxtral Mini adalah opsi untuk lingkungan lokal dan edge. Model card resminya mencantumkan sekitar 9,5 GB RAM GPU dalam bf16/fp16.

5. Arsitektur

Tiga komponen utama:

  1. 1. Encoder audio: Mengubah gelombang suara menjadi representasi audio hasil pembelajaran
  2. 2. Projector: Memetakan representasi audio ke ruang tersembunyi model bahasa
  3. 3. Backbone model bahasa: Menghasilkan transkrip, jawaban, ringkasan, atau pemanggilan tool

Desain itu menjelaskan mengapa Voxtral mampu melakukan lebih dari sekadar transkripsi, tetapi ia juga harus membawa bobot model bahasa yang jauh lebih besar dibanding model khusus transkripsi seperti Whisper Turbo.

Mengapa Whisper Notes Tetap Masuk Akal

Voxtral dan Whisper Notes menyelesaikan masalah yang berbeda. Voxtral menggabungkan transkripsi dengan pemahaman audio; Whisper Notes berfokus pada transkripsi privat yang mudah dijalankan di perangkat keras Apple kelas konsumen.

Apa yang Ditawarkan Whisper Notes

Privasi

Performa

  • Teknologi Whisper, akurasi yang sudah teruji
  • Dioptimalkan untuk Apple Silicon
  • Hasil yang andal

Biaya

  • Whisper Notes memakai pembelian sekali tanpa langganan. Satu pembelian App Store mencakup versi iPhone, iPad, dan Mac App Store; versi DMG dari situs web adalah lisensi pembelian sekali yang dijual terpisah. Harga mengikuti kanal pembelian.
  • Tanpa biaya per menit
  • Transkripsi tanpa batas

Pengalaman Pengguna

  • Antarmuka sederhana
  • Pembaruan rutin
  • Peningkatan berkelanjutan

Kebutuhan Penyimpanan

Dalam full precision, Voxtral Small adalah model kelas server: card resminya mencantumkan sekitar 55 GB RAM GPU. Voxtral Mini memang ditujukan khusus untuk penggunaan lokal dan edge, tetapi card-nya tetap mencantumkan sekitar 9,5 GB RAM GPU dalam bf16/fp16. Sebagai perbandingan, unduhan Whisper Turbo di aplikasi hanya sekitar 1,6 GB — jauh lebih cocok untuk produk Whisper Notes saat ini.

Whisper Notes menggunakan Whisper Large-v3 Turbo — model yang menyeimbangkan performa, kecepatan, dan kebutuhan VRAM untuk pemakaian sehari-hari. Kami akan beralih ke model yang lebih baik begitu tersedia dengan kebutuhan sumber daya yang wajar.

Voxtral menarik jika tanya-jawab audio, peringkasan, atau deployment server self-host adalah kebutuhan utama Anda. Whisper Notes ditujukan bagi pengguna individu yang menginginkan transkripsi privat dan bebas dari langganan berulang.

Apa Artinya Ini

Voxtral adalah langkah open-weight penting yang melampaui pengenalan suara biasa, karena ia dapat bernalar atas audio sekaligus mentranskripsikannya.

Untuk transkripsi offline yang privat di Mac dan iPhone, engine khusus yang lebih kecil tetap lebih mudah dikemas dan dijalankan secara konsisten.

Sedang membandingkan semua opsi lokal? Setiap model speech-to-text on-device — varian Whisper, Parakeet V3, SenseVoice, dan Voxtral — dibandingkan berdampingan di halaman perbandingan model Whisper kami.

Pertanyaan yang Sering Diajukan

Apa itu Mistral Voxtral?

Voxtral adalah keluarga model open-weight dari Mistral untuk transkripsi ucapan dan pemahaman audio. Rilis Juli 2025 mencakup Voxtral Small 24B untuk beban kerja kelas server dan Voxtral Mini 3B untuk deployment lokal dan edge. Kedua checkpoint menggunakan lisensi Apache 2.0.

Bisakah Voxtral berjalan secara lokal di Mac?

Bobot yang dapat diunduh bisa di-host sendiri, tetapi kedua ukurannya punya kebutuhan yang berbeda. Voxtral Small memerlukan sekitar 55 GB RAM GPU dalam bf16/fp16, sehingga termasuk pilihan kelas server. Voxtral Mini adalah checkpoint untuk lingkungan lokal dan edge; model card-nya mencantumkan sekitar 9,5 GB dalam bf16/fp16, dan kecepatan serta pemakaian memori aktual di Mac bergantung pada runtime dan kuantisasi yang dipakai.

Apakah Whisper Notes memakai Voxtral?

Tidak. Whisper Notes menjalankan Parakeet V3 (default di Mac), Whisper Large-v3 Turbo, dan SenseVoice — model-model yang dipilih karena menyeimbangkan performa, kecepatan, dan kebutuhan VRAM untuk pemakaian sehari-hari di Apple Silicon. Kami akan mengadopsi model yang lebih baik begitu praktis dijalankan di perangkat keras konsumen.

Berapa banyak bahasa yang didukung Voxtral?

Model card resminya mencantumkan delapan bahasa utama dengan deteksi otomatis: Inggris, Spanyol, Prancis, Portugis, Hindi, Jerman, Belanda, dan Italia. Mistral juga mengevaluasi bahasa Arab di FLEURS, tetapi bahasa itu tidak termasuk dalam daftar bahasa utama di model card.

Kapan Mistral Voxtral dirilis?

Mistral merilis Voxtral pada 15 Juli 2025. Checkpoint Apache 2.0 awalnya adalah Voxtral Small 24B dan Voxtral Mini 3B.