Mistral telah mengeluarkan Voxtral, keluarga model open-weight pertamanya untuk transkripsi dan pemahaman audio. Penanda aras rasminya menunjukkan pengecaman pertuturan berbilang bahasa dan soal jawab audio yang kukuh, manakala dua saiz model itu mempunyai keperluan perkakasan yang jauh berbeza. Berikut ialah apa yang benar-benar disokong oleh keluaran ini dan sebab Whisper Notes masih menggunakan model yang lebih kecil dan tertumpu pada transkripsi di perkakasan Apple pengguna biasa.
Dua Model
Mistral mengeluarkan dua checkpoint berlesen Apache 2.0 pada Julai 2025:
Voxtral Small 24B
- •24 bilion parameter
- •Transkripsi, terjemahan, soal jawab audio dan ringkasan
- •Tetingkap konteks 32k
- •Kira-kira 55 GB RAM GPU dalam bf16/fp16
Voxtral Mini 3B
- •3 bilion parameter
- •Kumpulan tugasan audio-dan-teks yang sama dalam checkpoint yang lebih kecil
- •Diposisikan secara rasmi untuk penempatan tempatan dan edge
- •Kira-kira 9.5 GB RAM GPU dalam bf16/fp16
Wajaran Terbuka dan Lesen
Kedua-dua checkpoint 2025 itu ialah wajaran terbuka (open weights) di bawah lesen Apache 2.0. Anda boleh memuat turun dan menjalankannya sendiri:
- ✓ Wajaran model tersedia sepenuhnya
- ✓ Hos sendiri atau ubah suai dalam lingkungan lesen Apache 2.0
- ✓ Tiada yuran API Mistral apabila mengehos sendiri; anda tetap menanggung kos pengkomputeran sendiri
- ✓ Proses audio di pelayan anda sendiri
Sumber: pengumuman keluaran Voxtral daripada Mistral, model card rasmi Voxtral Small dan model card rasmi Voxtral Mini.
Penanda Aras
Keluaran Mistral membandingkan kadar ralat perkataan (WER) purata makro merentasi set bahasa Inggeris bentuk pendek dan bentuk panjang, Mozilla Common Voice, FLEURS dan Multilingual LibriSpeech. Dalam keputusan FLEURS yang dilaporkan Mistral, Voxtral Small mengatasi Whisper pada setiap tugasan yang dinilai. WER yang lebih rendah adalah lebih baik:
WER FLEURS daripada penanda aras pelancaran Mistral yang diplot terhadap anggaran harga API; kedua-dua keputusan penanda aras dan harga boleh berubah
FLEURS hanyalah satu sudut daripada kualiti transkripsi. Ini keputusan yang dilaporkan oleh vendor sendiri, jadi semak definisi penanda aras yang diterbitkan dan uji sendiri bahasa, mikrofon serta keadaan rakaman anda sebelum memilih model.
Voxtral vs Whisper: Yang Mana Patut Anda Guna?
Penanda aras cuma sebahagian daripada cerita. Beginilah dua keluarga model ini dibandingkan pada faktor yang benar-benar penting kalau anda mahu menjalankannya sendiri:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| Bahasa | 8 bahasa utama | 8 bahasa utama | 100+ | 100+ |
| Sumber terbuka | Ya | Ya | Ya | Ya |
| Saiz model | 24 bilion parameter; ~55 GB RAM GPU dalam bf16/fp16 | 3 bilion parameter; ~9.5 GB RAM GPU dalam bf16/fp16 | 1.55 bilion parameter | 809 juta parameter (~1.6 GB) |
| Praktikal pada Mac pengguna biasa | Tidak, jika dijalankan pada full precision di perkakasan biasa | Mungkin, dengan runtime yang serasi; lebih berat daripada Turbo | Ya | Ya |
Kesimpulannya: Voxtral Small melaporkan keputusan WER yang kukuh dan menambah keupayaan pemahaman audio yang tidak dicuba oleh Whisper. Voxtral Mini ialah checkpoint yang diposisikan Mistral untuk penempatan tempatan dan edge, tetapi model card rasminya masih menyenaraikan kira-kira 9.5 GB RAM GPU dalam bf16/fp16. Untuk aplikasi transkripsi pengguna biasa, Whisper Large-v3 Turbo kekal lebih mudah dihantar dan meliputi jauh lebih banyak bahasa. Sebab itulah Whisper Notes kini menggabungkan Whisper Turbo dengan Parakeet V3 dan SenseVoice, bukannya Voxtral.
Kos API dan Hos Sendiri
Setakat semakan pada 10 Julai 2026, model card Mistral menyenaraikan input audio Voxtral Small pada harga $0.004 seminit. Input teks dan teks yang dijana dicaj secara berasingan bagi permintaan pemahaman audio. Jika anda mengehos sendiri wajaran Apache 2.0 itu, tiada caj API Mistral, tetapi anda menanggung kos perkakasan dan operasi.
API Mistral
Wajaran hos sendiri
Bagaimana Ia Berfungsi
Model card rasmi menggambarkan Voxtral sebagai backbone model bahasa yang disertakan pengekod audio dan mod transkripsi khusus. Had produk yang penting adalah jelas:
1. Seni Bina Multimodal
Voxtral menerima audio dan teks dalam perbualan yang sama, bukan sekadar bertindak sebagai penyahkod pertuturan-ke-teks:
- •Mod khusus untuk transkripsi terus
- •Soal jawab audio dan ringkasan berstruktur
- •Berbilang input audio dan perbualan audio berbilang giliran
Had audio panjang
Tetingkap konteks 32k menyokong sehingga 30 minit audio untuk transkripsi atau 40 minit untuk pemahaman audio yang lebih luas.
2. Bahasa dan Penilaian
Mistral menyenaraikan lapan bahasa utama dengan pengesanan automatik:
- •Inggeris, Sepanyol, Perancis, Portugis, Hindi, Jerman, Belanda dan Itali
- •Penanda aras merangkumi FLEURS, Mozilla Common Voice dan Multilingual LibriSpeech
- •Keluaran ini turut menilai audio bahasa Inggeris bentuk pendek dan bentuk panjang secara berasingan
3. Keperluan Penempatan
Wajaran terbuka tidak bermakna setiap checkpoint cukup kecil untuk setiap peranti:
- •Voxtral Small memerlukan kira-kira 55 GB RAM GPU dalam bf16/fp16 menurut model card-nya
- •Voxtral Mini ialah checkpoint 3B yang ditujukan untuk penempatan tempatan dan edge
- •Mistral mengesyorkan vLLM untuk menyaji checkpoint yang telah dikeluarkan
4. Ciri Utama
Pemahaman Kontekstual
Boleh menjawab soalan dan menghasilkan ringkasan terus daripada audio, dalam had konteks 32k.
Berbilang Bahasa
Mengesan dan mentranskripsi lapan bahasa utama secara automatik: Inggeris, Sepanyol, Perancis, Portugis, Hindi, Jerman, Belanda dan Itali.
Pengendalian Hingar
Penilaian rasmi merangkumi pelbagai set data pertuturan, tetapi Mistral tidak menerbitkan jaminan menyeluruh untuk setiap rakaman yang bising.
Penempatan Edge
Voxtral Mini ialah pilihan untuk kegunaan tempatan dan edge. Model card rasminya menyenaraikan kira-kira 9.5 GB RAM GPU dalam bf16/fp16.
5. Seni Bina
Tiga komponen utama:
- 1. Pengekod audio: Menukar gelombang bunyi kepada perwakilan audio yang dipelajari
- 2. Projector: Memetakan perwakilan audio ke dalam ruang tersembunyi model bahasa
- 3. Backbone model bahasa: Menjana transkrip, jawapan, ringkasan atau panggilan alat
Reka bentuk itu menjelaskan sebab Voxtral mampu melakukan lebih daripada transkripsi, tetapi ia juga membawa wajaran model bahasa yang jauh lebih besar berbanding model khusus transkripsi seperti Whisper Turbo.
Sebab Whisper Notes Masih Relevan
Voxtral dan Whisper Notes menyelesaikan masalah yang berbeza. Voxtral menggabungkan transkripsi dengan pemahaman audio; Whisper Notes menumpukan pada transkripsi peribadi yang mudah dijalankan di perkakasan Apple pengguna biasa.
Apa yang Ditawarkan Whisper Notes
Privasi
- •Pemprosesan 100% luar talian
- •Tiada penghantaran data
- •Tiada kebergantungan pada awan
Prestasi
- •Teknologi Whisper, ketepatan yang terbukti
- •Dioptimumkan untuk Apple Silicon
- •Hasil yang boleh dipercayai
Kos
- •Whisper Notes menggunakan pembelian sekali tanpa langganan. Satu pembelian App Store merangkumi versi iPhone, iPad dan Mac App Store; versi DMG dari laman web ialah lesen pembelian sekali yang dijual berasingan. Harga mengikut saluran pembelian.
- •Tiada caj mengikut minit
- •Transkripsi tanpa had
Pengalaman Pengguna
- •Antara muka ringkas
- •Kemas kini berkala
- •Penambahbaikan berterusan
Keperluan Storan
Pada full precision, Voxtral Small ialah model kelas pelayan: card rasminya menyenaraikan kira-kira 55 GB RAM GPU. Voxtral Mini memang ditujukan khusus untuk kegunaan tempatan dan edge, tetapi card-nya masih menyenaraikan kira-kira 9.5 GB RAM GPU dalam bf16/fp16. Muat turun Whisper Turbo dalam aplikasi pula hanya sekitar 1.6 GB — lebih sesuai untuk produk Whisper Notes pada masa ini.
Whisper Notes menggunakan Whisper Large-v3 Turbo — ia mengimbangi prestasi, kelajuan dan keperluan VRAM untuk kegunaan harian. Kami akan menaik taraf kepada model yang lebih baik apabila ia tersedia dengan keperluan sumber yang munasabah.
Voxtral menarik apabila soal jawab audio, ringkasan atau penempatan pelayan hos sendiri menjadi keutamaan. Whisper Notes pula disasarkan kepada pengguna individu yang mahukan transkripsi peribadi dan tiada langganan berulang.
Apa Maksudnya
Voxtral ialah langkah open-weight yang penting melangkaui pengecaman pertuturan semata-mata, kerana ia boleh menaakul tentang audio dan bukan sekadar mentranskripsinya.
Untuk transkripsi luar talian yang peribadi pada Mac dan iPhone, enjin khusus yang lebih kecil kekal lebih mudah dibungkus dan dijalankan secara konsisten.
Nak membandingkan semua pilihan tempatan? Setiap model pertuturan-ke-teks pada peranti — varian Whisper, Parakeet V3, SenseVoice dan Voxtral — dibandingkan sebelah-menyebelah di halaman perbandingan model Whisper kami.
Soalan Lazim
Apakah Mistral Voxtral?
Voxtral ialah keluarga model open-weight daripada Mistral untuk transkripsi pertuturan dan pemahaman audio. Keluaran Julai 2025 merangkumi Voxtral Small 24B untuk beban kerja kelas pelayan dan Voxtral Mini 3B untuk penempatan tempatan dan edge. Kedua-dua checkpoint menggunakan lesen Apache 2.0.
Bolehkah Voxtral berjalan secara tempatan pada Mac?
Wajaran yang boleh dimuat turun memang boleh dihos sendiri, tetapi dua saiz itu mempunyai keperluan yang berbeza. Voxtral Small memerlukan kira-kira 55 GB RAM GPU dalam bf16/fp16, jadi ia pilihan kelas pelayan. Voxtral Mini ialah checkpoint untuk kegunaan tempatan dan edge; model card-nya menyenaraikan kira-kira 9.5 GB dalam bf16/fp16, dan kelajuan serta penggunaan memori sebenar pada Mac bergantung pada runtime dan pengkuantuman yang digunakan.
Adakah Whisper Notes menggunakan Voxtral?
Tidak. Whisper Notes menjalankan Parakeet V3 (lalai pada Mac), Whisper Large-v3 Turbo dan SenseVoice — model yang dipilih kerana mengimbangi prestasi, kelajuan dan keperluan VRAM untuk kegunaan harian pada Apple Silicon. Kami akan menerima pakai model yang lebih baik sebaik sahaja ia praktikal untuk dijalankan pada perkakasan pengguna biasa.
Berapa banyak bahasa yang disokong Voxtral?
Model card rasmi menyenaraikan lapan bahasa utama dengan pengesanan automatik: Inggeris, Sepanyol, Perancis, Portugis, Hindi, Jerman, Belanda dan Itali. Mistral turut menilai bahasa Arab dalam FLEURS, tetapi ia tidak termasuk dalam senarai bahasa utama model card tersebut.
Bilakah Mistral Voxtral dikeluarkan?
Mistral mengeluarkan Voxtral pada 15 Julai 2025. Checkpoint Apache 2.0 yang awal ialah Voxtral Small 24B dan Voxtral Mini 3B.