Mistral Voxtral vs GPT-4o | 語音AI基準測試

2025年8月2日
·
8 min read
·Whisper Notes Team

Mistral 釋出了 Voxtral——它第一個用於轉錄與音訊理解的開放權重模型家族。官方基準測試展現了強勁的多語言語音辨識和音訊問答能力,但兩種模型大小的硬體需求差距很大。這篇文章整理這次釋出實際支援什麼,以及為什麼 Whisper Notes 在消費級 Apple 硬體上仍然採用更小、專注於轉錄的模型。

Mistral Voxtral 效能基準測試

兩個模型

Mistral 在 2025 年 7 月釋出了兩個 Apache 2.0 授權的 checkpoint:

Voxtral Small 24B

  • 240 億參數
  • 轉錄、翻譯、音訊問答與摘要
  • 32k 上下文視窗
  • bf16/fp16 下約需 55 GB GPU 記憶體

Voxtral Mini 3B

  • 30 億參數
  • 同一套音訊+文字任務,裝進更小的 checkpoint
  • 官方定位為本機與邊緣部署
  • bf16/fp16 下約需 9.5 GB GPU 記憶體

開放權重與授權

兩個 2025 年的 checkpoint 都以 Apache 2.0 授權開放權重。你可以自己下載執行:

  • 完整模型權重可取得
  • 可在 Apache 2.0 授權範圍內自架或修改
  • 自架不需付 Mistral API 費用;但算力還是要自己出
  • 音訊可在你自己的伺服器上處理

資料來源:Mistral 的 Voxtral 發布公告、官方 Voxtral Small 模型卡與官方 Voxtral Mini 模型卡

基準測試

Mistral 的發布資料比較了英文短音訊與長音訊、Mozilla Common Voice、FLEURS 和 Multilingual LibriSpeech 上的宏平均詞錯率。在 Mistral 公布的 FLEURS 結果中,Voxtral Small 在每一項受測任務上都贏過 Whisper。WER 越低越好:

Voxtral WER 基準測試與所有模型的比較

以 Mistral 發布時的 FLEURS WER 對照估計的 API 價格繪製;基準結果和價格都可能變動

FLEURS 只是轉錄品質的一個切面。這些是廠商自行公布的結果,選模型之前,請比對公開的基準定義,並用你自己的語言、麥克風和錄音環境實際測試。

Voxtral vs Whisper:該用哪個?

基準測試只說了一半的故事。如果你真的想自己跑一個模型,這兩個模型家族在關鍵條件上的對比如下:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
語言 8 種主要語言 8 種主要語言 100+ 100+
開源
模型大小 24B 參數;bf16/fp16 下約 55 GB GPU 記憶體 3B 參數;bf16/fp16 下約 9.5 GB GPU 記憶體 1.55B 參數 809M 參數(約 1.6 GB)
消費級 Mac 上實用嗎 一般硬體跑不動全精度 有相容的執行環境就可行;但比 Turbo 重 可以 可以

結論:Voxtral Small 公布的 WER 成績很強,還加上了 Whisper 沒打算做的音訊理解。Voxtral Mini 是 Mistral 定位給本機與邊緣部署的 checkpoint,但官方模型卡仍列出 bf16/fp16 下約 9.5 GB 的 GPU 記憶體需求。對一款消費級轉錄 App 來說,Whisper Large-v3 Turbo 仍然更容易出貨,語言覆蓋也廣得多。這就是 Whisper Notes 目前搭配 Whisper Turbo、Parakeet V3 和 SenseVoice,而不是 Voxtral 的原因。

API 與自架成本

截至 2026 年 7 月 10 日查證,Mistral 的模型卡列出 Voxtral Small 的音訊輸入價格為每分鐘 $0.004。音訊理解類請求的文字輸入與生成文字另外計費。如果你自架 Apache 2.0 權重,就沒有 Mistral API 費用,但硬體和維運要自己負擔。

Mistral API

$0.004
Voxtral Small 每音訊分鐘

自架權重

Apache 2.0
免 API 費;算力自理

運作原理

官方模型卡把 Voxtral 描述為一個帶音訊編碼器和專用轉錄模式的語言模型骨幹。產品層面的限制相當具體:

1. 多模態架構

Voxtral 能在同一段對話中同時接收音訊和文字,而不只是當一個語音轉文字解碼器:

  • 直接轉錄的專用模式
  • 音訊問答與結構化摘要
  • 多段音訊輸入與多輪音訊對話

長音訊限制

32k 上下文視窗支援最長 30 分鐘的轉錄音訊,或 40 分鐘的廣義音訊理解。

2. 語言與評測

Mistral 列出八種主要語言,支援自動偵測:

  • 英文、西班牙文、法文、葡萄牙文、印地文、德文、荷蘭文和義大利文
  • 基準測試包含 FLEURS、Mozilla Common Voice 和 Multilingual LibriSpeech
  • 發布資料也分別評測了英文短音訊與長音訊

3. 部署需求

開放權重不代表每個 checkpoint 都小到每台裝置都能跑:

  • 依模型卡所列,Voxtral Small 在 bf16/fp16 下約需 55 GB GPU 記憶體
  • Voxtral Mini 是為本機與邊緣部署準備的 3B checkpoint
  • Mistral 建議用 vLLM 來部署這批 checkpoint

4. 主要特性

語境理解

能在 32k 上下文限制內,直接針對音訊回答問題、產生摘要。

多語言

自動偵測並轉錄八種主要語言:英文、西班牙文、法文、葡萄牙文、印地文、德文、荷蘭文和義大利文。

雜訊處理

官方評測涵蓋多樣的語音資料集,但 Mistral 並未對每一種噪音錄音提出一體適用的保證。

邊緣部署

Voxtral Mini 是本機與邊緣的選項。官方模型卡列出 bf16/fp16 下約 9.5 GB 的 GPU 記憶體需求。

5. 架構

三個主要組件:

  1. 1. 音訊編碼器:把波形轉換成學習到的音訊表示
  2. 2. 投影層:把音訊表示映射到語言模型的隱藏空間
  3. 3. 語言模型骨幹:生成逐字稿、回答、摘要或工具呼叫

這種設計解釋了為什麼 Voxtral 能做的不只是轉錄,但它也因此背著比 Whisper Turbo 這類純轉錄模型大得多的語言模型權重。

為什麼 Whisper Notes 依然合理

Voxtral 和 Whisper Notes 解決的是不同的問題。Voxtral 把轉錄和音訊理解結合在一起;Whisper Notes 專注於在消費級 Apple 硬體上輕鬆執行的私密轉錄。

Whisper Notes 提供什麼

隱私

效能

  • Whisper 技術,準確度有口碑
  • 針對 Apple Silicon 最佳化
  • 結果穩定可靠

成本

  • 每平台 $7.99 一次買斷;Mac 版有 5,000 字免費試用
  • 沒有按分鐘收費
  • 轉錄不限量

使用體驗

  • 介面簡單
  • 定期更新
  • 持續改進

儲存空間需求

Voxtral Small 在全精度下是伺服器級模型:官方模型卡列出約 55 GB 的 GPU 記憶體。Voxtral Mini 明確定位給本機與邊緣使用,但模型卡在 bf16/fp16 下仍列出約 9.5 GB 的 GPU 記憶體。Whisper Turbo 在 App 內的下載約 1.6 GB,對現在的 Whisper Notes 產品來說是更合適的體量。

Whisper Notes 使用 Whisper Large-v3 Turbo——它在日常使用的效能、速度和顯示記憶體需求之間取得平衡。當有資源需求合理的更好模型出現時,我們會升級。

如果你在意音訊問答、摘要,或需要自架伺服器部署,Voxtral 很有吸引力。Whisper Notes 面向的是想要私密轉錄、不想再多一份訂閱的個人使用者。

這代表什麼

Voxtral 是開放權重模型跨出單純語音辨識的重要一步,因為它除了轉錄,還能對音訊進行推理。

但就 Mac 和 iPhone 上的私密離線轉錄而言,更小的專用引擎仍然更容易打包、跑起來也更穩定。

想比較所有本機方案?每一個裝置端語音轉文字模型——Whisper 各版本、Parakeet V3、SenseVoice 和 Voxtral——都在我們的 Whisper 模型比較頁面上並排比較。

常見問題

Mistral Voxtral 是什麼?

Voxtral 是 Mistral 用於語音轉錄與音訊理解的開放權重模型家族。2025 年 7 月的釋出包含面向伺服器級工作負載的 Voxtral Small 24B,以及面向本機與邊緣部署的 Voxtral Mini 3B。兩個 checkpoint 都採用 Apache 2.0 授權。

Voxtral 可以在 Mac 上本機執行嗎?

可下載的權重可以自架,但兩種大小的需求差很多。Voxtral Small 在 bf16/fp16 下約需 55 GB GPU 記憶體,屬於伺服器級選項。Voxtral Mini 是本機與邊緣的 checkpoint;模型卡列出 bf16/fp16 下約 9.5 GB,實際在 Mac 上的速度和記憶體用量取決於執行環境與量化方式。

Whisper Notes 有用 Voxtral 嗎?

沒有。Whisper Notes 執行 Parakeet V3(Mac 預設)、Whisper Large-v3 Turbo 和 SenseVoice——選這些模型,是因為它們在 Apple Silicon 的日常使用中,兼顧了效能、速度和顯示記憶體需求。一旦有更好的模型能在消費級硬體上實際跑起來,我們就會採用。

Voxtral 支援多少種語言?

官方模型卡列出八種主要語言,支援自動偵測:英文、西班牙文、法文、葡萄牙文、印地文、德文、荷蘭文和義大利文。Mistral 也在 FLEURS 裡評測了阿拉伯文,但它不在模型卡的主要語言清單中。

Mistral Voxtral 是什麼時候發布的?

Mistral 於 2025 年 7 月 15 日發布 Voxtral。最初的 Apache 2.0 checkpoint 是 Voxtral Small 24B 和 Voxtral Mini 3B。