Whisper Large V3 Turbo vs V3:Mac 上快 5 倍(基準測試)

2024年11月6日
·
6 min read
·Whisper Notes Team

OpenAI 的 Whisper Large-v3 Turbo 將解碼器從 32 層裁剪到 4 層,參數量從 15.5 億降至 8.09 億。在我們的 Apple Silicon 實測中,同一段音訊的轉錄速度快了約 5 倍,精準度幾乎不變。Whisper Notes 已在 Mac 和 iPhone 上搭載此模型。

Whisper Large V3 Turbo 與 V3 架構比較

V3 Turbo vs V3:改了什麼

Turbo 不是新架構。它就是 Whisper Large-v3,解碼器從 32 層剪枝到 4 層,然後微調恢復精準度。編碼器完全不變。

Large-v3 Turbo Large-v3
參數量 809M 1,550M
解碼器層數 4 32
語言數 100+ 100+
翻譯任務 不支援 支援
開源授權 MIT Apache 2.0

測試方法:同一個 10 分鐘音檔,在同一版 Whisper Notes 中於各裝置上轉錄。時間為從開始轉錄到最終文字產出的實際秒數;V3 和 Turbo 之間只更換模型,其餘條件不變。

Turbo 的訓練資料明確排除了翻譯任務。完整版 Large-v3 支援翻譯,但 Whisper Notes 只搭載 Turbo——翻譯功能透過 Apple Intelligence 單獨實現。

基礎模型:Whisper Large-v3 是什麼?

Whisper Large-v3 是 OpenAI 的旗艦開源語音辨識模型,2023 年 11 月釋出。它有 15.5 億參數,輸入採用 128 mel-bin 頻譜圖,用 500 萬小時音訊訓練(100 萬弱標註 + 400 萬偽標註),支援包含粵語在內的 100+ 種語言。在 Hugging Face Open ASR 排行榜上,它的平均詞錯率約 7.4%——本文通篇拿來衡量 Turbo 的準確率天花板就是它。想知道 Large-v3 和其他所有裝置端模型的對比,請見我們的 Whisper 模型比較

速度基準:Whisper Notes 在 Apple Silicon 上的表現

Mac 版 Whisper Notes 中,Turbo 透過 CoreML 在 Neural Engine 上執行。處理 10 分鐘音訊:

裝置 Whisper V3 V3 Turbo 提速
iPhone 15 Pro 425 秒 82 秒 5.2×
iPad Pro M2 380 秒 71 秒 5.4×
MacBook Pro M2 316 秒 63 秒 5.0×

5 倍提速是 Whisper Notes 在 Apple Silicon 上的實測結果,較小的解碼器在 Neural Engine 上最佳化效果更好。在 GPU 上使用 faster-whisper 等框架時,差距縮小到約 2.7 倍(見下方社群基準測試)。

精準度比較:WER 詞錯率

Hugging Face Open ASR 排行榜在相同的英文資料集上測試了兩個模型。Turbo 的詞錯率在每個基準上都與 V3 相差不到 0.5 個百分點:

資料集 V3 Turbo WER V3 WER
LibriSpeech Clean 2.10% 2.01%
LibriSpeech Other 4.24% 3.91%
GigaSpeech 10.14% 10.02%
Earnings22 11.63% 11.29%
AMI 16.13% 15.95%
平均 WER 7.83% 7.44%

V3 在每個資料集上都略微更準,但差距很小——平均僅 0.39 個百分點。在實際使用中,基本感受不到區別。

在 YouTube-commons 長音訊評估(最大的開源 ASR 基準之一)上,Turbo 的 WER 為 13.40%,V3 為 13.20%——但 Turbo 的即時因子達到 129.5×,而 V3 僅 55.3×。速度快 2.3 倍,精準度幾乎相同。

Turbo 在韓文、俄文等其他語言的準確率如何?

上面的基準測試都是英文。根據 OpenAI 的模型卡,Turbo 裁剪到 4 層的解碼器在非英語語言上損失的準確率比英語略多,低資源語言的退化最明顯。俄文和多數歐洲語言方面,Turbo 仍緊貼完整版 Large-v3——而且如果你用的是 Whisper Notes,Parakeet V3 以 Whisper 10 倍的速度涵蓋俄文和其他 24 種歐洲語言。

至於韓文、日文、中文和粵語,專門打造的模型既更快、標點也更好:SenseVoice 以 52 倍即時速度轉錄中日韓語音。Whisper Notes 在 Mac 和 iOS 上都同時內建 SenseVoice 和 Turbo,你可以按語言挑對的模型,而不是什麼都硬塞給同一個。

社群基準測試:GPU 與 CPU

來自 faster-whisper 和 whisper.cpp 社群的獨立基準測試在不同硬體上顯示了一致的結果。在 GPU 上使用 faster-whisper 轉錄 13 分鐘音訊:

模型 精度 耗時 GPU 顯示記憶體 WER
Large-v3 Turbo fp16 19.2 秒 2,537 MB 1.92%
Large-v3 fp16 52.0 秒 4,521 MB 2.88%
Large-v3 Turbo int8 19.6 秒 1,545 MB 1.92%
Distil-Large-v3 fp16 26.1 秒 2,409 MB 2.39%

資料來源:faster-whisper 在 NVIDIA GPU 上的基準測試,LibriSpeech clean 驗證集。Turbo int8 僅需 1.5 GB 顯示記憶體——2 GB 顯示卡也能跑。

在 RTX 3060 筆記型電腦(6 GB 顯示記憶體,int8 精度)上進行批次推理,優勢更加明顯:

模型 循序推理 批次 (10) 批次 WER
Large-v3 Turbo 46.1 秒 18.7 秒 7.7%
Large-v3 230.8 秒 43.0 秒 7.9%
Large-v2 178.3 秒 43.2 秒 8.8%
Medium 113.3 秒 26.3 秒 8.9%

資料來源:NilaierMusic 基準測試,Intel i7-12650H + RTX 3060 筆記型電腦 6 GB 顯示記憶體,法語音訊,int8 精度。

批次推理下,Turbo 在所有測試模型中 WER 最低(7.7%),同時速度最快。是正式環境的最佳選擇。

Turbo vs Medium vs 所有 Whisper 模型大小

在 Turbo 出現之前,Medium 是常見的折衷方案:可接受的準確率,還能忍受的速度。Turbo 讓這種取捨過時了——它的 809M 參數只比 Medium(769M)大一點點,卻以數倍的速度提供 large 等級的準確率。完整的模型家族並排如下:

模型 參數量 磁碟大小 相對速度 準確率等級
tiny 39M ~75 MB ~10× 最低
base 74M ~142 MB ~7×
small 244M ~466 MB ~4× 中等
medium 769M ~1.5 GB ~2×
large-v3 1,550M ~2.9 GB 1×(基準) 最高
large-v3-turbo 809M ~1.6 GB 在 Apple Silicon 上 ~5× 接近最高

Turbo 於 2024 年 9 月 30 日釋出,參數量 809M。如果你以前選 Medium 是為了省磁碟空間或求快,現在 Turbo 在幾乎相同的體積下,準確率和速度都贏過它。

已知限制(以及 Whisper Notes 的因應方案)

不支援翻譯

Turbo 的訓練資料不包含翻譯任務,只能用來源語言轉錄——不像 Large-v3 支援音訊→英文翻譯。

Whisper Notes — 透過 Apple Intelligence 自動將轉錄結果翻譯為你指定的語言,不管用哪個模型都能得到雙語輸出。

噪音環境下幻覺更多

社群回饋表明 Turbo 在極短音訊片段或高噪音錄音中,比 V3 更容易產生幻覺。這與解碼器縮減(4 層 vs 32 層)有關。

Whisper Notes — 轉錄前先執行 Pyannote VAD 語音活動偵測,辨識語音片段並去除靜音和噪音,讓模型只處理真正的人聲。

該選哪個模型?

英語 / 歐洲語言 Parakeet V3 — 比 Whisper 快 10 倍,精準度更高
中文 / 日語 / 韓語 SenseVoice — CJK 專用,52 倍速
其他語言 Whisper Large V3 Turbo — 100+ 種語言,準確率高,速度較慢

Whisper Large-v3 Turbo 常見問題

Whisper Large-v3 和 Large-v3 Turbo 的差別是什麼?

Large-v3 Turbo 保留 Large-v3 的編碼器,但把解碼器從 32 層減到 4 層。這就是它快得多、轉錄準確率又緊貼 Large-v3 的原因。代價是 Turbo 不支援 Whisper 內建的翻譯任務。

faster-whisper 支援 Large-v3 Turbo 嗎?

支援。faster-whisper 透過 CTranslate2 轉換支援 Large-v3 Turbo,社群基準測試顯示在顯示記憶體吃緊時 Turbo 是很好的選擇。在上面的測試中,Turbo int8 只用了約 1.5 GB 顯示記憶體。

whisper.cpp 支援 Large-v3 Turbo 嗎?

支援。whisper.cpp 可以執行轉換後的 GGML/GGUF 版 Whisper Large-v3 Turbo。如果你在自建本機轉錄流程,Turbo 通常比完整版 Large-v3 更容易塞進消費級硬體。

哪裡可以下載 openai/whisper-large-v3-turbo?

官方模型權重可在 Hugging Face 上從 OpenAI 取得。Whisper Notes 使用者不需要手動下載:Mac App 會在介面裡處理本機模型的安裝。

想比較所有本機方案?每一個裝置端語音轉文字模型——Whisper 各版本、Parakeet V3、SenseVoice 和 Voxtral——都在我們的 Whisper 模型比較頁面上並排比較。還不熟悉 Whisper 本身?可以先讀 Whisper 逐字稿指南——這個模型是什麼、有哪些執行方式、各要花多少錢。