OpenAI 的 Whisper Large-v3 Turbo 將解碼器從 32 層裁剪到 4 層,參數量從 15.5 億降至 8.09 億。在我們的 Apple Silicon 實測中,同一段音訊的轉錄速度快了約 5 倍,精準度幾乎不變。Whisper Notes 已在 Mac 和 iPhone 上搭載此模型。
V3 Turbo vs V3:改了什麼
Turbo 不是新架構。它就是 Whisper Large-v3,解碼器從 32 層剪枝到 4 層,然後微調恢復精準度。編碼器完全不變。
| Large-v3 Turbo | Large-v3 | |
|---|---|---|
| 參數量 | 809M | 1,550M |
| 解碼器層數 | 4 | 32 |
| 語言數 | 100+ | 100+ |
| 翻譯任務 | 不支援 | 支援 |
| 開源授權 | MIT | Apache 2.0 |
測試方法:同一個 10 分鐘音檔,在同一版 Whisper Notes 中於各裝置上轉錄。時間為從開始轉錄到最終文字產出的實際秒數;V3 和 Turbo 之間只更換模型,其餘條件不變。
Turbo 的訓練資料明確排除了翻譯任務。完整版 Large-v3 支援翻譯,但 Whisper Notes 只搭載 Turbo——翻譯功能透過 Apple Intelligence 單獨實現。
基礎模型:Whisper Large-v3 是什麼?
Whisper Large-v3 是 OpenAI 的旗艦開源語音辨識模型,2023 年 11 月釋出。它有 15.5 億參數,輸入採用 128 mel-bin 頻譜圖,用 500 萬小時音訊訓練(100 萬弱標註 + 400 萬偽標註),支援包含粵語在內的 100+ 種語言。在 Hugging Face Open ASR 排行榜上,它的平均詞錯率約 7.4%——本文通篇拿來衡量 Turbo 的準確率天花板就是它。想知道 Large-v3 和其他所有裝置端模型的對比,請見我們的 Whisper 模型比較。
速度基準:Whisper Notes 在 Apple Silicon 上的表現
在 Mac 版 Whisper Notes 中,Turbo 透過 CoreML 在 Neural Engine 上執行。處理 10 分鐘音訊:
| 裝置 | Whisper V3 | V3 Turbo | 提速 |
|---|---|---|---|
| iPhone 15 Pro | 425 秒 | 82 秒 | 5.2× |
| iPad Pro M2 | 380 秒 | 71 秒 | 5.4× |
| MacBook Pro M2 | 316 秒 | 63 秒 | 5.0× |
5 倍提速是 Whisper Notes 在 Apple Silicon 上的實測結果,較小的解碼器在 Neural Engine 上最佳化效果更好。在 GPU 上使用 faster-whisper 等框架時,差距縮小到約 2.7 倍(見下方社群基準測試)。
精準度比較:WER 詞錯率
Hugging Face Open ASR 排行榜在相同的英文資料集上測試了兩個模型。Turbo 的詞錯率在每個基準上都與 V3 相差不到 0.5 個百分點:
| 資料集 | V3 Turbo WER | V3 WER |
|---|---|---|
| LibriSpeech Clean | 2.10% | 2.01% |
| LibriSpeech Other | 4.24% | 3.91% |
| GigaSpeech | 10.14% | 10.02% |
| Earnings22 | 11.63% | 11.29% |
| AMI | 16.13% | 15.95% |
| 平均 WER | 7.83% | 7.44% |
V3 在每個資料集上都略微更準,但差距很小——平均僅 0.39 個百分點。在實際使用中,基本感受不到區別。
在 YouTube-commons 長音訊評估(最大的開源 ASR 基準之一)上,Turbo 的 WER 為 13.40%,V3 為 13.20%——但 Turbo 的即時因子達到 129.5×,而 V3 僅 55.3×。速度快 2.3 倍,精準度幾乎相同。
Turbo 在韓文、俄文等其他語言的準確率如何?
上面的基準測試都是英文。根據 OpenAI 的模型卡,Turbo 裁剪到 4 層的解碼器在非英語語言上損失的準確率比英語略多,低資源語言的退化最明顯。俄文和多數歐洲語言方面,Turbo 仍緊貼完整版 Large-v3——而且如果你用的是 Whisper Notes,Parakeet V3 以 Whisper 10 倍的速度涵蓋俄文和其他 24 種歐洲語言。
至於韓文、日文、中文和粵語,專門打造的模型既更快、標點也更好:SenseVoice 以 52 倍即時速度轉錄中日韓語音。Whisper Notes 在 Mac 和 iOS 上都同時內建 SenseVoice 和 Turbo,你可以按語言挑對的模型,而不是什麼都硬塞給同一個。
社群基準測試:GPU 與 CPU
來自 faster-whisper 和 whisper.cpp 社群的獨立基準測試在不同硬體上顯示了一致的結果。在 GPU 上使用 faster-whisper 轉錄 13 分鐘音訊:
| 模型 | 精度 | 耗時 | GPU 顯示記憶體 | WER |
|---|---|---|---|---|
| Large-v3 Turbo | fp16 | 19.2 秒 | 2,537 MB | 1.92% |
| Large-v3 | fp16 | 52.0 秒 | 4,521 MB | 2.88% |
| Large-v3 Turbo | int8 | 19.6 秒 | 1,545 MB | 1.92% |
| Distil-Large-v3 | fp16 | 26.1 秒 | 2,409 MB | 2.39% |
資料來源:faster-whisper 在 NVIDIA GPU 上的基準測試,LibriSpeech clean 驗證集。Turbo int8 僅需 1.5 GB 顯示記憶體——2 GB 顯示卡也能跑。
在 RTX 3060 筆記型電腦(6 GB 顯示記憶體,int8 精度)上進行批次推理,優勢更加明顯:
| 模型 | 循序推理 | 批次 (10) | 批次 WER |
|---|---|---|---|
| Large-v3 Turbo | 46.1 秒 | 18.7 秒 | 7.7% |
| Large-v3 | 230.8 秒 | 43.0 秒 | 7.9% |
| Large-v2 | 178.3 秒 | 43.2 秒 | 8.8% |
| Medium | 113.3 秒 | 26.3 秒 | 8.9% |
資料來源:NilaierMusic 基準測試,Intel i7-12650H + RTX 3060 筆記型電腦 6 GB 顯示記憶體,法語音訊,int8 精度。
批次推理下,Turbo 在所有測試模型中 WER 最低(7.7%),同時速度最快。是正式環境的最佳選擇。
Turbo vs Medium vs 所有 Whisper 模型大小
在 Turbo 出現之前,Medium 是常見的折衷方案:可接受的準確率,還能忍受的速度。Turbo 讓這種取捨過時了——它的 809M 參數只比 Medium(769M)大一點點,卻以數倍的速度提供 large 等級的準確率。完整的模型家族並排如下:
| 模型 | 參數量 | 磁碟大小 | 相對速度 | 準確率等級 |
|---|---|---|---|---|
| tiny | 39M | ~75 MB | ~10× | 最低 |
| base | 74M | ~142 MB | ~7× | 低 |
| small | 244M | ~466 MB | ~4× | 中等 |
| medium | 769M | ~1.5 GB | ~2× | 高 |
| large-v3 | 1,550M | ~2.9 GB | 1×(基準) | 最高 |
| large-v3-turbo | 809M | ~1.6 GB | 在 Apple Silicon 上 ~5× | 接近最高 |
Turbo 於 2024 年 9 月 30 日釋出,參數量 809M。如果你以前選 Medium 是為了省磁碟空間或求快,現在 Turbo 在幾乎相同的體積下,準確率和速度都贏過它。
已知限制(以及 Whisper Notes 的因應方案)
不支援翻譯
Turbo 的訓練資料不包含翻譯任務,只能用來源語言轉錄——不像 Large-v3 支援音訊→英文翻譯。
Whisper Notes — 透過 Apple Intelligence 自動將轉錄結果翻譯為你指定的語言,不管用哪個模型都能得到雙語輸出。
噪音環境下幻覺更多
社群回饋表明 Turbo 在極短音訊片段或高噪音錄音中,比 V3 更容易產生幻覺。這與解碼器縮減(4 層 vs 32 層)有關。
Whisper Notes — 轉錄前先執行 Pyannote VAD 語音活動偵測,辨識語音片段並去除靜音和噪音,讓模型只處理真正的人聲。
該選哪個模型?
| 英語 / 歐洲語言 | Parakeet V3 — 比 Whisper 快 10 倍,精準度更高 |
| 中文 / 日語 / 韓語 | SenseVoice — CJK 專用,52 倍速 |
| 其他語言 | Whisper Large V3 Turbo — 100+ 種語言,準確率高,速度較慢 |
Whisper Large-v3 Turbo 常見問題
Whisper Large-v3 和 Large-v3 Turbo 的差別是什麼?
Large-v3 Turbo 保留 Large-v3 的編碼器,但把解碼器從 32 層減到 4 層。這就是它快得多、轉錄準確率又緊貼 Large-v3 的原因。代價是 Turbo 不支援 Whisper 內建的翻譯任務。
faster-whisper 支援 Large-v3 Turbo 嗎?
支援。faster-whisper 透過 CTranslate2 轉換支援 Large-v3 Turbo,社群基準測試顯示在顯示記憶體吃緊時 Turbo 是很好的選擇。在上面的測試中,Turbo int8 只用了約 1.5 GB 顯示記憶體。
whisper.cpp 支援 Large-v3 Turbo 嗎?
支援。whisper.cpp 可以執行轉換後的 GGML/GGUF 版 Whisper Large-v3 Turbo。如果你在自建本機轉錄流程,Turbo 通常比完整版 Large-v3 更容易塞進消費級硬體。
哪裡可以下載 openai/whisper-large-v3-turbo?
官方模型權重可在 Hugging Face 上從 OpenAI 取得。Whisper Notes 使用者不需要手動下載:Mac App 會在介面裡處理本機模型的安裝。
想比較所有本機方案?每一個裝置端語音轉文字模型——Whisper 各版本、Parakeet V3、SenseVoice 和 Voxtral——都在我們的 Whisper 模型比較頁面上並排比較。還不熟悉 Whisper 本身?可以先讀 Whisper 逐字稿指南——這個模型是什麼、有哪些執行方式、各要花多少錢。