我們想弄清楚一件事:有沒有哪個本機模型,在你講的語言上比 Whisper Large V3 更準?於是我們拿 FLEURS 資料集把這幾個模型都跑了一遍。
FLEURS 是 Google 的資料集,收錄 102 種語言的朗讀語音。我們從每種語言抽出約 75 句,讓這五個模型聽同一批片段、同樣的順序:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
結果大致是這樣。
Qwen3-ASR 1.7B 對 Whisper Large V3 Turbo——我們自己跑的 FLEURS,一台 M5 MacBook Air,朗讀語音,短片段。
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| 支援語言 | 30 種 | 101 種 |
| 明顯優勢 | 粵語、印地語、泰語、越南語、法語(5 種) | 芬蘭語、匈牙利語、希臘語等 11 種 |
| 速度 | 即時速度的 8.7 倍 | 即時速度的 2.4 倍 |
| 峰值記憶體 | 2.43 GiB | 1.87 GiB |
| 下載大小 | 約 2.5 GB | 約 1.6 GB |
除了各自的強項語言之外,兩者的準確率差距不大。
Whisper Large V3 和 Qwen3-ASR 詳細比較
全部 30 種語言,依 Qwen 領先最多排到落後最多,兩欄都是數字越低越好。
我們自己跑的 FLEURS,一台 M5 MacBook Air,朗讀語音。中文、粵語、日語、韓語、泰語為字錯率,其餘為詞錯率;標綠表示領先幅度超出配對的 95% 誤差範圍。
| 語言 | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| 粵語 | 6.00 | 37.97 |
| 印地語 | 13.67 | 30.42 |
| 泰語 | 5.92 | 12.95 |
| 越南語 | 5.07 | 9.79 |
| 波斯語 | 26.98 | 30.03 |
| 阿拉伯語 | 14.14 | 15.75 |
| 印尼語 | 4.97 | 6.50 |
| 法語 | 3.98 | 5.39 |
| 中文 | 5.69 | 6.88 |
| 英語 | 5.07 | 5.92 |
| 德語 | 3.51 | 4.10 |
| 日語 | 5.39 | 5.71 |
| 韓語 | 3.51 | 3.70 |
| 西班牙語 | 3.60 | 3.76 |
| 義大利語 | 2.98 | 3.05 |
| 俄語 | 5.98 | 5.51 |
| 葡萄牙語 | 5.64 | 4.91 |
| 馬其頓語 | 17.81 | 16.64 |
| 馬來語 | 11.60 | 10.18 |
| 荷蘭語 | 7.65 | 5.63 |
| 土耳其語 | 8.34 | 5.53 |
| 丹麥語 | 20.12 | 14.92 |
| 波蘭語 | 12.78 | 5.32 |
| 羅馬尼亞語 | 18.97 | 8.22 |
| 菲律賓語 | 20.44 | 9.37 |
| 瑞典語 | 20.04 | 8.72 |
| 捷克語 | 23.92 | 11.15 |
| 希臘語 | 30.20 | 12.97 |
| 芬蘭語 | 26.08 | 6.54 |
| 匈牙利語 | 36.35 | 13.66 |
我們自己做的配對測試,FLEURS 測試集版本 70bb2e84,每種語言約 75 句,一台 M5 MacBook Air。
Qwen3-ASR 1.7B 明顯勝出的 5 種。錯誤率百分比(Qwen 對 Turbo):粵語(6.0 對 38.0)、印地語(13.7 對 30.4)、泰語(5.9 對 13.0)、越南語(5.1 對 9.8)、法語(4.0 對 5.4)。粵語、泰語算字錯率,其餘算詞錯率。它的優勢集中在按字計分的語言上:中文、粵語、日語、韓語、泰語這五種它平均 5.3%,Turbo 是 13.4%;按詞計分的另外二十五種剛好相反,它平均 14.0%,Turbo 是 10.2%。
Whisper Large V3 Turbo 明顯勝出的 11 種。錯誤率百分比(Qwen 對 Turbo),全部是詞錯率:匈牙利語(36.4 對 13.7)、希臘語(30.2 對 13.0)、芬蘭語(26.1 對 6.5)、捷克語(23.9 對 11.2)、菲律賓語(20.4 對 9.4)、丹麥語(20.1 對 14.9)、瑞典語(20.0 對 8.7)、羅馬尼亞語(19.0 對 8.2)、波蘭語(12.8 對 5.3)、土耳其語(8.3 對 5.5)、荷蘭語(7.7 對 5.6)。
接近或打平的 14 種。英語(5.1 對 5.9)、德語(3.5 對 4.1)、西班牙語(3.6 對 3.8)、義大利語(3.0 對 3.1)、俄語(6.0 對 5.5)、葡萄牙語(5.6 對 4.9);中文(5.7 對 6.9)、日語(5.4 對 5.7)、韓語(3.5 對 3.7)算字錯率。另外還有阿拉伯語、印尼語、波斯語、馬來語、馬其頓語。這一檔的差距都很小,全落在 95% 區間裡,這一輪的資料分不出高下。
粵語是唯一一行真的會改變選擇的。同一批音訊上,Whisper Large V3 Turbo 是 37.97% 字錯率,我們先前推薦拿來做粵語的 SenseVoice Small 是 36.71%,兩個都在 37% 上下;Qwen3-ASR 1.7B 是 6.00%。在這套朗讀語音上,前面兩個數字都撐不起粵語,所以舊的建議從現在起要帶上這個但書。
Qwen3-ASR 1.7B 有多快?
五個引擎都在同一套測試、同一台機器(M5 MacBook Air)上量出來,彼此之間至少是可比的。
同一次 FLEURS 測試裡,各引擎在自己支援的語言上的即時倍率中位數,一台 M5 MacBook Air,朗讀語音。
| 引擎 | 語言數 | 本輪速度中位數(短片段) |
|---|---|---|
| SenseVoice Small | 6 種語言 | 161.0 倍 |
| Parakeet TDT 0.6B v3 | 25 | 82.9 倍 |
| Qwen3-ASR 1.7B | 標稱 30 種 | 8.7 倍 |
| Whisper Small | 101 | 6.4 倍 |
| Whisper Large V3 Turbo | 101 | 2.4 倍 |
這些是短片段測試台的數字,比同樣的引擎處理長錄音時要低。這一欄只用來在這一輪裡橫向比較各引擎,別處不算數。
同一套測試裡,Parakeet V3 和 SenseVoice Small 比 Qwen3-ASR 快了大約一個數量級。換成長檔案而不是短片段,Parakeet 在 M4 Pro 上跑到過即時速度的 103 倍,SenseVoice 是 52 倍以上(另一套音訊上的另一種量法,但指向一致)。
Qwen3-ASR 落在中間。本輪短片段測試裡它不是最慢的,最慢的是 Whisper Large V3 Turbo。不過它在不同語言之間的落差比誰都大,希臘語 2.7 倍,日語 12.4 倍。
Qwen3-ASR 佔多少記憶體和磁碟?
峰值記憶體是同一次 FLEURS 測試中逐個項目觀測到的行程最大佔用,一台 M5 MacBook Air,朗讀語音,短片段。
| 引擎 | 下載大小 | 本輪峰值記憶體 |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0.09 GiB |
| Whisper Small | 600 MB | 0.87 GiB |
| SenseVoice Small | 827 MB | 0.95 GiB |
| Whisper Large V3 Turbo | 約 1.6 GB | 1.87 GiB |
| Qwen3-ASR 1.7B | 約 2.5 GB | 2.43 GiB |
兩條軸上 Qwen3-ASR 都是五個裡面最重的:下載約 2.5 GB,本輪行程峰值記憶體 2.43 GiB;Whisper Large V3 Turbo 是約 1.6 GB 和 1.87 GiB。
8 GB 記憶體的機器有更輕的路可以走。Parakeet V3 用 465 MB 和 0.09 GiB 涵蓋 25 種語言,Whisper Small 用 600 MB 和 0.87 GiB 涵蓋 101 種。
我們怎麼測的:FLEURS、30 種語言、一台 Mac
Qwen3-ASR 1.7B 用的是 MLX 8-bit 版本,Whisper Large V3 Turbo 用的是 whisper.cpp 的 ggml 版本,跑在 Metal 上。資料是 Google FLEURS 測試集 70bb2e84 版(CC-BY-4.0),102 種語言裡跑了 83 種,每種約 75 句、約 15 分鐘,所有模型聽同一批片段、同樣的順序;配對比較的是 Qwen 標稱的那 30 種。以空格斷詞的語言用詞錯率,中文、粵語、日語、韓語、泰語用字錯率,兩者不合併成單一分數;誤差範圍是每格 10,000 次項目層級自助重抽樣。機器是一台 M5 MacBook Air,32 GB,macOS 26.5,兩個模型都沒有空輸出或失敗。
FLEURS 是朗讀語音,不是會議,也不是聽寫。朗讀集的排名在真實音訊面前失效過兩次,所以我們不往長錄音外推:這些表是用來判斷一個模型在你的語言上值不值得一試,不是你實際會拿到的準確率。真實會議上的評測跑完會另外寫一篇。
該不該用 Qwen3-ASR 取代 Whisper Large V3?
按語言來看,在 Mac 版 Whisper Notes 裡,我們會這樣回答。
- 如果你要轉錄粵語、印地語、泰語、越南語或法語:選 Qwen3-ASR 1.7B。
- 如果你要轉錄中文、日語、韓語、英語、德語、西班牙語或義大利語:它只領先一點點,我們也只敢講這一點點。兩個模型都可以用,波斯語、阿拉伯語、印尼語、俄語、葡萄牙語、馬其頓語和馬來語也一樣。
- 如果你要轉錄芬蘭語、匈牙利語、希臘語、捷克語、瑞典語、丹麥語、波蘭語、羅馬尼亞語、菲律賓語、土耳其語或荷蘭語:繼續用 Whisper Large V3 Turbo,這十一種它都明顯勝出。
- 如果你在意的是速度和佔用:這個引擎不適合。同一套測試裡 Parakeet V3 和 SenseVoice Small 快了一個數量級,下載大小也只有它的零頭;Whisper Small 用 600 MB 涵蓋 101 種語言,本輪 6.4 倍。
- 如果你用的是 iPhone 版或 Mac App Store 版:這個引擎還沒有進到那兩個管道,粵語在那裡請用 SenseVoice。
這是 Mac 版 Whisper Notes 把阿里巴巴開源的 Qwen3-ASR 移植到裝置上的版本:開放權重轉成 Apple MLX 的 8-bit,跑在你自己 Mac 的 GPU 上,音訊不必上傳到阿里巴巴的伺服器。它和 Mac 直接下載版(DMG)1.5.0 裡被 SenseVoice 換掉的那個 0.6B 不是同一個模型。
基本用法(Mac 直接下載版 DMG 1.6.0 及以後):設定 → 轉錄模型 → Qwen3-ASR 1.7B。模型第一次使用時會在 App 內下載,約 2.5 GB。它需要 macOS 15 以上、Apple 晶片,建議 16 GB 記憶體;App 其餘部分在 macOS 14 上就能跑。按引擎劃分的語言表在語言支援頁上。本機 CLI 和 MCP 伺服器接受 qwen、qwen3、qwen3-asr 三個名字。
不想換的話什麼都不用改,Parakeet V3 仍然是預設。
常見問題
Qwen3-ASR 比 Whisper Large V3 Turbo 更準嗎?
要看語言,而且比數接近對半。在我們自己用 Mac 版 Whisper Notes 跑的 FLEURS 測試裡,兩個模型共同支援的 30 種語言中,Qwen3-ASR 1.7B 贏 15 種,Whisper Large V3 Turbo 贏 15 種。Qwen 明顯領先的是粵語(6.00% 對 37.97% 字錯率)、印地語(13.67% 對 30.42% 詞錯率)、泰語、越南語和法語。Turbo 明顯領先的是芬蘭語(6.54% 對 26.08% 詞錯率)、匈牙利語、希臘語、捷克語、瑞典語、丹麥語、波蘭語、羅馬尼亞語、菲律賓語、土耳其語和荷蘭語。30 個差距裡有 14 個落在誤差範圍內,應該當成平手。如果你的語言在 Qwen 領先的那一欄,而且你用的是 Whisper Notes 的 Mac 直接下載版(DMG),就選 Qwen3-ASR;其餘情況、以及 Qwen 那 30 種以外的所有語言,選 Whisper Large V3 Turbo——它涵蓋全部 101 種語言。
iPhone 版或 Mac App Store 版能用 Qwen3-ASR 嗎?
目前它在 Whisper Notes 的 Mac 直接下載版(DMG)1.6.0 及以後的版本裡。Mac App Store 版計畫在後續版本陸續支援新引擎,確切時間我們還說不準。在那之前,iPhone 版和 Mac App Store 版有三個引擎系列——Whisper、Parakeet V3、SenseVoice——而 Qwen 認得的每一種語言,那邊的 Whisper 也都涵蓋。按模型數量算,Mac App Store 版目前是四個,直接下載版是五個,因為 Whisper 有 Small 和 Large V3 Turbo 兩檔。如果你要在 iPhone 上轉錄粵語,那裡請用 SenseVoice。
中文、日語、韓語該選 Qwen3-ASR 還是 SenseVoice?
準確率很接近,速度差很遠。我們的 FLEURS 測試裡,Qwen3-ASR 中文字錯率 5.69%、日語 5.39%、韓語 3.51%;SenseVoice Small 在同一批音訊上分別是 7.06%、6.85%、7.82%。但同一輪裡 SenseVoice 的即時倍率中位數是 161 倍,Qwen 是 8.7 倍;下載大小是 827 MB 對約 2.5 GB;而且 SenseVoice 在 iPhone 和兩個 Mac 版本上都能用。除非你要轉錄的是粵語——那裡 Qwen3-ASR 是 6.00% 字錯率、SenseVoice 是 36.71%,差距大到值得多等一下——否則選 SenseVoice。
Qwen3-ASR 1.7B 的系統需求是什麼?
需要一台 Apple 晶片的 Mac,macOS 15 或更新版本,建議 16 GB 記憶體,另外約 2.5 GB 磁碟空間放模型。這比 Mac 版 Whisper Notes 其餘部分的要求更高——App 本身在 macOS 14 以上就能執行。我們的測試裡這個模型的行程峰值記憶體是 2.43 GiB,五個引擎裡最高。如果你的 Mac 是 8 GB 記憶體,Whisper Small 用 600 MB 涵蓋同樣的 101 種語言,Parakeet V3 用 465 MB 涵蓋 25 種歐洲語言。
用 Qwen3-ASR 的時候,音訊會離開我的 Mac 嗎?
不會。阿里巴巴確實也把 Qwen3-ASR 做成雲端服務,透過 DashScope 的即時 API 和錄音檔轉寫 API 提供,那條路徑需要把音訊上傳到他們的伺服器。Whisper Notes 不使用那些介面。它把開放權重當成 MLX 8-bit 模型跑在你 Mac 自己的 GPU 上,不需要帳號,不需要 API key,斷網也能轉錄。App 裡每個引擎系列、每個通路都是這樣。
為什麼這些數字和我在自己的錄音上得到的準確率對不起來?
因為 FLEURS 是短句、乾淨的朗讀語音,而你的錄音不是。我們這一輪是在公開資料集上做的校準:每種語言約 75 句,一台 M5 MacBook Air,所有模型聽同樣的片段。它適合判斷某個模型在某種語言上值不值得一試,不能用來預測你在會議、吵雜環境、帶口音的語音或兩小時長檔上的準確率。
去試試看
Qwen3-ASR 1.7B 在 Mac 版 Whisper Notes 1.6.0 及以後的直接下載版(DMG)裡。位置是設定 → 轉錄模型。免費試用額度是 10,000 字,夠你把自己的語言跑一遍,然後來反駁上面那幾張表。
某種語言上我們的數字和你的實際體驗對不起來,寫信到 mac@whispernotes.app 告訴我們。完整更新說明:whispernotes.app/changelog。
以上所有資料的來源:我們在 Google FLEURS 測試集 70bb2e84 版本上的測試、Qwen3-ASR 1.7B 模型卡,以及語言支援頁上按引擎劃分的語言表——那張表由 App 原始碼生成。