我們想弄清楚一件事:有沒有哪個本機模型,在你講的語言上比 Whisper Large V3 更準?於是我們拿 FLEURS 資料集把這幾個模型都跑了一遍。
FLEURS 是 Google 的資料集,收錄 102 種語言的朗讀語音。我們從每種語言抽出約 150 句,讓這五個模型聽同一批片段、同樣的順序:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
結果大致是這樣。
Qwen3-ASR 1.7B 對 Whisper Large V3 Turbo——我們自己跑的 FLEURS,一台 M5 MacBook Air,朗讀語音,短片段。
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| 支援語言 | 30 種 | 101 種 |
| 明顯優勢 | 粵語、印地語、泰語、越南語、法語等(7 種) | 芬蘭語、匈牙利語、希臘語等 11 種 |
| 速度 | 即時速度的 9.6 倍 | 即時速度的 2.6 倍 |
| 峰值記憶體 | 2.43 GiB | 1.87 GiB |
| 下載大小 | 約 2.5 GB | 約 1.6 GB |
除了各自的強項語言之外,兩者的準確率差距不大。
Whisper Large V3 和 Qwen3-ASR 詳細比較
全部 30 種語言,依 Qwen 領先最多排到落後最多,兩欄都是數字越低越好。
我們自己跑的 FLEURS,一台 M5 MacBook Air,朗讀語音。中文、粵語、日語、韓語、泰語為字錯率,其餘為詞錯率;標綠表示領先幅度超出配對的 95% 誤差範圍。
| 語言 | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| 粵語 | 6.44 | 36.75 |
| 印地語 | 13.19 | 29.64 |
| 泰語 | 6.53 | 13.40 |
| 越南語 | 4.91 | 8.10 |
| 中文 | 6.49 | 7.97 |
| 印尼語 | 4.91 | 6.31 |
| 阿拉伯語 | 14.32 | 15.72 |
| 法語 | 4.57 | 5.97 |
| 德語 | 2.85 | 4.05 |
| 英語 | 4.49 | 5.49 |
| 韓語 | 3.54 | 4.25 |
| 波斯語 | 30.32 | 30.93 |
| 葡萄牙語 | 5.17 | 5.44 |
| 西班牙語 | 3.38 | 3.62 |
| 義大利語 | 2.58 | 2.58 |
| 日語 | 5.74 | 5.30 |
| 俄語 | 5.65 | 5.13 |
| 馬其頓語 | 18.57 | 17.46 |
| 馬來語 | 10.62 | 9.22 |
| 荷蘭語 | 7.36 | 5.69 |
| 土耳其語 | 8.81 | 5.95 |
| 波蘭語 | 12.59 | 5.45 |
| 丹麥語 | 22.24 | 13.63 |
| 瑞典語 | 19.80 | 8.78 |
| 羅馬尼亞語 | 20.20 | 8.36 |
| 捷克語 | 24.59 | 11.94 |
| 菲律賓語 | 23.31 | 9.72 |
| 希臘語 | 30.22 | 13.94 |
| 芬蘭語 | 27.71 | 7.11 |
| 匈牙利語 | 36.63 | 14.59 |
我們自己做的配對測試,FLEURS 測試集版本 70bb2e84,每種語言約 150 句,一台 M5 MacBook Air。
Qwen3-ASR 1.7B 明顯勝出的 7 種。錯誤率百分比(Qwen 對 Turbo):粵語(6.4 對 36.8)、印地語(13.2 對 29.6)、泰語(6.5 對 13.4)、越南語(4.9 對 8.1)、法語(4.6 對 6.0)、德語(2.9 對 4.1)、英語(4.5 對 5.5)。粵語、泰語算字錯率,其餘算詞錯率。它的優勢集中在按字計分的語言上:中文、粵語、日語、韓語、泰語這五種它平均 5.7%,Turbo 是 13.5%;按詞計分的另外二十五種剛好相反,它平均 14.4%,Turbo 是 10.2%。
Whisper Large V3 Turbo 明顯勝出的 11 種。錯誤率百分比(Qwen 對 Turbo),全部是詞錯率:匈牙利語(36.6 對 14.6)、希臘語(30.2 對 13.9)、芬蘭語(27.7 對 7.1)、捷克語(24.6 對 11.9)、菲律賓語(23.3 對 9.7)、丹麥語(22.2 對 13.6)、羅馬尼亞語(20.2 對 8.4)、瑞典語(19.8 對 8.8)、波蘭語(12.6 對 5.5)、土耳其語(8.8 對 6.0)、荷蘭語(7.4 對 5.7)。
接近或打平的 12 種。西班牙語(3.4 對 3.6)、義大利語(2.6 對 2.6)、俄語(5.7 對 5.1)、葡萄牙語(5.2 對 5.4);中文(6.5 對 8.0)、日語(5.7 對 5.3)、韓語(3.5 對 4.3)算字錯率。另外還有阿拉伯語、印尼語、波斯語、馬來語、馬其頓語。這一檔的差距都很小,全落在 95% 區間裡,這一輪的資料分不出高下。
粵語是唯一一行真的會改變選擇的。同一批音訊上,Whisper Large V3 Turbo 是 36.75% 字錯率,我們先前推薦拿來做粵語的 SenseVoice Small 是 37.23%,兩個都在 37% 上下;Qwen3-ASR 1.7B 是 6.44%。在這套朗讀語音上,前面兩個數字都撐不起粵語,所以舊的建議從現在起要帶上這個但書。
Qwen3-ASR 1.7B 有多快?
五個引擎都在同一套測試、同一台機器(M5 MacBook Air)上量出來,彼此之間至少是可比的。
同一次 FLEURS 測試裡,各引擎在自己支援的語言上的即時倍率中位數,一台 M5 MacBook Air,朗讀語音。
| 引擎 | 語言數 | 本輪速度中位數(短片段) |
|---|---|---|
| SenseVoice Small | 6 種語言 | 162.3 倍 |
| Parakeet TDT 0.6B v3 | 25 | 83.0 倍 |
| Qwen3-ASR 1.7B | 標稱 30 種 | 9.6 倍 |
| Whisper Small | 101 | 7.0 倍 |
| Whisper Large V3 Turbo | 101 | 2.6 倍 |
這些是短片段測試台的數字,比同樣的引擎處理長錄音時要低。這一欄只用來在這一輪裡橫向比較各引擎,別處不算數。
同一套測試裡,Parakeet V3 和 SenseVoice Small 比 Qwen3-ASR 快了大約一個數量級。換成長檔案而不是短片段,Parakeet 在 M4 Pro 上跑到過即時速度的 103 倍,SenseVoice 是 52 倍以上(另一套音訊上的另一種量法,但指向一致)。
Qwen3-ASR 落在中間。本輪短片段測試裡它不是最慢的,最慢的是 Whisper Large V3 Turbo。不過它在不同語言之間的落差比誰都大,希臘語 2.8 倍,日語 13.4 倍。
Qwen3-ASR 佔多少記憶體和磁碟?
峰值記憶體是同一次 FLEURS 測試中逐個項目觀測到的行程最大佔用,一台 M5 MacBook Air,朗讀語音,短片段。
| 引擎 | 下載大小 | 本輪峰值記憶體 |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0.09 GiB |
| Whisper Small | 600 MB | 0.87 GiB |
| SenseVoice Small | 827 MB | 0.95 GiB |
| Whisper Large V3 Turbo | 約 1.6 GB | 1.87 GiB |
| Qwen3-ASR 1.7B | 約 2.5 GB | 2.43 GiB |
兩條軸上 Qwen3-ASR 都是五個裡面最重的:下載約 2.5 GB,本輪行程峰值記憶體 2.43 GiB;Whisper Large V3 Turbo 是約 1.6 GB 和 1.87 GiB。
8 GB 記憶體的機器有更輕的路可以走。Parakeet V3 用 465 MB 和 0.09 GiB 涵蓋 25 種語言,Whisper Small 用 600 MB 和 0.87 GiB 涵蓋 101 種。
我們怎麼測的:FLEURS、30 種語言、一台 Mac
Qwen3-ASR 1.7B 用的是 MLX 8-bit 版本,Whisper Large V3 Turbo 用的是 whisper.cpp 的 ggml 版本,跑在 Metal 上。資料是 Google FLEURS 測試集 70bb2e84 版(CC-BY-4.0),102 種語言裡跑了 83 種,所有模型聽同一批片段、同樣的順序;配對比較的是 Qwen 標稱的那 30 種,每種約 150 句、約 30 分鐘音訊。以空格斷詞的語言用詞錯率,中文、粵語、日語、韓語、泰語用字錯率,兩者不合併成單一分數;誤差範圍是每格 10,000 次項目層級自助重抽樣。機器是一台 M5 MacBook Air,32 GB,macOS 27.0,兩個模型都沒有空輸出或失敗。
FLEURS 是朗讀語音,不是會議,也不是聽寫。朗讀集的排名在真實音訊面前失效過兩次,所以我們不往長錄音外推:這些表是用來判斷一個模型在你的語言上值不值得一試,不是你實際會拿到的準確率。真實會議上的評測跑完會另外寫一篇。
該不該用 Qwen3-ASR 取代 Whisper Large V3?
按語言來看,在 Mac 版 Whisper Notes 裡,我們會這樣回答。
- 如果你要轉錄粵語、印地語、泰語、越南語、法語、德語或英語:選 Qwen3-ASR 1.7B。
- 如果你要轉錄中文、韓語或西班牙語:它只領先一點點,我們也只敢講這一點點。兩個模型都可以用,日語、義大利語、波斯語、阿拉伯語、印尼語、俄語、葡萄牙語、馬其頓語和馬來語也一樣。
- 如果你要轉錄芬蘭語、匈牙利語、希臘語、捷克語、瑞典語、丹麥語、波蘭語、羅馬尼亞語、菲律賓語、土耳其語或荷蘭語:繼續用 Whisper Large V3 Turbo,這十一種它都明顯勝出。
- 如果你在意的是速度和佔用:這個引擎不適合。同一套測試裡 Parakeet V3 和 SenseVoice Small 快了一個數量級,下載大小也只有它的零頭;Whisper Small 用 600 MB 涵蓋 101 種語言,本輪 7.0 倍。
- 如果你用的是 iPhone 版或 Mac App Store 版:這個引擎還沒有進到那兩個管道,粵語在那裡請用 SenseVoice。
這是 Mac 版 Whisper Notes 把阿里巴巴開源的 Qwen3-ASR 移植到裝置上的版本:開放權重轉成 Apple MLX 的 8-bit,跑在你自己 Mac 的 GPU 上,音訊不必上傳到阿里巴巴的伺服器。它和 Mac 直接下載版(DMG)1.5.0 裡被 SenseVoice 換掉的那個 0.6B 不是同一個模型。
基本用法(Mac 直接下載版 DMG 1.6.0 及以後):設定 → 轉錄模型 → Qwen3-ASR 1.7B。模型第一次使用時會在 App 內下載,約 2.5 GB。它需要 macOS 15 以上、Apple 晶片,建議 16 GB 記憶體;App 其餘部分在 macOS 14 上就能跑。按引擎劃分的語言表在語言支援頁上。本機 CLI 和 MCP 伺服器接受 qwen、qwen3、qwen3-asr 三個名字。
不想換的話什麼都不用改,Parakeet V3 仍然是預設。
常見問題
Qwen3-ASR 比 Whisper Large V3 Turbo 更準嗎?
要看語言,而且比數接近對半。在我們自己用 Mac 版 Whisper Notes 跑的 FLEURS 測試裡,兩個模型共同支援的 30 種語言中,Qwen3-ASR 1.7B 贏 14 種,Whisper Large V3 Turbo 贏 15 種,義大利語則是精確的平手——我們保留的每一位小數都相同。Qwen 明顯領先的是粵語(6.44% 對 36.75% 字錯率)、印地語(13.19% 對 29.64% 詞錯率)、泰語、越南語、法語、德語和英語。Turbo 明顯領先的是芬蘭語(7.11% 對 27.71% 詞錯率)、匈牙利語、希臘語、捷克語、瑞典語、丹麥語、波蘭語、羅馬尼亞語、菲律賓語、土耳其語和荷蘭語。30 個差距裡有 12 個落在誤差範圍內,應該當成平手。如果你的語言在 Qwen 領先的那一欄,而且你用的是 Whisper Notes 的 Mac 直接下載版(DMG),就選 Qwen3-ASR;其餘情況、以及 Qwen 那 30 種以外的所有語言,選 Whisper Large V3 Turbo——它涵蓋全部 101 種語言。
iPhone 版或 Mac App Store 版能用 Qwen3-ASR 嗎?
目前它在 Whisper Notes 的 Mac 直接下載版(DMG)1.6.0 及以後的版本裡。Mac App Store 版計畫在後續版本陸續支援新引擎,確切時間我們還說不準。在那之前,iPhone 版和 Mac App Store 版有三個引擎系列——Whisper、Parakeet V3、SenseVoice——而 Qwen 認得的每一種語言,那邊的 Whisper 也都涵蓋。按模型數量算,Mac App Store 版目前是四個,直接下載版是五個,因為 Whisper 有 Small 和 Large V3 Turbo 兩檔。如果你要在 iPhone 上轉錄粵語,那裡請用 SenseVoice。
中文、日語、韓語該選 Qwen3-ASR 還是 SenseVoice?
準確率很接近,速度差很遠。我們的 FLEURS 測試裡,Qwen3-ASR 中文字錯率 6.49%、日語 5.74%、韓語 3.54%;SenseVoice Small 在同一批音訊上分別是 7.69%、6.78%、7.85%。但同一輪裡 SenseVoice 的即時倍率中位數是 162 倍,Qwen 是 9.6 倍;下載大小是 827 MB 對約 2.5 GB;而且 SenseVoice 在 iPhone 和兩個 Mac 版本上都能用。除非你要轉錄的是粵語——那裡 Qwen3-ASR 是 6.44% 字錯率、SenseVoice 是 37.23%,差距大到值得多等一下——否則選 SenseVoice。
Qwen3-ASR 1.7B 的系統需求是什麼?
需要一台 Apple 晶片的 Mac,macOS 15 或更新版本,建議 16 GB 記憶體,另外約 2.5 GB 磁碟空間放模型。這比 Mac 版 Whisper Notes 其餘部分的要求更高——App 本身在 macOS 14 以上就能執行。我們的測試裡這個模型的行程峰值記憶體是 2.43 GiB,五個引擎裡最高。如果你的 Mac 是 8 GB 記憶體,Whisper Small 用 600 MB 涵蓋同樣的 101 種語言,Parakeet V3 用 465 MB 涵蓋 25 種歐洲語言。
用 Qwen3-ASR 的時候,音訊會離開我的 Mac 嗎?
不會。阿里巴巴確實也把 Qwen3-ASR 做成雲端服務,透過 DashScope 的即時 API 和錄音檔轉寫 API 提供,那條路徑需要把音訊上傳到他們的伺服器。Whisper Notes 不使用那些介面。它把開放權重當成 MLX 8-bit 模型跑在你 Mac 自己的 GPU 上,不需要帳號,不需要 API key,斷網也能轉錄。App 裡每個引擎系列、每個通路都是這樣。
為什麼這些數字和我在自己的錄音上得到的準確率對不起來?
因為 FLEURS 是短句、乾淨的朗讀語音,而你的錄音不是。我們這一輪是在公開資料集上做的校準:每種語言約 150 句,一台 M5 MacBook Air,所有模型聽同樣的片段。它適合判斷某個模型在某種語言上值不值得一試,不能用來預測你在會議、吵雜環境、帶口音的語音或兩小時長檔上的準確率。
去試試看
Qwen3-ASR 1.7B 在 Mac 版 Whisper Notes 1.6.0 及以後的直接下載版(DMG)裡。位置是設定 → 轉錄模型。每週免費額度是 5,000 字,夠你把自己的語言跑一遍,然後來反駁上面那幾張表。
某種語言上我們的數字和你的實際體驗對不起來,寫信到 mac@whispernotes.app 告訴我們。完整更新說明:whispernotes.app/changelog。
以上所有資料的來源:我們在 Google FLEURS 測試集 70bb2e84 版本上的測試、Qwen3-ASR 1.7B 模型卡,以及語言支援頁上按引擎劃分的語言表——那張表由 App 原始碼生成。