粵語與中文逐字稿誰更準?Qwen3-ASR vs Whisper Large V3 Turbo(Mac 實測)

2026年8月25日
·
11 min read
·Whisper Notes Team

我們想弄清楚一件事:有沒有哪個本機模型,在你講的語言上比 Whisper Large V3 更準?於是我們拿 FLEURS 資料集把這幾個模型都跑了一遍。

FLEURS 是 Google 的資料集,收錄 102 種語言的朗讀語音。我們從每種語言抽出約 75 句,讓這五個模型聽同一批片段、同樣的順序:

  • Parakeet V3
  • Whisper Large V3 Turbo
  • SenseVoice Small
  • Whisper Small
  • Qwen3-ASR 1.7B

結果大致是這樣。

Qwen3-ASR 1.7B 對 Whisper Large V3 Turbo——我們自己跑的 FLEURS,一台 M5 MacBook Air,朗讀語音,短片段。

Qwen3-ASR 1.7B Whisper Large V3 Turbo
支援語言 30 種 101 種
明顯優勢 粵語、印地語、泰語、越南語、法語(5 種) 芬蘭語、匈牙利語、希臘語等 11 種
速度 即時速度的 8.7 倍 即時速度的 2.4 倍
峰值記憶體 2.43 GiB 1.87 GiB
下載大小 約 2.5 GB 約 1.6 GB

除了各自的強項語言之外,兩者的準確率差距不大。

Whisper Large V3 和 Qwen3-ASR 詳細比較

全部 30 種語言,依 Qwen 領先最多排到落後最多,兩欄都是數字越低越好。

我們自己跑的 FLEURS,一台 M5 MacBook Air,朗讀語音。中文、粵語、日語、韓語、泰語為字錯率,其餘為詞錯率;標綠表示領先幅度超出配對的 95% 誤差範圍。

語言 Qwen3-ASR 1.7B Whisper Large V3 Turbo
粵語 6.00 37.97
印地語 13.67 30.42
泰語 5.92 12.95
越南語 5.07 9.79
波斯語 26.98 30.03
阿拉伯語 14.14 15.75
印尼語 4.97 6.50
法語 3.98 5.39
中文 5.69 6.88
英語 5.07 5.92
德語 3.51 4.10
日語 5.39 5.71
韓語 3.51 3.70
西班牙語 3.60 3.76
義大利語 2.98 3.05
俄語 5.98 5.51
葡萄牙語 5.64 4.91
馬其頓語 17.81 16.64
馬來語 11.60 10.18
荷蘭語 7.65 5.63
土耳其語 8.34 5.53
丹麥語 20.12 14.92
波蘭語 12.78 5.32
羅馬尼亞語 18.97 8.22
菲律賓語 20.44 9.37
瑞典語 20.04 8.72
捷克語 23.92 11.15
希臘語 30.20 12.97
芬蘭語 26.08 6.54
匈牙利語 36.35 13.66

我們自己做的配對測試,FLEURS 測試集版本 70bb2e84,每種語言約 75 句,一台 M5 MacBook Air。

Qwen3-ASR 1.7B 明顯勝出的 5 種。錯誤率百分比(Qwen 對 Turbo):粵語(6.0 對 38.0)、印地語(13.7 對 30.4)、泰語(5.9 對 13.0)、越南語(5.1 對 9.8)、法語(4.0 對 5.4)。粵語、泰語算字錯率,其餘算詞錯率。它的優勢集中在按字計分的語言上:中文、粵語、日語、韓語、泰語這五種它平均 5.3%,Turbo 是 13.4%;按詞計分的另外二十五種剛好相反,它平均 14.0%,Turbo 是 10.2%。

Whisper Large V3 Turbo 明顯勝出的 11 種。錯誤率百分比(Qwen 對 Turbo),全部是詞錯率:匈牙利語(36.4 對 13.7)、希臘語(30.2 對 13.0)、芬蘭語(26.1 對 6.5)、捷克語(23.9 對 11.2)、菲律賓語(20.4 對 9.4)、丹麥語(20.1 對 14.9)、瑞典語(20.0 對 8.7)、羅馬尼亞語(19.0 對 8.2)、波蘭語(12.8 對 5.3)、土耳其語(8.3 對 5.5)、荷蘭語(7.7 對 5.6)。

接近或打平的 14 種。英語(5.1 對 5.9)、德語(3.5 對 4.1)、西班牙語(3.6 對 3.8)、義大利語(3.0 對 3.1)、俄語(6.0 對 5.5)、葡萄牙語(5.6 對 4.9);中文(5.7 對 6.9)、日語(5.4 對 5.7)、韓語(3.5 對 3.7)算字錯率。另外還有阿拉伯語、印尼語、波斯語、馬來語、馬其頓語。這一檔的差距都很小,全落在 95% 區間裡,這一輪的資料分不出高下。

粵語是唯一一行真的會改變選擇的。同一批音訊上,Whisper Large V3 Turbo 是 37.97% 字錯率,我們先前推薦拿來做粵語的 SenseVoice Small 是 36.71%,兩個都在 37% 上下;Qwen3-ASR 1.7B 是 6.00%。在這套朗讀語音上,前面兩個數字都撐不起粵語,所以舊的建議從現在起要帶上這個但書。

Qwen3-ASR 1.7B 有多快?

五個引擎都在同一套測試、同一台機器(M5 MacBook Air)上量出來,彼此之間至少是可比的。

同一次 FLEURS 測試裡,各引擎在自己支援的語言上的即時倍率中位數,一台 M5 MacBook Air,朗讀語音。

引擎 語言數 本輪速度中位數(短片段)
SenseVoice Small 6 種語言 161.0 倍
Parakeet TDT 0.6B v3 25 82.9 倍
Qwen3-ASR 1.7B 標稱 30 種 8.7 倍
Whisper Small 101 6.4 倍
Whisper Large V3 Turbo 101 2.4 倍

這些是短片段測試台的數字,比同樣的引擎處理長錄音時要低。這一欄只用來在這一輪裡橫向比較各引擎,別處不算數。

同一套測試裡,Parakeet V3SenseVoice Small 比 Qwen3-ASR 快了大約一個數量級。換成長檔案而不是短片段,Parakeet 在 M4 Pro 上跑到過即時速度的 103 倍,SenseVoice 是 52 倍以上(另一套音訊上的另一種量法,但指向一致)。

Qwen3-ASR 落在中間。本輪短片段測試裡它不是最慢的,最慢的是 Whisper Large V3 Turbo。不過它在不同語言之間的落差比誰都大,希臘語 2.7 倍,日語 12.4 倍。

Qwen3-ASR 佔多少記憶體和磁碟?

峰值記憶體是同一次 FLEURS 測試中逐個項目觀測到的行程最大佔用,一台 M5 MacBook Air,朗讀語音,短片段。

引擎 下載大小 本輪峰值記憶體
Parakeet TDT 0.6B v3 465 MB 0.09 GiB
Whisper Small 600 MB 0.87 GiB
SenseVoice Small 827 MB 0.95 GiB
Whisper Large V3 Turbo 約 1.6 GB 1.87 GiB
Qwen3-ASR 1.7B 約 2.5 GB 2.43 GiB

兩條軸上 Qwen3-ASR 都是五個裡面最重的:下載約 2.5 GB,本輪行程峰值記憶體 2.43 GiB;Whisper Large V3 Turbo 是約 1.6 GB 和 1.87 GiB。

8 GB 記憶體的機器有更輕的路可以走。Parakeet V3 用 465 MB 和 0.09 GiB 涵蓋 25 種語言,Whisper Small 用 600 MB 和 0.87 GiB 涵蓋 101 種。

我們怎麼測的:FLEURS、30 種語言、一台 Mac

Qwen3-ASR 1.7B 用的是 MLX 8-bit 版本,Whisper Large V3 Turbo 用的是 whisper.cpp 的 ggml 版本,跑在 Metal 上。資料是 Google FLEURS 測試集 70bb2e84 版(CC-BY-4.0),102 種語言裡跑了 83 種,每種約 75 句、約 15 分鐘,所有模型聽同一批片段、同樣的順序;配對比較的是 Qwen 標稱的那 30 種。以空格斷詞的語言用詞錯率,中文、粵語、日語、韓語、泰語用字錯率,兩者不合併成單一分數;誤差範圍是每格 10,000 次項目層級自助重抽樣。機器是一台 M5 MacBook Air,32 GB,macOS 26.5,兩個模型都沒有空輸出或失敗。

FLEURS 是朗讀語音,不是會議,也不是聽寫。朗讀集的排名在真實音訊面前失效過兩次,所以我們不往長錄音外推:這些表是用來判斷一個模型在你的語言上值不值得一試,不是你實際會拿到的準確率。真實會議上的評測跑完會另外寫一篇。

該不該用 Qwen3-ASR 取代 Whisper Large V3?

按語言來看,在 Mac 版 Whisper Notes 裡,我們會這樣回答。

  • 如果你要轉錄粵語、印地語、泰語、越南語或法語:選 Qwen3-ASR 1.7B
  • 如果你要轉錄中文、日語、韓語、英語、德語、西班牙語或義大利語:它只領先一點點,我們也只敢講這一點點。兩個模型都可以用,波斯語、阿拉伯語、印尼語、俄語、葡萄牙語、馬其頓語和馬來語也一樣。
  • 如果你要轉錄芬蘭語、匈牙利語、希臘語、捷克語、瑞典語、丹麥語、波蘭語、羅馬尼亞語、菲律賓語、土耳其語或荷蘭語:繼續用 Whisper Large V3 Turbo,這十一種它都明顯勝出。
  • 如果你在意的是速度和佔用:這個引擎不適合。同一套測試裡 Parakeet V3SenseVoice Small 快了一個數量級,下載大小也只有它的零頭;Whisper Small 用 600 MB 涵蓋 101 種語言,本輪 6.4 倍。
  • 如果你用的是 iPhone 版或 Mac App Store 版:這個引擎還沒有進到那兩個管道,粵語在那裡請用 SenseVoice。

這是 Mac 版 Whisper Notes 把阿里巴巴開源的 Qwen3-ASR 移植到裝置上的版本:開放權重轉成 Apple MLX 的 8-bit,跑在你自己 Mac 的 GPU 上,音訊不必上傳到阿里巴巴的伺服器。它和 Mac 直接下載版(DMG)1.5.0 裡被 SenseVoice 換掉的那個 0.6B 不是同一個模型。

基本用法(Mac 直接下載版 DMG 1.6.0 及以後):設定 → 轉錄模型 → Qwen3-ASR 1.7B。模型第一次使用時會在 App 內下載,約 2.5 GB。它需要 macOS 15 以上、Apple 晶片,建議 16 GB 記憶體;App 其餘部分在 macOS 14 上就能跑。按引擎劃分的語言表在語言支援頁上。本機 CLI 和 MCP 伺服器接受 qwen、qwen3、qwen3-asr 三個名字。

不想換的話什麼都不用改,Parakeet V3 仍然是預設

常見問題

Qwen3-ASR 比 Whisper Large V3 Turbo 更準嗎?

要看語言,而且比數接近對半。在我們自己用 Mac 版 Whisper Notes 跑的 FLEURS 測試裡,兩個模型共同支援的 30 種語言中,Qwen3-ASR 1.7B 贏 15 種,Whisper Large V3 Turbo 贏 15 種。Qwen 明顯領先的是粵語(6.00% 對 37.97% 字錯率)、印地語(13.67% 對 30.42% 詞錯率)、泰語、越南語和法語。Turbo 明顯領先的是芬蘭語(6.54% 對 26.08% 詞錯率)、匈牙利語、希臘語、捷克語、瑞典語、丹麥語、波蘭語、羅馬尼亞語、菲律賓語、土耳其語和荷蘭語。30 個差距裡有 14 個落在誤差範圍內,應該當成平手。如果你的語言在 Qwen 領先的那一欄,而且你用的是 Whisper Notes 的 Mac 直接下載版(DMG),就選 Qwen3-ASR;其餘情況、以及 Qwen 那 30 種以外的所有語言,選 Whisper Large V3 Turbo——它涵蓋全部 101 種語言。

iPhone 版或 Mac App Store 版能用 Qwen3-ASR 嗎?

目前它在 Whisper Notes 的 Mac 直接下載版(DMG)1.6.0 及以後的版本裡。Mac App Store 版計畫在後續版本陸續支援新引擎,確切時間我們還說不準。在那之前,iPhone 版和 Mac App Store 版有三個引擎系列——Whisper、Parakeet V3、SenseVoice——而 Qwen 認得的每一種語言,那邊的 Whisper 也都涵蓋。按模型數量算,Mac App Store 版目前是四個,直接下載版是五個,因為 Whisper 有 Small 和 Large V3 Turbo 兩檔。如果你要在 iPhone 上轉錄粵語,那裡請用 SenseVoice。

中文、日語、韓語該選 Qwen3-ASR 還是 SenseVoice?

準確率很接近,速度差很遠。我們的 FLEURS 測試裡,Qwen3-ASR 中文字錯率 5.69%、日語 5.39%、韓語 3.51%;SenseVoice Small 在同一批音訊上分別是 7.06%、6.85%、7.82%。但同一輪裡 SenseVoice 的即時倍率中位數是 161 倍,Qwen 是 8.7 倍;下載大小是 827 MB 對約 2.5 GB;而且 SenseVoice 在 iPhone 和兩個 Mac 版本上都能用。除非你要轉錄的是粵語——那裡 Qwen3-ASR 是 6.00% 字錯率、SenseVoice 是 36.71%,差距大到值得多等一下——否則選 SenseVoice。

Qwen3-ASR 1.7B 的系統需求是什麼?

需要一台 Apple 晶片的 Mac,macOS 15 或更新版本,建議 16 GB 記憶體,另外約 2.5 GB 磁碟空間放模型。這比 Mac 版 Whisper Notes 其餘部分的要求更高——App 本身在 macOS 14 以上就能執行。我們的測試裡這個模型的行程峰值記憶體是 2.43 GiB,五個引擎裡最高。如果你的 Mac 是 8 GB 記憶體,Whisper Small 用 600 MB 涵蓋同樣的 101 種語言,Parakeet V3 用 465 MB 涵蓋 25 種歐洲語言。

用 Qwen3-ASR 的時候,音訊會離開我的 Mac 嗎?

不會。阿里巴巴確實也把 Qwen3-ASR 做成雲端服務,透過 DashScope 的即時 API 和錄音檔轉寫 API 提供,那條路徑需要把音訊上傳到他們的伺服器。Whisper Notes 不使用那些介面。它把開放權重當成 MLX 8-bit 模型跑在你 Mac 自己的 GPU 上,不需要帳號,不需要 API key,斷網也能轉錄。App 裡每個引擎系列、每個通路都是這樣。

為什麼這些數字和我在自己的錄音上得到的準確率對不起來?

因為 FLEURS 是短句、乾淨的朗讀語音,而你的錄音不是。我們這一輪是在公開資料集上做的校準:每種語言約 75 句,一台 M5 MacBook Air,所有模型聽同樣的片段。它適合判斷某個模型在某種語言上值不值得一試,不能用來預測你在會議、吵雜環境、帶口音的語音或兩小時長檔上的準確率。

去試試看

Qwen3-ASR 1.7B 在 Mac 版 Whisper Notes 1.6.0 及以後的直接下載版(DMG)裡。位置是設定 → 轉錄模型。免費試用額度是 10,000 字,夠你把自己的語言跑一遍,然後來反駁上面那幾張表。

某種語言上我們的數字和你的實際體驗對不起來,寫信到 mac@whispernotes.app 告訴我們。完整更新說明:whispernotes.app/changelog

以上所有資料的來源:我們在 Google FLEURS 測試集 70bb2e84 版本上的測試、Qwen3-ASR 1.7B 模型卡,以及語言支援頁上按引擎劃分的語言表——那張表由 App 原始碼生成。