Apple Speech vs Whisper:Apple 新的 SpeechAnalyzer 中文準不準?

2026年9月1日
·
8 min read
·Whisper Notes Team

從 macOS 26 和 iOS 26 開始,Apple 推出了新一代裝置端語音辨識——SpeechAnalyzer 和 SpeechTranscriber,下文統稱 Apple Speech。它比舊的聽寫引擎準確許多。於是我們想知道: Apple 內建的語音辨識,現在是否已經好到可以完全不用轉錄 App? 它和 Whisper Notes 裡的裝置端開放模型——Whisper、Parakeet、SenseVoice 和 Qwen3-ASR——還差多遠?我們進行了一次嚴格測試,以下是結果。我們測的十種語言裡,Apple Speech 沒有一種錯誤率最低,韓語、日語和中文距離第一名不到 1.5 點,荷蘭語、俄語和波蘭語則根本沒有模型。

Apple Speech 和下載模型相差多遠?

語言 Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
英語 8.80 4.49 5.49 7.04 6.89 8.46
德語 6.26 2.85 4.05 8.67 6.26
荷蘭語 7.36 5.69 16.75 8.58
俄語 5.65 5.13 11.37 7.12
波蘭語 12.59 5.45 15.81 8.30
日語 6.36 5.74 5.30 11.37 6.78
韓語 4.31 3.54 4.25 7.30 7.85
法語 7.61 4.57 5.97 13.24 5.83
中文 7.97 6.49 7.97 20.50 7.69
西班牙語(拉丁美洲) 5.41 3.38 3.62 6.22 4.86

最常用語言中的十種,每個引擎各佔一欄。每格是該引擎的錯誤率,越低越好;綠色是該行最低,白色是第二低。日語、韓語和中文採字錯率,其餘採詞錯率,兩者不合併成一個分數。這是 Whisper Notes 團隊自己跑的 FLEURS 測試,一台 M5 MacBook Air,朗讀語音。

表頭簡稱:Qwen3-ASR = Qwen3-ASR 1.7B,Whisper Large = Whisper Large V3 Turbo,Parakeet = Parakeet V3,SenseVoice = SenseVoice Small。破折號代表該引擎沒有這種語言的模型。

十種語言裡,Qwen3-ASR 1.7B 在六種的錯誤率最低,另外四種由 Whisper Large V3 Turbo 領先。Apple Speech 距離該行第一名最近的是韓語的 0.77 點、日語的 1.06 點和中文的 1.48 點,中文上它和 Whisper Large V3 Turbo 同為 7.97。它支援的七種語言裡,比該行第一名高 0.8 到 4.3 點,差距最大的是英語,8.80 對 4.49。荷蘭語、波蘭語和俄語沒有 Apple Speech 的結果。

Apple Speech 支援哪些語言?

這次測試中,Apple Speech 在 83 個語言設定裡有 21 個傳回結果。兩個 Whisper 模型涵蓋全部 83 個,Qwen3-ASR 1.7B 涵蓋 30 個,Parakeet V3 涵蓋 25 個。上面的十種語言裡,它沒有荷蘭語、波蘭語或俄語模型。也沒有一份固定清單可以引用:語言資源由 macOS 管理,所以 App 必須在執行時查詢這台機器有哪些資源。

語言 Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
義大利語 4.39 2.58 2.58 7.64 3.43
粵語 8.69 6.44 36.75 119.01 37.23
葡萄牙語(巴西) 9.35 5.17 5.44 8.61 6.49
印地語 101.50 13.19 29.64 61.26
泰盧固語 101.63 81.74 103.19
烏爾都語 101.69 23.39 38.83
旁遮普語 101.75 92.05 103.40
孟加拉語 102.00 83.52 117.37
尼泊爾語 102.13 88.59 118.84
馬拉雅拉姆語 102.18 107.34 167.16
馬拉地語 102.23 82.69 109.95
坎那達語 103.83 72.07 116.10
古吉拉特語 104.52 75.31 108.91
泰米爾語 113.01 71.28 79.77

Apple Speech 有傳回結果的其餘十四種語言,依它自己的錯誤率排序。引擎欄、配色和簡稱同上;粵語採字錯率,其餘採詞錯率。由於插入錯誤也算在分子內,錯誤率可能超過 100%。

最後十一行從印地語到泰米爾語,Apple Speech 傳回的是拉丁字母轉寫而不是原生文字,因此那裡的錯誤率衡量的是文字系統不符,不是辨識準確率;這些格子不列入該行排名。同一行其他引擎的數值則是正常測量結果。

SpeechAnalyzer 的運作方式

Apple 從 iOS 10 起就有語音辨識 API。當時的 SFSpeechRecognizer 是舊聽寫路徑背後的引擎。SpeechAnalyzer 取代了它,隨 macOS 26 和 iOS 26 推出,除了 watchOS 之外的所有 Apple 平台都能使用。

這套 API 以工作階段為核心。你建立一個 SpeechAnalyzer,加入一個或多個模組,再送入音訊;將語音轉成文字的模組是 SpeechTranscriber。音訊以你自行填入的非同步序列送入,結果以另一個序列傳回,兩者通常在不同工作上執行。分析器一次只接收一個輸入序列。每個緩衝區和每筆結果都有對應音訊本身時間軸的時間碼,因此結果能放回原本的位置。

Apple WWDC25 的 SpeechAnalyzer 並行處理示意圖:輸入工作將輸入 AsyncSequence 傳入分析工作中的 SpeechAnalyzer 和 SpeechTranscriber,結果 AsyncSequence 再送到結果工作與使用者介面

一個工作階段、三項工作:音訊以 AsyncSequence 送入,由 SpeechAnalyzer 和 SpeechTranscriber 分析,結果再以另一個 AsyncSequence 傳回介面。來源:Apple, WWDC25 第 277 場

結果會抵達兩次。Apple 所稱 volatile range 的可變範圍內,內容仍可能被更好的結果取代;範圍之外則是最終結果。App 因此能在你還在說話時先顯示粗略逐字稿,之後再修正。

Apple 為 SpeechTranscriber 模型列出五項設計目標:長音訊、對話語音、遠距說話者、低延遲,以及隱私,也就是在裝置上執行。備忘錄、語音備忘錄、日誌和通話摘要都以它為基礎。

Apple WWDC25 投影片,列出 SpeechTranscriber 模型的能力:長音訊、對話語音、遠距說話者、低延遲、隱私

Apple 為 SpeechTranscriber 模型列出的五項設計目標。來源:Apple, WWDC25 第 277 場

模型不屬於任何一個 App。它們透過 AssetInventory 從 Apple 伺服器下載,由系統儲存和更新,並在 App 之間共享。它們不增加 App 的下載大小,也不佔用 App 的記憶體空間,解碼則在呼叫端行程之外進行。SpeechTranscriber 若沒有某種語言或裝置的模型,DictationTranscriber 就會接手,使用和系統聽寫相同的模型。

我們怎麼測試

本文每個引擎都在一台 M5 MacBook Air(32 GB、macOS 27.0)上,以相同順序、一次一段轉錄同一批片段。音訊來自 Google FLEURS 測試集版本 70bb2e84,每種語言約 150 句、約 30 分鐘。資料集自身的項目 ID 經固定雜湊後決定順序,我們取剛好超過三十分鐘的最短完整項目區段;模型輸出完全不參與這項選擇。每一格都從各自的紀錄重新計算並再次核對,285 格全部通過。

以空格分詞的語言採詞錯率,日語、韓語、中文和粵語採字錯率。FLEURS 是朗讀語音,不是會議,也不是聽寫。這些表能說明某個引擎在你的語言上是否值得一試,不能預測你用自己的錄音會得到什麼結果。

比舊版 Apple Dictation 好多少?

Apple 提供兩個轉錄工作點,我們兩個都測了。SpeechTranscriber 是新的工作點,也就是本文所稱的 Apple Speech。 DictationTranscriber 是相容性工作點,也是它出現前 Mac 採用的聽寫路徑。

語言 Apple Dictation Apple Speech
韓語 7.11 4.31
義大利語 6.93 4.39
西班牙語(拉丁美洲) 8.43 5.41
德語 12.69 6.26
日語 9.37 6.36
法語 17.10 7.61
中文 10.28 7.97
粵語 10.18 8.69
英語 13.83 8.80
葡萄牙語(巴西) 10.85 9.35

兩個 Apple 工作點都乾淨測到的全部語言,依 Apple Speech 的錯誤率排序;綠色是該行較好的數值。同一次測試、同一批片段、同一台 Mac。日語、韓語、中文和粵語採字錯率,其餘採詞錯率。

十種語言裡,Apple Speech 全部更準。中位數語言的錯誤約少三分之一,法語和德語少一半以上,巴西葡萄牙語和粵語則約每七個錯誤少一個。

這是和 Apple 自己的過去相比。和下載模型比較,它在乾淨測到的語言裡最佳名次是粵語第二名。Dictation 涵蓋更多語言:這次測試是 33 個設定對 21 個,也包含新引擎在這裡缺少的全部三種語言。

內建引擎帶來什麼?

引擎 速度 峰值記憶體 下載大小
SenseVoice Small 即時速度的 162.3 倍 0.95 GiB 827 MB
Parakeet V3 即時速度的 75.6 倍 0.09 GiB 465 MB
Apple Speech 即時速度的 30.8 倍 不列數值 語言套件由 macOS 下載,不由 App 下載
Qwen3-ASR 1.7B 即時速度的 11.1 倍 2.43 GiB 約 2.5 GB
Whisper Small 即時速度的 7.9 倍 0.87 GiB 600 MB
Whisper Large V3 Turbo 即時速度的 3.0 倍 1.87 GiB 約 1.6 GB

速度是各引擎在本文乾淨測到的十三種語言中,僅計實際執行語言後的中位數——這是逐項隔離處理的吞吐量,屬於診斷值,不是產品延遲。峰值記憶體是這次測試的行程群組峰值。Apple Speech 在呼叫端 App 無法掌控的 macOS 服務裡解碼,因此那一格無論填什麼數字,都不會和另外五個引擎代表同一件事。

Apple Speech 的語言資源由系統下載一次,供所有 App 共享。App 本身不帶模型,也不會在自己的行程裡配置記憶體。系統服務運作時仍會使用記憶體,但我們無法精確歸屬,所以那一格不列數字,而不是填零。它以即時速度的 30.8 倍執行,慢於 Parakeet V3 和 SenseVoice Small。

Whisper Large V3 Turbo 拿下十行中的四個第一名,同時是這裡最慢的引擎,比 Apple Speech 慢約十倍,磁碟佔用約 1.6 GB。Qwen3-ASR 1.7B 拿下其餘六行,下載約 2.5 GB,記憶體 2.43 GiB。Parakeet V3 是 465 MB 和 0.09 GiB,法語比 Turbo 準,波蘭語比它差,而且沒有日語、韓語、中文或粵語模型。最接近的比較對象是 600 MB 的 Whisper Small;兩者都乾淨測到的十種語言裡,有八種是 Apple Speech 更準。

該用 Apple Speech 還是下載一個模型?

按語言來看:

  • 英語:不適合。Apple Speech 的錯誤率是 8.80; Qwen3-ASR 1.7B (4.49)或 Whisper Large V3 Turbo (5.49)明顯更準。
  • 德語:不適合。Apple Speech 的錯誤率是 6.26; Qwen3-ASR 1.7B (2.85)或 Whisper Large V3 Turbo (4.05)明顯更準。
  • 荷蘭語、俄語和波蘭語:Apple Speech 沒有這三種語言的模型。 Whisper Large V3 Turbo 在三種語言上都是最準的,分別為 5.69、5.13 和 5.45。
  • 日語:可以使用。Apple Speech 的錯誤率是 6.36,落後 Whisper Large V3 Turbo 的 5.30。
  • 韓語:可以使用。Apple Speech 的錯誤率是 4.31,落後 Qwen3-ASR 1.7B 的 3.54。
  • 法語:不適合。Apple Speech 的錯誤率是 7.61; Qwen3-ASR 1.7B (4.57)或 Parakeet V3 (5.83)明顯更準。
  • 中文:可以使用。Apple Speech 的錯誤率是 7.97,和 Whisper Large V3 Turbo 相同;最準的是 Qwen3-ASR 1.7B 的 6.49。
  • 西班牙語:不適合。Apple Speech 的錯誤率是 5.41; Qwen3-ASR 1.7B (3.38)或 Whisper Large V3 Turbo (3.62)明顯更準。

Apple Speech 是本文對 Apple 的 SpeechTranscriber 所用的簡稱,這套裝置端 API 可由任何執行 macOS 26 或更新版本的 Mac App 呼叫。它不在 Mac 版 Whisper Notes 下載的模型之列:Mac 直接下載版(DMG)有 Whisper、Parakeet V3、SenseVoice 和 Qwen3-ASR;iPhone 版和 Mac App Store 版有 Whisper、Parakeet V3 和 SenseVoice。各引擎的表格可見 語言支援頁

這些結果不會改變 Mac 版 Whisper Notes 目前的運作方式: Parakeet V3 仍是預設模型

常見問題

Apple Speech 和 Whisper 一樣準嗎?

兩者都支援的語言裡,大多數上它並不如 Whisper 準。在我們自己跑的 FLEURS 測試中,這十種語言裡 Apple Speech 支援的七種,Whisper Large V3 Turbo 有六種更準,中文則完全打平,兩者字錯率都是 7.97%。和 Whisper Small 比較時順序反轉:七種裡 Apple Speech 領先六種,只在英語以 8.80% 對 7.04% 的詞錯率落後。乾淨測到的語言裡它沒有拿下任何第一名,最接近的是韓語,字錯率 4.31%,該行第一名是 3.54%。粵語是乾淨測到的語言中唯一一個 Apple Speech 勝過 Whisper Large V3 Turbo 的,字錯率 8.69% 對 36.75%。如果你的語言在支援範圍內,而且希望讓 macOS 管理語言套件,可使用內建引擎;若要最準的結果,或你的語言正是它在這裡缺少的三種之一,請使用 Whisper Large V3 Turbo。

Apple Speech 支援哪些語言?

清單由 macOS 決定,不由任何 App 決定。這次測試裡 Apple Speech 在我們測試的 83 個語言設定中有 21 個產生結果,兩個 Whisper 版本都是 83 個,Qwen3-ASR 1.7B 是 30 個,Parakeet V3 是 25 個。主表的十種最常用語言中,它有英語、德語、日語、韓語、法語、中文和西班牙語,沒有荷蘭語、波蘭語或俄語。第二張表列出其餘十四個設定:義大利語、粵語、巴西葡萄牙語,以及十一種它以拉丁字母轉寫而非原生文字作答的語言。App 必須在執行時向 macOS 查詢指定機器有哪些語言。如果你的語言不在其中,Whisper 在每個管道都涵蓋 App 清單內的所有語言。

Apple Speech 和 Parakeet V3 該選哪一個?

兩者都支援的每種歐洲語言都應選 Parakeet V3。英語是 6.89 對 8.80、法語 5.83 對 7.61、西班牙語 4.86 對 5.41、義大利語 3.43 對 4.39、巴西葡萄牙語 6.49 對 9.35;德語兩者同為 6.26。Parakeet V3 沒有日語、韓語、中文或粵語模型,所以這幾種語言只有 Apple Speech 有結果,而日語、韓語和中文距離該行第一名不到 1.5 點。Parakeet V3 需下載 465 MB,以即時速度的 75.6 倍執行,峰值記憶體為 0.09 GiB;Apple Speech 的語言套件由 macOS 下載,速度為即時的 30.8 倍,記憶體數值不列。

SpeechAnalyzer 是什麼?和 Apple Dictation 一樣嗎?

SpeechAnalyzer 是 Apple 在 WWDC 2025 發表、隨 macOS 26 和 iOS 26 推出的整體 API。SpeechTranscriber 是其中的轉錄工作點,也是我們測量並在本文稱為 Apple Speech 的對象。Dictation 是相容性工作點,我們也測了:兩者都乾淨測到的十種語言裡,Apple Speech 全部更準,中位數語言的錯誤約少三分之一,法語和德語則少一半以上。Dictation 涵蓋更多語言,這次是 33 個設定對 21 個,因此如果你能接受 17.34%、13.50% 和 13.13% 的詞錯率,它就是荷蘭語、波蘭語或俄語的系統引擎。同一批片段上,Whisper Large V3 Turbo 分別是 5.69%、5.45% 和 5.13%。

使用 Apple Speech 時,音訊會離開我的 Mac 嗎?

Apple 將 SpeechTranscriber 記載為裝置端語音辨識:macOS 會下載一次語言資源,辨識在本機執行。我們測量的是準確率和速度,不是網路行為,因此這部分依照 Apple 的說明。Whisper Notes 自己下載的引擎——Whisper、Parakeet V3、SenseVoice 和 Qwen3-ASR——在你自己 Mac 的 GPU 或 Neural Engine 上執行,不需帳號或 API key;每個管道都能在斷網時轉錄。

為什麼這些數字和我在自己錄音裡得到的準確率不同?

因為 FLEURS 是短句、乾淨的朗讀語音,而你的錄音不是。我們這次是在公開資料集上校準:每種語言約 150 句、約 30 分鐘音訊,一台 M5 MacBook Air,所有引擎使用相同片段。它能說明某個引擎在一種語言上是否值得一試,不能預測會議、嘈雜音訊、帶口音語音或兩小時檔案上的結果。

為什麼別的評測說 Apple Speech 比 Whisper 準?

因為它們比的是 Whisper Small,而且只測英語。和 Whisper Small 比,我們的結果一致:兩者都乾淨測到的十種語言裡,有八種是 Apple Speech 更準。英語正是它輸掉的兩種之一,8.80 對 7.04。換成 Whisper Large V3 Turbo 就不成立了:同樣這十種語言裡,Apple Speech 有八種落後,中文以 7.97 打平,只在粵語領先。拿哪一個 Whisper 來比,就決定了標題怎麼寫。

試用看看

這裡五個可下載模型——Whisper Small、Whisper Large V3 Turbo、Parakeet V3、SenseVoice Small 和 Qwen3-ASR 1.7B——全都在 Mac 版 Whisper Notes 的直接下載版(DMG)中,位置是設定 → 轉錄模型。

如果某種語言上,我們的數字和你的實際體驗不符,請寄信到 mac@whispernotes.app。完整版本說明: whispernotes.app/changelog

資料來源:我們在 Google FLEURS 測試集版本 70bb2e84 上進行的測試、Apple 的 SpeechAnalyzer 文件,以及先前的 三十種語言 Qwen3-ASR 測試