Apple Speech 对比 Whisper:macOS 自带语音识别覆盖哪些语言(Mac 实测)

2026年9月1日
·
9 min read
·Whisper Notes Team

从 macOS 26 和 iOS 26 开始,苹果有了新一代的设备端语音识别 API——SpeechAnalyzer 和 SpeechTranscriber,下文简称 Apple Speech。Whisper Notes 里同时装着 Whisper、Parakeet、SenseVoice、Qwen3-ASR,每一个都有它存在的理由:有的极快,有的在某几种语言上更准。所以这个问题值得认真问一次:苹果自带的语音识别,现在够用了吗?它和这些设备端的开源模型,差距还有多大?我们做了一次严格的实测,下面是结果。

Apple Speech 和你下载的模型,差多远?

语言 Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
英语 8.80 4.49 5.49 7.04 6.89 8.46
德语 6.26 2.85 4.05 8.67 6.26
荷兰语 7.36 5.69 16.75 8.58
俄语 5.65 5.13 11.37 7.12
波兰语 12.59 5.45 15.81 8.30
日语 6.36 5.74 5.30 11.37 6.78
韩语 4.31 3.54 4.25 7.30 7.85
法语 7.61 4.57 5.97 13.24 5.83
中文 7.97 6.49 7.97 20.50 7.69
西班牙语(拉美) 5.41 3.38 3.62 6.22 4.86

十种最常用的语言,一个引擎一列。每一格是该引擎的错误率,越低越好;标绿的是该行最低,标白的是次低。日语、韩语和中文为字错率,其余为词错率,两者不合并成一个总分。我们自己跑的 FLEURS,一台 M5 MacBook Air,朗读语音。

表头简称:Qwen3-ASR = Qwen3-ASR 1.7B,Whisper Large = Whisper Large V3 Turbo,Parakeet = Parakeet V3,SenseVoice = SenseVoice Small。破折号表示该引擎没有这种语言的模型。

十个第一名只属于两个引擎。Qwen3-ASR 1.7B 拿下六行,Whisper Large V3 Turbo 拿下另外四行。Apple Speech 一个都没拿到。但在韩语、日语和中文上,它离第一名不到一分半,中文上还和 Whisper Large V3 Turbo 精确打平,都是 7.97。西班牙语和法语差得更多,德语更远。英语是底:8.80 对 4.49,六个里最后一名,凡是你本可以下载的模型都赢过它,包括体积最小的那个。还有三行根本没有 Apple 的格子,那是下一节的事。结论有两半:在它熟的语言上已经够用,而在我们能比的每一种语言上,它离开源模型还差着一档。

Apple Speech 支持哪些语言?

二十多种:这一轮里 Apple Speech 在 83 个语言配置中的 21 个上返回了结果,两个 Whisper 版本都是 83 个,Qwen3-ASR 1.7B 是 30 个,Parakeet V3 是 25 个。上面那十种语言里它缺三种——荷兰语、波兰语、俄语——API 直接回答没有模型,也就无从测起。也没有一份固定的清单可以引用:语言资源属于 macOS,app 只能在运行时问这台机器上到底装了哪些。

语言 Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
意大利语 4.39 2.58 2.58 7.64 3.43
粤语 8.69 6.44 36.75 119.01 37.23
葡萄牙语(巴西) 9.35 5.17 5.44 8.61 6.49

Apple Speech 在这里干净测到的其余语言,按它自己的错误率排序。引擎列、配色和简称同上;粤语为字错率,另外两种为词错率。错误率可以超过 100%,因为多出来的插入也算进分子。

它跑过但没有发布的还有十一个配置——孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、尼泊尔语、旁遮普语、泰米尔语、泰卢固语和乌尔都语——因为 Apple Speech 返回的是拉丁转写而不是本族文字,那里算出来的错误率量的是文字,不是识别。

我们怎么测的

先说公平。所有引擎听的是同一批片段、同样的顺序,一次只跑一条,机器只有一台:M5 MacBook Air,32 GB,macOS 27.0,所以苹果这边用的是它当下的引擎。音频是 Google FLEURS 测试集 70bb2e84 版,每种语言约 150 句、约 30 分钟。句子不是我们挑的:按数据集自带的条目 ID 做一次固定哈希排序,取刚好越过三十分钟的最短整条前缀。模型输出不参与这个选择。每一格都从它自己的收据重算并复核过才留下,285 格全部通过。

分数上,用空格分词的语言算词错率,日语、韩语、中文和粤语算字错率;两者不合并成一个总分。还有一条比上面都重要的限制:FLEURS 是朗读语音,不是会议,也不是听写。这些表能告诉你某个引擎在你的语言上值不值得一试。它们不能预测你在自己的录音上会拿到多少。

比旧版 Apple Dictation 进步了多少?

苹果一共提供两个转录工作点,我们两个都测了。SpeechTranscriber 是新的那个,也就是本文说的 Apple Speech。DictationTranscriber 是兼容的那个,是它出现之前 Mac 上的听写路径。

语言 Apple Dictation Apple Speech
韩语 7.11 4.31
意大利语 6.93 4.39
西班牙语(拉美) 8.43 5.41
德语 12.69 6.26
日语 9.37 6.36
法语 17.10 7.61
中文 10.28 7.97
粤语 10.18 8.69
英语 13.83 8.80
葡萄牙语(巴西) 10.85 9.35

两个苹果工作点都干净测到的全部语言,按 Apple Speech 的错误率排序;标绿的是该行更好的那个。同一轮测试,同一批片段,同一台 Mac。日语、韩语、中文和粤语为字错率,其余为词错率。

十种语言,Apple Speech 全部更准。中位的那种语言少掉大约三分之一的错误,法语和德语少掉一半以上。进步最小的是巴西葡萄牙语和粤语,大约每七个错误消掉一个。如果你对苹果语音识别的印象还停留在过去的听写上,那个印象已经过期了。

不过这是跟苹果自己的过去比,不是跟同场的模型比。在本文出现的每一种语言上,Apple Speech 都没有拿到过第一,它最好的名次是粤语上的第二。旧的听写倒是覆盖更多语言——这一轮里是 33 个配置对 21 个,包括新引擎在这里缺的那三种。

用系统自带的这个,换来什么?

引擎 速度 峰值内存 下载体积
SenseVoice Small 162.3x 倍实时 0.95 GiB 827 MB
Parakeet V3 75.6x 倍实时 0.09 GiB 465 MB
Apple Speech 30.8x 倍实时 不报 不用下载,系统自带
Qwen3-ASR 1.7B 11.1x 倍实时 2.43 GiB 约 2.5 GB
Whisper Small 7.9x 倍实时 0.87 GiB 600 MB
Whisper Large V3 Turbo 3.0x 倍实时 1.87 GiB 约 1.6 GB

速度取中位数,范围是本文这些语言里该引擎实际跑过的那些——单条隔离测量的处理吞吐,是诊断值,不是产品延迟。峰值内存是这一轮的进程组峰值。Apple Speech 的解码发生在调用方 app 管不着的 macOS 系统服务里,那一格填什么数字都和另外五个不是一回事。

Apple Speech 既不用装,也不用留。没有模型文件,没有下载,app 自己的进程里也不分配内存。最后这条不等于零:系统服务工作时确实要用内存,而我们没法把它精确归给谁,所以那一格我们不报数字,而不是报零。它也快——这里大约三十倍实时,只慢于 Parakeet V3 和 SenseVoice Small。对不少人来说这就是全部理由,而在它擅长的语言上,准确率也撑得住这个理由。

赢过它的那几个,都得拿别的东西来换。Whisper Large V3 Turbo 拿下十行里的四个第一,同时是这次最慢的引擎,比 Apple Speech 慢十倍左右,磁盘上约 1.6 GB。Qwen3-ASR 1.7B 拿下另外六个,代价是约 2.5 GB 下载和 2.43 GiB 内存。Parakeet V3 是反例,465 MB、0.09 GiB,而它的代价时轻时重:法语上比 Turbo 还准,波兰语上差得多,日语、韩语、中文和粤语则一个都没有。最接近的比较对象是 Whisper Small,那也是对苹果最有利的一次——我们为两者都干净测到的十种语言里,有八种 Apple Speech 更准,而 Whisper Small 是一个你得一直留着的 600 MB 文件。

该用 Apple Speech 还是下载一个模型?

按语言来看,我们会这样回答。

  • 如果你转写荷兰语、波兰语或俄语:Apple Speech 不是选项,它没有这些语言的模型。这三种最准的都是 Whisper Large V3 Turbo
  • 如果磁盘或下载体积是你的约束:Apple Speech 什么都不用装。我们为两者都干净测到的十种语言里,有八种它比 Whisper Small 更准,例外是英语和巴西葡萄牙语。
  • 如果你转写韩语、日语或中文,又想用系统自带的:这三种它离该行最准的模型都不到一分半,中文上还和 Whisper Large V3 Turbo 打平。在你还不需要抠最后一两分之前,这个成绩站得住。
  • 如果你转写英语:它在六个里排最后,8.80,而 Qwen3-ASR 1.7B 是 4.49、Whisper Large V3 Turbo 是 5.49。下一个吧。
  • 如果你转写粤语:Apple Speech 是第二,8.69,第一是 Qwen3-ASR 1.7B 的 6.44——粤语也是两个 Whisper 都用不了的那一行,36.75 和 119.01。
  • 如果你只要每种语言最准的那个,不在乎下载:Qwen3-ASR 1.7B 赢下英语、德语、韩语、法语、中文和西班牙语;Whisper Large V3 Turbo 赢下荷兰语、俄语、波兰语和日语。
  • 如果你用的是 iPhone 版或 Mac App Store 版:Whisper Notes 在那两个渠道提供的引擎是 Whisper、Parakeet V3 和 SenseVoice。

Apple Speech 是本文对苹果自家 SpeechTranscriber 的简称,这是 macOS 26 和 iOS 26 引入的设备端 API,任何 Mac app 都能调用。它是系统的引擎,不是我们的:磁盘上没有模型文件,语言资源由 macOS 管理,要 macOS 26 及以上。它不在 Mac 版 Whisper Notes 需要你下载的那几个模型之列——那几个模型系列,Mac 直接下载版(DMG)是 Whisper、Parakeet V3、SenseVoice 和 Qwen3-ASR,iPhone 版和 Mac App Store 版是 Whisper、Parakeet V3 和 SenseVoice。这几个引擎的语言表在语言支持页上。

这些数字不改变 Mac 版 Whisper Notes 今天的样子,Parakeet V3 仍是默认

常见问题

Apple Speech 和 Whisper 一样准吗?

两者都支持的语言里,大多数上它还差一截,但差距比传闻小。在我们自己跑的 FLEURS 测试里,这十种语言中 Apple Speech 支持的七种,Whisper Large V3 Turbo 赢六种,中文精确打平,都是 7.97% 字错率。换成体积更小的 Whisper Small,结果反过来:同样这七种里 Apple Speech 赢六种,只输英语,8.80% 对 7.04% 词错率。在这次测试里 Apple Speech 没有拿到过第一。它离第一最近的是韩语(4.31% 字错率对该行最准的 3.54%)、日语(6.36% 对 5.30%)和中文(7.97% 对 6.49%),离得最远的是英语,8.80% 对 4.49% 词错率。粤语是我们干净测到的语言中唯一一个 Apple Speech 赢过 Whisper Large V3 Turbo 的,8.69% 对 36.75% 字错率。如果你完全不想下载模型、语言又在它覆盖范围内,系统自带的这个够用;如果你要最准的结果,或者你的语言正好是它在这里缺的那三种之一,那就用 Whisper Large V3 Turbo。

Apple Speech 支持哪些语言?

二十多种,但清单不在 app 手里,是 macOS 说了算。我们这一轮里它在 83 个语言配置中的 21 个上返回了结果,两个 Whisper 版本都是 83 个,Qwen3-ASR 1.7B 是 30 个,Parakeet V3 是 25 个。本文那张主表取的是十种最常用的语言,好让所有引擎在同样的行里比:这十种里它有英语、德语、日语、韩语、法语、中文和西班牙语,没有荷兰语、波兰语和俄语。意大利语、巴西葡萄牙语和粤语它也支持,那几行在第二张表里。也没有一份固定的清单可以公布:app 只能在运行时向系统查询这台机器上装了哪些语言,因为这些资源是 macOS 下载和管理的,不归 app 管。如果你的语言不在里面,Whisper 覆盖 app 语言表里的全部语言,每个渠道都有。

磁盘紧张时该选 Apple Speech 还是 Whisper Small?

我们为两者都干净测到的十种语言里,八种该选 Apple Speech。韩语它是 4.31% 字错率,Whisper Small 是 7.30%;意大利语 4.39% 对 7.64% 词错率;西班牙语 5.41% 对 6.22%;德语 6.26% 对 8.67%;日语 6.36% 对 11.37% 字错率;法语 7.61% 对 13.24%;中文 7.97% 对 20.50% 字错率;粤语 8.69% 对 119.01% 字错率。Whisper Small 领先的是英语,7.04% 对 8.80%,还有巴西葡萄牙语,8.61% 对 9.35%。而且 Apple Speech 什么都不用下载,Whisper Small 是一个 600 MB 的模型文件。仍然值得留着 Whisper Small 的理由是广度:它覆盖 app 语言表里的全部语言,包括 Apple Speech 在这里缺的那三种,而且它在每个渠道都能用——iPhone、Mac App Store 版和直接下载版都有。

SpeechAnalyzer 是什么?它和苹果的听写是一回事吗?

SpeechAnalyzer 是苹果在 WWDC 2025 发布、随 macOS 26 和 iOS 26 一起交付的总的 API。SpeechTranscriber 是它里面的转录工作点,我们测的就是这个,本文说的 Apple Speech 也是它。听写是另一个工作点,兼容的那个,我们也跑了:两者都干净测到的十种语言,Apple Speech 全部更准,中位的那种语言少掉大约三分之一的错误,法语和德语少掉一半以上。逐语言的表在上面那一节里。听写覆盖的语言确实更多——我们这一轮里是 33 个配置对 21 个——所以如果你需要一个系统引擎来做荷兰语、波兰语或俄语,又能接受 17.34%、13.50% 和 13.13% 的词错率,它就是那个选项;同一批片段上 Whisper Large V3 Turbo 是 5.69%、5.45% 和 5.13%。

用 Apple Speech 时音频会离开我的 Mac 吗?

苹果把 SpeechTranscriber 写成设备端语音识别,我们这次测的就是这个 API:语言资源由 macOS 下载一次,识别本身在本地跑。我们这篇测的是准确率和速度,不是网络行为,所以这部分我们按苹果自己的说法转述。Whisper Notes 自己下载的那几个引擎——Whisper、Parakeet V3、SenseVoice 和 Qwen3-ASR——跑在你 Mac 自己的 GPU 或神经引擎上,不需要账号,不需要 API key,断网也能转写,每个渠道都是如此。

为什么这些数字和我在自己的录音上得到的准确率对不上?

因为 FLEURS 是短句、干净的朗读语音,而你的录音不是。我们这一轮是在公开数据集上做的校准:每种语言约 150 句、约 30 分钟音频,一台 M5 MacBook Air,所有引擎听同样的片段。它适合判断某个引擎在某种语言上值不值得一试,不能用来预测你在会议、噪声环境、带口音的语音或两小时长文件上的准确率。

去试试

这次对比里需要下载的那五个模型——Whisper Small、Whisper Large V3 Turbo、Parakeet V3、SenseVoice Small 和 Qwen3-ASR 1.7B——在 Mac 版 Whisper Notes 的直接下载版(DMG)里都有,位置是设置 → 转录模型。朗读语音只是个起点,你自己的音频才是真正的考题。

某种语言上我们的数字和你的实际体验对不上,写信到 mac@whispernotes.app 告诉我们。完整更新说明:whispernotes.app/changelog

以上所有数据的来源:我们在 Google FLEURS 测试集 70bb2e84 版本上的测试、苹果的 SpeechAnalyzer 文档,以及在此之前那次三十种语言的 Qwen3-ASR 测试