Qwen3-ASR 对比 Whisper:30 种语言,各赢 15 种(Mac 实测)

2026年8月25日
·
15 min read
·Whisper Notes Team

TL;DR:我们自己跑的 FLEURS,30 种共同语言

Qwen3-ASR 1.7B(Beta) Whisper Large V3 Turbo
支持语言 标称 30 种 101 种
30 种共同语言里胜出几种 15 15
其中超出误差范围的 5 11
字错率均值(中文、粤语、日语、韩语、泰语) 5.30% 13.44%
词错率均值(其余 25 种) 13.99% 10.16%
粤语 6.00% 字错率 37.97% 字错率
下载体积 / 本轮峰值内存 约 2.5 GB / 2.43 GiB 约 1.6 GB / 1.87 GiB
哪里能用 仅 Mac 直接下载版(DMG)1.6.0 及以上 两个 Mac 版本都有

* 这是我们自己的测量,不是官方榜单。数据集为 Google FLEURS 测试集,版本号 70bb2e84,每种语言每个模型约 15 分钟音频,机器是一台 M5 MacBook Air(32 GB,macOS 26.5)。FLEURS 是短句朗读语音,干净、规整,因此这些数字不能预测会议、听写、噪声环境和长录音。词错率与字错率不会合并成一个总分。

有没有哪个本地模型,在你说的这门语言上比 Whisper 更准?从 Mac 直接下载版(DMG)1.6.0 起,Mac 版 Whisper Notes 多了第四个可选引擎:Qwen3-ASR 1.7B,以 MLX 8-bit 完全在你的 Mac 上运行,目前是 Beta。我们把它和 Whisper Large V3 Turbo 放在同一台机器、同一批音频、同一套评分标准下,跑完了它标称的全部 30 种语言。结论是:15 种更准——另外 15 种归 Whisper。但这 15 种和我们原本以为的那 15 种,不是同一批。

我们是做这个 app 的人,所以尽量让这次对比难以做手脚。对比的 Whisper 用的是 Large V3 Turbo,因为那是 app 里最大的 Whisper。但它终究是我们自己测的,不是第三方基准,而且是朗读音频,不是真实录音。

先说结论

  • 如果你转写粤语,这是本轮差距最大的一项。Qwen3-ASR 1.7B 字错率 6.00%,Whisper Large V3 Turbo 是 37.97%,SenseVoice Small 在同一批音频上是 36.71%。粤语是唯一一门被这个新引擎在 Whisper Notes 的 Mac 直接下载版上改变了可行性的语言。
  • 如果你转写印地语、泰语、越南语或法语Qwen3-ASR 1.7B 的领先幅度超出了误差范围:印地语领先 16.7 个百分点,泰语 7.0,越南语 4.7,法语 1.4。
  • 如果你转写中文、日语、韩语、英语、德语、西班牙语或意大利语,它领先,但只领先一点点,我们也只敢说这一点点。这些差距都落在 95% 区间以内,意味着本轮数据分不出高下。两个模型都可以用。波斯语、阿拉伯语和印尼语也在这一档;俄语、葡萄牙语、马其顿语和马来语同样在这一档,只是方向偏向 Turbo。
  • 如果你转写芬兰语、匈牙利语、希腊语、捷克语、瑞典语、丹麦语、波兰语、罗马尼亚语、菲律宾语、土耳其语或荷兰语,请继续用 Whisper Large V3 Turbo。这十一种它都明确胜出,芬兰语和匈牙利语的差距超过 19 个百分点。
  • 如果你在意的是速度和占用,这个引擎不适合你。同一套测试里,Parakeet V3SenseVoice Small 快了一个数量级,体积也只有它的零头。
  • 如果你用的是 iPhone 版或 Mac App Store 版,这个引擎根本不在里面。它只在 Mac 直接下载版(DMG)1.6.0 及以后的版本中。

Qwen3-ASR 1.7B 是什么,不是什么?

Qwen3-ASR 是阿里巴巴的语音识别模型系列,建立在 Qwen3-Omni 基础模型的音频理解能力之上。1.7B 的模型卡自称"在开源 ASR 模型中达到业界最好水平",并列出 52 种语言和方言:30 种语言,加 22 种中文方言。

阿里巴巴同时把 Qwen3-ASR 作为云服务出售。如果你看到过"Qwen3-ASR API"的说法,指的是百炼(DashScope)上的实时 API 或录音文件转写 API:音频上传到阿里的服务器,返回文本。

Whisper Notes 走的不是这条路。我们拿的是开放权重,转成 Apple MLX 的 8-bit 格式,跑在你自己 Mac 的 GPU 上。没有账号,没有 API key,没有上传。音频不会离开这台机器——这一点和另外三个引擎完全一样。我们把模型放在本地跑,本来就是为了这件事,而它也是选择器里唯一一条不随引擎变化的事实。

三个"不是"——另外三个引擎系列每个渠道都有,只有它不在 iPhone 上,不在 Mac App Store 版里,也还没有走出 Beta。那三个是 Whisper、Parakeet V3 和 SenseVoice;Mac 直接下载版(DMG)1.6.0 及以后多出 Qwen3-ASR 1.7B 这第四个。

SenseVoice 不是已经换掉 Qwen3-ASR 了吗?

换掉了,那句话现在依然成立。直接下载版(DMG)1.5.0 里,我们用 SenseVoice Small 替换了 Qwen3-ASR。当时移除的是 0.6B 版本,走 sherpa-onnx 在 CPU 上自回归推理,27 分钟的中文播客要跑 224 秒。SenseVoice 处理同一个文件只用了 13.83 秒。

1.6.0 里来的是另一个模型。参数量接近三倍,运行方式从 CPU 上的 sherpa-onnx 换成 GPU 上的 MLX,下文所有数据也都是单独重跑的。0.6B 不会回来了。把这两个理解成同一家族的两个成员,而不是同一个模型走了又回来。

SenseVoice 也没有被拿掉。中文、日语、韩语仍然首选它,所有渠道都有,而且它是两者中唯一能在 iPhone 上跑的。

我们是怎么测的?

这一轮跑的是冻结好的协议,不是随手掐的几个表。下面这些细节足够你拿来反驳我们。

  • 模型。Qwen3-ASR 1.7B 用的是 app 内置的那个 MLX 8-bit 版本;Whisper Large V3 Turbo 用的是 app 内置的 whisper.cpp ggml 版本,跑在 Metal 上。
  • 数据。Google FLEURS 的测试集,版本锁定在 70bb2e84,CC-BY-4.0 许可。
  • 抽样。每种语言按固定顺序取前 15 分钟,不随机抽。所有模型听到的是同一批片段、同样的顺序,没有谁抽到更容易的题。
  • 评分。以空格分词的语言用词错率,中文、粤语、日语、韩语、泰语用字错率。两者绝不合并成一个全局分数——一个数字符、一个数词,含义本来就不同。
  • 误差范围。每一格都做 10,000 次自助重采样。FLEURS 没有公开说话人聚类信息,所以区间是条目级的,我们也如实标注。
  • 机器。一台 M5 MacBook Air,32 GB,macOS 26.5。空输出和失败都计入分母。两个模型这一项都是零。

下面这段比协议本身更重要。FLEURS 是短句、干净、朗读的语音:有人对着好麦克风念一句话。你的会议不是这样。你的听写也不是这样。我们自己的测试里已经两次看到朗读集排名在真实音频面前失效,所以我们在基准测试的仓库里定了条规矩:朗读集排名不外推到真实长录音。这张表适合用来判断"这个模型在我这门语言上值不值得一试",不适合用来预期"我能拿到的准确率就是这个数"。

我们还没有跑完 Qwen3-ASR 1.7B 在真实会议场景上的评测。跑完了会单独写一篇,并附上它自己的方法说明。

两个模型各自赢在哪里?

全部 30 种语言,按 Qwen 领先最多到落后最多排列。两列都是越低越好。最后一列表示这个差距有没有超出配对 95% 区间;写"否"的行,本轮数据分不出两个模型的高下,请当成平手来读。

我们自己跑的 FLEURS,一台 M5 MacBook Air,朗读语音。

语言 指标 Qwen3-ASR 1.7B Whisper Large V3 Turbo 差值(百分点) 超出误差范围?
粤语 字错率 6.00 37.97 -31.98
印地语 词错率 13.67 30.42 -16.74
泰语 字错率 5.92 12.95 -7.04
越南语 词错率 5.07 9.79 -4.72
波斯语 词错率 26.98 30.03 -3.05
阿拉伯语 词错率 14.14 15.75 -1.61
印尼语 词错率 4.97 6.50 -1.54
法语 词错率 3.98 5.39 -1.40
中文 字错率 5.69 6.88 -1.19
英语 词错率 5.07 5.92 -0.85
德语 词错率 3.51 4.10 -0.60
日语 字错率 5.39 5.71 -0.32
韩语 字错率 3.51 3.70 -0.18
西班牙语 词错率 3.60 3.76 -0.15
意大利语 词错率 2.98 3.05 -0.07
俄语 词错率 5.98 5.51 +0.47
葡萄牙语 词错率 5.64 4.91 +0.73
马其顿语 词错率 17.81 16.64 +1.18
马来语 词错率 11.60 10.18 +1.41
荷兰语 词错率 7.65 5.63 +2.02
土耳其语 词错率 8.34 5.53 +2.81
丹麦语 词错率 20.12 14.92 +5.20
波兰语 词错率 12.78 5.32 +7.46
罗马尼亚语 词错率 18.97 8.22 +10.75
菲律宾语 词错率 20.44 9.37 +11.07
瑞典语 词错率 20.04 8.72 +11.31
捷克语 词错率 23.92 11.15 +12.77
希腊语 词错率 30.20 12.97 +17.23
芬兰语 词错率 26.08 6.54 +19.53
匈牙利语 词错率 36.35 13.66 +22.69

我们自己的配对测试,FLEURS 测试集版本 70bb2e84,每种语言约 15 分钟,一台 M5 MacBook Air。差值单位为百分点。"超出误差范围"指差值的配对 95% 自助区间不包含零。

这张表能读出三件事,只有一件对我们有利。

比分是平的。各胜 15 种。这份数据没有任何一种读法能得出"Qwen3-ASR 1.7B 可以全面替代 Whisper",我们也不会那样讲。30 个差距里有 16 个超出误差范围——Qwen 占 5 个,Turbo 占 11 个;剩下 14 个只在小数点上分得出胜负。

赢的地方和输的地方不在同一片区域。按字计分的五种语言——中文、粤语、日语、韩语、泰语——Qwen 平均 5.30%,Turbo 是 13.44%。按词计分的另外二十五种,Qwen 平均 13.99%,Turbo 是 10.16%。它明确赢下的是按字计分的那几种,加上印地语、泰语和越南语;而在 Turbo 处理得游刃有余的北欧和中欧语言上它垮得很彻底,菲律宾语也一样,Turbo 领先 11 个百分点。

粤语这一行才是真正会改变选择的。6.00% 对 37.97%,这不是调参能解释的差距。我们此前把 SenseVoice 写成粤语的答案,而在同一批音频上 SenseVoice 是 36.71% 字错率,和 Turbo 差不多。在这套朗读语音数据上,这两个数字都不足以支撑粤语。与其让旧的推荐不加限定地留在那里,不如把这个限定条件补上。如果你说粤语、并且用的是 Mac 直接下载版,值得试试这个 Beta。如果你在 iPhone 或 Mac App Store 版上,SenseVoice 仍是你能用的粤语引擎;而且它在中文、日语、韩语上的表现,比粤语这一行给人的印象好得多。

这份准确率要付出什么代价?

准确率只是一个维度。另外三个维度在同一套测试、同一台机器上测得,所以至少这几个引擎彼此之间是可比的。

引擎 语言数 本轮速度中位数(短片段) 峰值内存 下载体积 可用渠道
SenseVoice Small 6 个选项 161.0 倍 0.95 GiB 827 MB iPhone、两个 Mac 版本
Parakeet TDT 0.6B v3 25 82.9 倍 0.09 GiB 465 MB iPhone、两个 Mac 版本
Qwen3-ASR 1.7B(Beta) 标称 30 种 8.7 倍 2.43 GiB 约 2.5 GB 仅 Mac 直接下载版(DMG)1.6.0+
Whisper Small 101 6.4 倍 0.87 GiB 600 MB iPhone、两个 Mac 版本
Whisper Large V3 Turbo 101 2.4 倍 1.87 GiB 约 1.6 GB 两个 Mac 版本

同一次 FLEURS 测试中,各引擎在其支持语言上的实时倍率中位数,机器为一台 M5 MacBook Air。这些是短片段的测试台数据,比 app 处理长录音时的实际表现要低。这一列只能用来在这一轮里横向比较各引擎,不能用于别处。峰值内存为逐条目观测到的进程最大占用。

这张表要当阶梯看,不要当排行榜看。同一套测试里,Parakeet V3SenseVoice Small 比 Qwen3-ASR 快了大约一个数量级,体积则是 465 MB 和 827 MB 对 2.5 GB。在 app 里处理长文件时,Parakeet 在 M4 Pro 上跑到过 103 倍实时,SenseVoice 是 52 倍以上——那是另一套音频上的另一种测量,但指向是一致的。

Qwen3-ASR 落在这道阶梯的中间。它并不是本轮短片段测试里最慢的引擎,最慢的是 Whisper Large V3 Turbo;但它在语言之间的波动比谁都大,希腊语 2.7 倍,日语 12.4 倍。而在资源占用上,它是 app 里最重的:下载最大,峰值内存最高,也是唯一一个抬高了系统要求的引擎。

切换之前还需要知道什么?

这个引擎附带五个条件。没有一个是缺陷,它们只是一个 1.7B 模型跑在笔记本上应有的样子。

  • 它是 Beta。模型选择器里就是这么标的,意思是行为和默认值在版本之间仍可能变动。另外四个引擎不是 Beta。
  • 它需要 macOS 15 及以上、Apple 芯片,建议 16 GB 内存。Mac 版 app 的其余部分在 macOS 14 上就能跑。只有这个引擎要求更多,本轮 2.43 GiB 的进程峰值内存就是原因;如果你的 Mac 是 8 GB 内存,Parakeet V3 和 Whisper Small 用 465 MB 和 600 MB 就能干同样的活。
  • 它是约 2.5 GB 的下载。首次使用时在 app 内下载,取消或断网后可以续传,使用前会校验完整性。如果磁盘吃紧,Whisper Small 用 600 MB 就覆盖 101 种语言。
  • 用它做语音输入时是准确率优先,不是边说边出字。按住 Fn 说话,松开,完整文本一次性粘贴。我们用同一批音频把真流式版本和这个版本做过对拍,流式那条路更差:30 组英语配对是 9.25% 对 3.13% 词错率,30 组德语是 22.60% 对 2.93%。我们选了准确率。它能接受很短的语音,所以用它口述一行修改照样能用。另外,模型必须先加载完成,语音输入才会受理按键,不会让你对着一个尚未就绪的模型说话。
  • 导入音频时确实会边转边出字。那是另一条路径:文件在本地一次性离线转写,文字随模型产出逐步显示在页面上。最终保存的是这一遍转写的结果。

如果上面这些都不吸引你,你的设置一点都不用改。Parakeet V3 仍然是默认引擎,英语和大部分欧洲语言仍然选它;非 Beta 引擎之间的完整对比表也在那篇里。

是哪 30 种语言,怎么打开?

Qwen3-ASR 1.7B 标称 30 种语言:阿拉伯语、粤语、中文、捷克语、丹麦语、荷兰语、英语、菲律宾语、芬兰语、法语、德语、希腊语、印地语、匈牙利语、印尼语、意大利语、日语、韩语、马其顿语、马来语、波斯语、波兰语、葡萄牙语、罗马尼亚语、俄语、西班牙语、瑞典语、泰语、土耳其语、越南语。简体中文和繁体中文在选择器里是两个选项,共用同一个中文请求,所以你在语言支持页上会数到 31 个勾、30 个语言名。

这 30 种语言,Whisper 在所有渠道也都覆盖——变的只是错误率,粤语上差了整整 32 个百分点。

打开方法:用 Mac 直接下载版(DMG)1.6.0 或更高版本打开 Whisper Notes,进入设置,找到转录模型,选择 Qwen3-ASR 1.7B。模型在首次使用时下载。如果下载中断,重新打开选择器会续传,不会从头再来。

选择器里带着和上面这张表同源的数字。选中一个模型,展开它的语言列表,每种语言会显示实测的词错率或字错率,各引擎中最低的那个标绿,下面注明"On-device results on a subset of FLEURS."(设备端结果,基于 FLEURS 的一个子集)。我们宁愿你按实测数据挑模型,也不要按宣传挑——包括我们自己的宣传。

命令行也能用。本地 CLI 和 MCP 服务接受 qwen、qwen3、qwen3-asr 三个名字,走的是和界面完全相同的 app、语言选择和分块逻辑。

常见问题

Qwen3-ASR 比 Whisper 更准吗?

取决于语言,而且比分接近对半。在我们自己用 Mac 版 Whisper Notes 跑的 FLEURS 测试中,两个模型共同覆盖的 30 种语言里,Qwen3-ASR 1.7B 赢 15 种,Whisper Large V3 Turbo 赢 15 种。Qwen 明确领先的是粤语(6.00% 对 37.97% 字错率)、印地语(13.67% 对 30.42% 词错率)、泰语、越南语和法语。Turbo 明确领先的是芬兰语(6.54% 对 26.08% 词错率)、匈牙利语、希腊语、捷克语、瑞典语、丹麦语、波兰语、罗马尼亚语、菲律宾语、土耳其语和荷兰语。30 个差距里有 14 个落在误差范围内,应当视为平手。如果你的语言在 Qwen 领先的那一列,并且能接受 Whisper Notes 的 Mac 直接下载版(DMG)上的一个 Beta,就选 Qwen3-ASR;其余情况、以及 Qwen 那 30 种之外的所有语言,选 Whisper Large V3 Turbo——它覆盖全部 101 个语言选项。

iPhone 版或 Mac App Store 版能用 Qwen3-ASR 吗?

不能。Qwen3-ASR 1.7B 只在 Whisper Notes 的 Mac 直接下载版(DMG)1.6.0 及以后的版本里,其他渠道都没有。iPhone 版和 Mac App Store 版有三个引擎系列——Whisper、Parakeet V3、SenseVoice——而 Qwen 能识别的每一种语言,这些渠道的 Whisper 也都覆盖。若按模型数量算,Mac App Store 版是四个,直接下载版是五个,因为 Whisper 有 Small 和 Large V3 Turbo 两档。如果你需要在 iPhone 上转写粤语,那里用 SenseVoice。

中文、日语、韩语该选 Qwen3-ASR 还是 SenseVoice?

准确率很接近,速度差得很远。我们的 FLEURS 测试中,Qwen3-ASR 中文字错率 5.69%、日语 5.39%、韩语 3.51%;SenseVoice Small 在同一批音频上分别是 7.06%、6.85%、7.82%。但同一轮里 SenseVoice 的实时倍率中位数是 161 倍,Qwen 是 8.7 倍;下载体积是 827 MB 对约 2.5 GB;而且 SenseVoice 在 iPhone 和两个 Mac 版本上都能用。除非你转写的是粤语——那里 Qwen3-ASR 是 6.00% 字错率、SenseVoice 是 36.71%,差距大到值得多等一会儿——否则选 SenseVoice。

这里的 Beta 是什么意思?

意思是这个引擎已经发布、可以正常使用,但它的行为和默认值在 Mac 直接下载版(DMG)的后续版本中仍可能变化。Whisper Notes 里另外四个模型——Parakeet V3、SenseVoice Small、Whisper Small、Whisper Large V3 Turbo——都不是 Beta。转写同样完全在设备上进行:不需要账号,不上传,飞行模式下照常工作。如果你不想用 Beta,Parakeet V3 仍是默认引擎,对你来说什么都不会变。

Qwen3-ASR 1.7B 的系统要求是什么?

需要一台 Apple 芯片的 Mac,macOS 15 或更高版本,建议 16 GB 内存,另需约 2.5 GB 磁盘空间存放模型。这比 Mac 版 Whisper Notes 其余部分的要求更高——app 本身在 macOS 14 及以上就能运行。我们的测试中该模型进程峰值内存为 2.43 GiB,是五个引擎里最高的。如果你的 Mac 是 8 GB 内存,Whisper Small 用 600 MB 覆盖同样的 101 种语言,Parakeet V3 用 465 MB 覆盖 25 种欧洲语言。

这是 1.5.0 里被 SenseVoice 换掉的那个 Qwen3-ASR 吗?

不是,这是同一家族里更大的一个模型。直接下载版(DMG)1.5.0 移除的是 Qwen3-ASR 0.6B,走 sherpa-onnx 在 CPU 上自回归推理,27 分钟的中文播客要 224 秒。Qwen3-ASR 1.7B 的参数量大约是它的三倍,通过 Apple MLX 以 8-bit 跑在 GPU 上。SenseVoice Small 仍然在 app 里,所有渠道都有,中文、日语、韩语上仍是更快的选择。

用 Qwen3-ASR 时音频会离开我的 Mac 吗?

不会。阿里巴巴确实也把 Qwen3-ASR 做成云服务,通过百炼(DashScope)的实时 API 和录音文件转写 API 提供,那条路径需要把音频上传到他们的服务器。Whisper Notes 不使用这些接口。它把开放权重作为 MLX 8-bit 模型跑在你 Mac 自己的 GPU 上,不需要账号,不需要 API key,断网也能转写。app 里四个引擎系列都是如此。

为什么这些数字和我在自己的录音上得到的准确率对不上?

因为 FLEURS 是短句、干净的朗读语音,而你的录音不是。我们这一轮是在公开数据集上做的校准:每种语言约 15 分钟,一台 M5 MacBook Air,所有模型听同样的片段。它适合判断某个模型在某种语言上值不值得一试,不能用来预测你在会议、噪声环境、带口音的语音或两小时长文件上的准确率。朗读集排名在真实音频面前失效,我们自己已经遇到过两次,所以我们把它作为校准发布,而不是当作定论。

去试试

Qwen3-ASR 1.7B 在 Mac 版 Whisper Notes 1.6.0 及以后的直接下载版(DMG)里,标记为 Beta。位置是设置 → 转录模型。免费试用额度是 10,000 字,足够你把自己的语言跑一遍,然后来反驳上面那张表。

如果你发现某种语言上我们的数字和你的实际体验对不上,我们很想知道。写信到 mac@whispernotes.app。完整更新说明:whispernotes.app/changelog

以上所有数据的来源:我们在 Google FLEURS 测试集 70bb2e84 版本上的测试、Qwen3-ASR 1.7B 模型卡,以及语言支持页上按引擎划分的语言表——那张表由 app 源码生成。