Mistral Voxtral vs GPT-4o | 语音AI基准测试

2025年8月2日
·
8 min read
·Whisper Notes Team

Mistral 发布了 Voxtral——他们首个开放权重的转录与音频理解模型家族。官方基准显示它在多语言语音识别和音频问答上表现不俗,但两个尺寸的硬件要求差别很大。这篇文章梳理这次发布实际支持什么,以及为什么 Whisper Notes 在消费级 Apple 硬件上仍然选择更小、专注转录的模型。

Mistral Voxtral 性能基准

两个模型

Mistral 在 2025 年 7 月发布了两个 Apache 2.0 许可的检查点:

Voxtral Small 24B

  • 240 亿参数
  • 转录、翻译、音频问答与摘要
  • 32k 上下文窗口
  • bf16/fp16 下约需 55 GB GPU 显存

Voxtral Mini 3B

  • 30 亿参数
  • 同一套音频+文本任务能力,装进更小的检查点
  • 官方定位为本地与边缘部署
  • bf16/fp16 下约需 9.5 GB GPU 显存

开放权重与许可证

2025 年发布的两个检查点都是 Apache 2.0 许可的开放权重,可以自行下载运行:

  • 完整模型权重开放下载
  • 在 Apache 2.0 许可范围内自托管或改造
  • 自托管不产生 Mistral API 费用,但算力成本仍需自己承担
  • 音频可完全在自己的服务器上处理

资料来源:Mistral 官方 Voxtral 发布公告、官方 Voxtral Small 模型卡 与官方 Voxtral Mini 模型卡

基准测试

Mistral 的发布材料对比了英语短音频、长音频、Mozilla Common Voice、FLEURS 和 Multilingual LibriSpeech 上的宏平均词错误率。在 Mistral 报告的 FLEURS 结果中,Voxtral Small 在所有评测任务上都胜过 Whisper。WER 越低越好:

Voxtral 与各模型的 WER 基准对比

横轴为估算 API 价格,纵轴为 Mistral 发布基准中的 FLEURS WER;基准结果和价格都可能变化

FLEURS 只反映转录质量的一个切面,且这些都是厂商自报的结果。选型前请对照公开的基准定义,用你自己的语言、麦克风和录音环境实测。

Voxtral vs Whisper:该用哪个?

基准分数只是故事的一部分。如果你真打算自己跑一个模型,这几个维度才是关键:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
语言支持 8 种主要语言 8 种主要语言 100+ 种 100+ 种
开源
模型体积 24B 参数;bf16/fp16 约 55 GB GPU 显存 3B 参数;bf16/fp16 约 9.5 GB GPU 显存 15.5 亿参数 8.09 亿参数(约 1.6 GB)
消费级 Mac 上是否实用 全精度下常规硬件跑不动 配合兼容的运行时可行,但比 Turbo 重 可以 可以

结论:Voxtral Small 的 WER 成绩确实亮眼,还带上了 Whisper 不涉及的音频理解能力。Voxtral Mini 是 Mistral 定位给本地和边缘部署的检查点,但官方模型卡写明 bf16/fp16 下仍需约 9.5 GB GPU 显存。对一款面向消费者的转录应用来说,Whisper Large-v3 Turbo 更容易集成,语言覆盖也广得多。这就是 Whisper Notes 目前组合使用 Whisper Turbo、Parakeet V3 和 SenseVoice、而不是 Voxtral 的原因。

API 与自托管成本

截至 2026 年 7 月 10 日,Mistral 的模型卡标注 Voxtral Small 的音频输入价格为每分钟 $0.004。音频理解类请求的文本输入和生成文本另行计费。如果自托管 Apache 2.0 权重,则没有 Mistral API 费用,但硬件和运维成本由你承担。

Mistral API

$0.004
Voxtral Small 每分钟音频

自托管权重

Apache 2.0
无 API 费用;算力自理

工作原理

官方模型卡把 Voxtral 描述为"语言模型骨干 + 音频编码器 + 专用转录模式"的组合。产品层面的关键限制都写得很具体:

1. 多模态架构

Voxtral 能在同一段对话中接收音频和文本,而不仅仅是一个语音转文字解码器:

  • 专用的直接转录模式
  • 音频问答与结构化摘要
  • 支持多段音频输入和多轮音频对话

长音频上限

32k 上下文窗口最长支持 30 分钟音频的转录,或 40 分钟音频的更广义理解任务。

2. 语言与评测

Mistral 列出了八种主要语言,支持自动检测:

  • 英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语
  • 基准测试涵盖 FLEURS、Mozilla Common Voice 和 Multilingual LibriSpeech
  • 发布材料还分别评测了英语短音频和长音频

3. 部署要求

权重开放不等于每个检查点都小到任何设备都能跑:

  • 据官方模型卡,Voxtral Small 在 bf16/fp16 下约需 55 GB GPU 显存
  • Voxtral Mini 是面向本地和边缘部署的 3B 检查点
  • Mistral 推荐用 vLLM 部署这些检查点

4. 核心特性

上下文理解

能直接基于音频回答问题、生成摘要,上限受 32k 上下文约束。

多语言

自动检测并转录八种主要语言:英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语。

噪音处理

官方评测覆盖了多样的语音数据集,但 Mistral 并未对所有嘈杂录音场景给出笼统保证。

边缘部署

Voxtral Mini 是本地和边缘部署的选项,官方模型卡标注 bf16/fp16 下约需 9.5 GB GPU 显存。

5. 架构

三个主要组件:

  1. 1. 音频编码器:把波形转换成学习到的音频表示
  2. 2. 投影层:把音频表示映射到语言模型的隐空间
  3. 3. 语言模型骨干:生成转录文本、答案、摘要或工具调用

这种设计解释了为什么 Voxtral 不止能转录——但也意味着它背着比 Whisper Turbo 这类纯转录模型大得多的语言模型权重。

为什么 Whisper Notes 依然是合理选择

Voxtral 和 Whisper Notes 解决的是不同问题。Voxtral 把转录和音频理解结合在一起;Whisper Notes 专注于在消费级 Apple 硬件上轻松运行的私密转录。

Whisper Notes 提供什么

隐私

性能

  • Whisper 技术,准确率久经验证
  • 针对 Apple Silicon 优化
  • 结果稳定可靠

成本

  • Whisper Notes 采用一次性购买,不收订阅费。一次 App Store 购买包含 iPhone、iPad 与 Mac App Store 版;官网直下 DMG 版是单独销售的一次性许可。价格以各购买渠道显示为准。
  • 不按分钟收费
  • 无限转录

使用体验

  • 界面简洁
  • 持续更新
  • 不断改进

存储要求

Voxtral Small 在全精度下是服务器级模型:官方模型卡标注约 55 GB GPU 显存。Voxtral Mini 虽然专为本地和边缘场景设计,模型卡仍写着 bf16/fp16 下约 9.5 GB GPU 显存。而 Whisper Turbo 在应用内的下载体积大约 1.6 GB——对当前的 Whisper Notes 产品来说,这才是合适的量级。

Whisper Notes 使用 Whisper Large-v3 Turbo——它在性能、速度和显存需求之间找到了日常使用的平衡点。一旦有更好的模型能以合理的资源开销运行,我们就会升级。

如果你在意音频问答、摘要或自托管服务器部署,Voxtral 很有吸引力。Whisper Notes 面向的是想要私密转录、拒绝订阅制的个人用户。

这意味着什么

Voxtral 是开放权重模型在纯语音识别之外迈出的重要一步——它不仅能转录音频,还能对音频进行推理。

但对于 Mac 和 iPhone 上的私密离线转录,更小的专用引擎依然更容易打包、运行也更稳定。

想对比所有本地方案?我们的 Whisper 模型对比页把每一个设备端语音转文字模型——Whisper 各变体、Parakeet V3、SenseVoice 和 Voxtral——放在一起逐项对比。

常见问题

Mistral Voxtral 是什么?

Voxtral 是 Mistral 的开放权重语音转录与音频理解模型家族。2025 年 7 月的发布包含面向服务器级负载的 Voxtral Small 24B 和面向本地与边缘部署的 Voxtral Mini 3B,两个检查点均采用 Apache 2.0 许可。

Voxtral 能在 Mac 上本地运行吗?

权重可以下载自托管,但两个尺寸的要求差别很大。Voxtral Small 在 bf16/fp16 下约需 55 GB GPU 显存,属于服务器级选择。Voxtral Mini 是本地和边缘检查点,模型卡标注 bf16/fp16 下约 9.5 GB;在 Mac 上的实际速度和内存占用取决于运行时和量化方案。

Whisper Notes 用 Voxtral 吗?

不用。Whisper Notes 运行 Parakeet V3(Mac 默认)、Whisper Large-v3 Turbo 和 SenseVoice——选择它们是因为在 Apple Silicon 上,它们在性能、速度和显存需求之间的平衡最适合日常使用。一旦有更好的模型能在消费级硬件上实用运行,我们就会采用。

Voxtral 支持多少种语言?

官方模型卡列出八种主要语言,支持自动检测:英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语。Mistral 在 FLEURS 中也评测了阿拉伯语,但它不在模型卡的主要语言列表里。

Mistral Voxtral 是什么时候发布的?

Mistral 于 2025 年 7 月 15 日发布 Voxtral,首批 Apache 2.0 检查点是 Voxtral Small 24B 和 Voxtral Mini 3B。