Mistral 发布了 Voxtral——他们首个开放权重的转录与音频理解模型家族。官方基准显示它在多语言语音识别和音频问答上表现不俗,但两个尺寸的硬件要求差别很大。这篇文章梳理这次发布实际支持什么,以及为什么 Whisper Notes 在消费级 Apple 硬件上仍然选择更小、专注转录的模型。
两个模型
Mistral 在 2025 年 7 月发布了两个 Apache 2.0 许可的检查点:
Voxtral Small 24B
- •240 亿参数
- •转录、翻译、音频问答与摘要
- •32k 上下文窗口
- •bf16/fp16 下约需 55 GB GPU 显存
Voxtral Mini 3B
- •30 亿参数
- •同一套音频+文本任务能力,装进更小的检查点
- •官方定位为本地与边缘部署
- •bf16/fp16 下约需 9.5 GB GPU 显存
开放权重与许可证
2025 年发布的两个检查点都是 Apache 2.0 许可的开放权重,可以自行下载运行:
- ✓ 完整模型权重开放下载
- ✓ 在 Apache 2.0 许可范围内自托管或改造
- ✓ 自托管不产生 Mistral API 费用,但算力成本仍需自己承担
- ✓ 音频可完全在自己的服务器上处理
资料来源:Mistral 官方 Voxtral 发布公告、官方 Voxtral Small 模型卡 与官方 Voxtral Mini 模型卡。
基准测试
Mistral 的发布材料对比了英语短音频、长音频、Mozilla Common Voice、FLEURS 和 Multilingual LibriSpeech 上的宏平均词错误率。在 Mistral 报告的 FLEURS 结果中,Voxtral Small 在所有评测任务上都胜过 Whisper。WER 越低越好:
横轴为估算 API 价格,纵轴为 Mistral 发布基准中的 FLEURS WER;基准结果和价格都可能变化
FLEURS 只反映转录质量的一个切面,且这些都是厂商自报的结果。选型前请对照公开的基准定义,用你自己的语言、麦克风和录音环境实测。
Voxtral vs Whisper:该用哪个?
基准分数只是故事的一部分。如果你真打算自己跑一个模型,这几个维度才是关键:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| 语言支持 | 8 种主要语言 | 8 种主要语言 | 100+ 种 | 100+ 种 |
| 开源 | 是 | 是 | 是 | 是 |
| 模型体积 | 24B 参数;bf16/fp16 约 55 GB GPU 显存 | 3B 参数;bf16/fp16 约 9.5 GB GPU 显存 | 15.5 亿参数 | 8.09 亿参数(约 1.6 GB) |
| 消费级 Mac 上是否实用 | 全精度下常规硬件跑不动 | 配合兼容的运行时可行,但比 Turbo 重 | 可以 | 可以 |
结论:Voxtral Small 的 WER 成绩确实亮眼,还带上了 Whisper 不涉及的音频理解能力。Voxtral Mini 是 Mistral 定位给本地和边缘部署的检查点,但官方模型卡写明 bf16/fp16 下仍需约 9.5 GB GPU 显存。对一款面向消费者的转录应用来说,Whisper Large-v3 Turbo 更容易集成,语言覆盖也广得多。这就是 Whisper Notes 目前组合使用 Whisper Turbo、Parakeet V3 和 SenseVoice、而不是 Voxtral 的原因。
API 与自托管成本
截至 2026 年 7 月 10 日,Mistral 的模型卡标注 Voxtral Small 的音频输入价格为每分钟 $0.004。音频理解类请求的文本输入和生成文本另行计费。如果自托管 Apache 2.0 权重,则没有 Mistral API 费用,但硬件和运维成本由你承担。
Mistral API
自托管权重
工作原理
官方模型卡把 Voxtral 描述为"语言模型骨干 + 音频编码器 + 专用转录模式"的组合。产品层面的关键限制都写得很具体:
1. 多模态架构
Voxtral 能在同一段对话中接收音频和文本,而不仅仅是一个语音转文字解码器:
- •专用的直接转录模式
- •音频问答与结构化摘要
- •支持多段音频输入和多轮音频对话
长音频上限
32k 上下文窗口最长支持 30 分钟音频的转录,或 40 分钟音频的更广义理解任务。
2. 语言与评测
Mistral 列出了八种主要语言,支持自动检测:
- •英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语
- •基准测试涵盖 FLEURS、Mozilla Common Voice 和 Multilingual LibriSpeech
- •发布材料还分别评测了英语短音频和长音频
3. 部署要求
权重开放不等于每个检查点都小到任何设备都能跑:
- •据官方模型卡,Voxtral Small 在 bf16/fp16 下约需 55 GB GPU 显存
- •Voxtral Mini 是面向本地和边缘部署的 3B 检查点
- •Mistral 推荐用 vLLM 部署这些检查点
4. 核心特性
上下文理解
能直接基于音频回答问题、生成摘要,上限受 32k 上下文约束。
多语言
自动检测并转录八种主要语言:英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语。
噪音处理
官方评测覆盖了多样的语音数据集,但 Mistral 并未对所有嘈杂录音场景给出笼统保证。
边缘部署
Voxtral Mini 是本地和边缘部署的选项,官方模型卡标注 bf16/fp16 下约需 9.5 GB GPU 显存。
5. 架构
三个主要组件:
- 1. 音频编码器:把波形转换成学习到的音频表示
- 2. 投影层:把音频表示映射到语言模型的隐空间
- 3. 语言模型骨干:生成转录文本、答案、摘要或工具调用
这种设计解释了为什么 Voxtral 不止能转录——但也意味着它背着比 Whisper Turbo 这类纯转录模型大得多的语言模型权重。
为什么 Whisper Notes 依然是合理选择
Voxtral 和 Whisper Notes 解决的是不同问题。Voxtral 把转录和音频理解结合在一起;Whisper Notes 专注于在消费级 Apple 硬件上轻松运行的私密转录。
Whisper Notes 提供什么
隐私
- •100% 离线处理
- •零数据传输
- •不依赖云端
性能
- •Whisper 技术,准确率久经验证
- •针对 Apple Silicon 优化
- •结果稳定可靠
成本
- •Whisper Notes 采用一次性购买,不收订阅费。一次 App Store 购买包含 iPhone、iPad 与 Mac App Store 版;官网直下 DMG 版是单独销售的一次性许可。价格以各购买渠道显示为准。
- •不按分钟收费
- •无限转录
使用体验
- •界面简洁
- •持续更新
- •不断改进
存储要求
Voxtral Small 在全精度下是服务器级模型:官方模型卡标注约 55 GB GPU 显存。Voxtral Mini 虽然专为本地和边缘场景设计,模型卡仍写着 bf16/fp16 下约 9.5 GB GPU 显存。而 Whisper Turbo 在应用内的下载体积大约 1.6 GB——对当前的 Whisper Notes 产品来说,这才是合适的量级。
Whisper Notes 使用 Whisper Large-v3 Turbo——它在性能、速度和显存需求之间找到了日常使用的平衡点。一旦有更好的模型能以合理的资源开销运行,我们就会升级。
如果你在意音频问答、摘要或自托管服务器部署,Voxtral 很有吸引力。Whisper Notes 面向的是想要私密转录、拒绝订阅制的个人用户。
这意味着什么
Voxtral 是开放权重模型在纯语音识别之外迈出的重要一步——它不仅能转录音频,还能对音频进行推理。
但对于 Mac 和 iPhone 上的私密离线转录,更小的专用引擎依然更容易打包、运行也更稳定。
想对比所有本地方案?我们的 Whisper 模型对比页把每一个设备端语音转文字模型——Whisper 各变体、Parakeet V3、SenseVoice 和 Voxtral——放在一起逐项对比。
常见问题
Mistral Voxtral 是什么?
Voxtral 是 Mistral 的开放权重语音转录与音频理解模型家族。2025 年 7 月的发布包含面向服务器级负载的 Voxtral Small 24B 和面向本地与边缘部署的 Voxtral Mini 3B,两个检查点均采用 Apache 2.0 许可。
Voxtral 能在 Mac 上本地运行吗?
权重可以下载自托管,但两个尺寸的要求差别很大。Voxtral Small 在 bf16/fp16 下约需 55 GB GPU 显存,属于服务器级选择。Voxtral Mini 是本地和边缘检查点,模型卡标注 bf16/fp16 下约 9.5 GB;在 Mac 上的实际速度和内存占用取决于运行时和量化方案。
Whisper Notes 用 Voxtral 吗?
不用。Whisper Notes 运行 Parakeet V3(Mac 默认)、Whisper Large-v3 Turbo 和 SenseVoice——选择它们是因为在 Apple Silicon 上,它们在性能、速度和显存需求之间的平衡最适合日常使用。一旦有更好的模型能在消费级硬件上实用运行,我们就会采用。
Voxtral 支持多少种语言?
官方模型卡列出八种主要语言,支持自动检测:英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语。Mistral 在 FLEURS 中也评测了阿拉伯语,但它不在模型卡的主要语言列表里。
Mistral Voxtral 是什么时候发布的?
Mistral 于 2025 年 7 月 15 日发布 Voxtral,首批 Apache 2.0 检查点是 Voxtral Small 24B 和 Voxtral Mini 3B。