10秒出稿,还是边说边认人:MAI-Transcribe-2 vs Muse Voice Transcribe(2026)
微软 MAI-Transcribe-2 一小时录音大约 10 秒出稿;Meta Muse Voice Transcribe 边说边认出 20 个人。2026 年两套转写场景怎么选。
微软在 2026 年 9 月 3 日发布了 MAI-Transcribe-2。Meta Superintelligence Labs 两天前刚发布 Muse Voice Transcribe。这两个名字,再加上常见错搜 mal-transcribe-2,落在同一新闻周期里。真正有用的问题不是笼统问谁更好,而是你要把模型雇来干什么。
核心取舍是批处理还是实时。MAI-Transcribe-2 是面向文件、字幕和归档的高吞吐语音转文字模型。Muse Voice Transcribe 是流式音频感知模型:人还在说,它就开始出字,标出说话人,并判断一句话何时结束。本文是资料对比,依据厂商文档和第三方榜单,不是我们用私有音频做的对打测试。Muse Voice Transcribe 编辑部撰写,2026 年 9 月 4 日。
先看结论
- 批处理选 MAI-Transcribe-2:60 种语言、限时 $0.10/音频小时、Artificial Analysis 非流式 AA-WER 2.0%。
- 实时选 Muse Voice Transcribe:流式最终稿 WER 3.1%、说完后 0.16 秒出稿、原生支持 20+ 说话人分离和 endpointing。
- 不要把 2.0% 和 3.1% 当成同一张榜。批处理和流式是两套测试。
- 如果只想在浏览器里实时转写、先不接 Azure 或 Meta API,直接用 Muse Voice Transcribe 工作台。
快速对比表
| 维度 | MAI-Transcribe-2 | Muse Voice Transcribe |
|---|---|---|
| 最适合 | 批量文件、字幕、归档 | 实时会议、听写、语音 Agent |
| 厂商 | Microsoft AI | Meta Superintelligence Labs |
| 发布时间 | 2026-09-03 | 2026-09-01 |
| API 价格 | $0.10/小时(限时至 2026 年底) | $0.18/小时($3 / 1,000 分钟) |
| AA-WER(批处理) | 2.0%(第 2) | 不是该模型的主榜 |
| AA-WER Streaming | 不是发布主打数据 | 3.1% @ 0.16s(截至 2026-09-01 第 1) |
| 速度 | 1 小时音频约 10 秒转完;AA 测得 410.7x | 80ms 音频块;按词自适应延迟 |
| 语言 | 60 种,默认自动语种识别 | 训练 70+ 种,上线时 25 种经过充分验证 |
| 说话人分离 | 有,走 Fast Transcription API | 一次流式推理覆盖 20+ 说话人 |
| 词级时间戳 | 有 | 流式轮次输出 |
| 转写风格 | 干净稿 / 逐字稿 | 不是主打开关 |
| 怎么用 | Azure Speech(公开预览)、Foundry、OpenRouter | Meta Model API、Mac 版 Meta AI、Muse Code |
| 我们的判断 | 批处理成本和多语言文件胜出 | 实时、带说话人的 ASR 胜出 |
哪个更准?
先看你打开的是哪张榜。 MAI-Transcribe-2 打的是微软要卖的批处理精度。Muse Voice Transcribe 打的是 Meta 要卖的流式精度。把这两个数字排成一张总榜,是分类错误。
微软称 MAI-Transcribe-2 在 FLEURS 上对命名竞品取得最低字错率。2026 年 9 月 3 日新闻稿给出 60 语平均 5.2%。模型页给出 Top 25 语 3.4%。独立的 Artificial Analysis 非流式榜(检索于 2026-09-04)上,它的 AA-WER 为 2.0%,仅次于 Fun-Realtime-ASR-preview 的 1.7%,优于 ElevenLabs Scribe v2 的 2.2% 和 Gemini 3.5 Transcribe 的 2.6%。
Meta 称 Muse Voice Transcribe 截至 2026 年 9 月 1 日在 Artificial Analysis 流式语音转文字榜上排第一。这些流式数字来自 Meta 发布图以及媒体转述,本文没有去刮一张实时的 AA 流式页面。MarkTechPost 和 VentureBeat 转述的数字是:最终稿 WER 3.1%,说完后 0.16 秒出稿。Cartesia Ink-2(语义 endpoint)是 3.4% / 0.43s。ElevenLabs Scribe v2 Realtime 是 3.6% / 0.14s。
这两个百分比不能互换。AA-WER v2 大约平均了 8 小时偏英语的音频(AgentTalk、VoxPopuli、Earnings22)。AA-WER Streaming 测的是直播定稿。2.0% 的批处理模型在会议里仍可能显得慢;3.1% 的流式模型做长字幕仍可能输在价格上。
一句话:批处理精度看 MAI-Transcribe-2。流式精度看 Muse Voice Transcribe。按你要做的产品选榜。
哪个更快:批量吞吐还是实时延迟?
音频已经是文件,MAI-Transcribe-2 更快。人还在说话,Muse Voice Transcribe 更快。
微软发布稿称该模型比 OpenAI GPT-Transcribe 快 10 倍、比 ElevenLabs Scribe v2 快 7 倍、比 Gemini 3.5 Transcribe 快 5 倍,1 小时音频大约 10 秒转完。Artificial Analysis 给出 MAI-Transcribe-2 的中位速度因子是 410.7x,GPT Transcribe 40.0x,Scribe v2 53.8x,Gemini 3.5 Transcribe 89.7x。独立测量和微软口径形状一致。
Muse Voice Transcribe 并不追求把成品文件按 410 倍速啃完。它按 80ms 切音频,用强化学习在难词上多听一会儿、在容易的词上更快提交。Meta 称之为 adaptive delay。流式榜上真正重要的是 最终稿 3.1% WER / 0.16s,以及 首个 partial 3.6% WER / 0.13s。Azure 也把 MAI-Transcribe 接到了 Voice Live,微软并不是完全不做流式。v2 发布叙事仍然是批处理效率。

结论:已录好的音频看 MAI-Transcribe-2。人还在说、要马上出字,看 Muse Voice Transcribe。
谁更会分说话人?
实时说话人标签,Muse Voice Transcribe 胜出。只需要录完再分离,MAI-Transcribe-2 就够。
说话人分离是 MAI-Transcribe-2 这一代才加上的。1.5 没有这项。Azure MAI-Transcribe 文档 允许在 Fast Transcription 上把 diarization.enabled 设为 true。这适合呼叫中心归档、字幕、以及就诊后再处理的临床笔记。
Meta 把说话人分离、ASR 和 endpointing 做进同一个流式模型,不需要额外后处理。研究博客演示了 8 人实时对话,产品口径是 1 小时以上音频、20+ 说话人。VentureBeat 转述 Meta 图上的平均 说话人分离错误率 17.5%(AMI-IHM、AMI-SDM、VoxConverse)。Meta Model API 在 push-to-talk 之外提供 DIARIZATION 和 ENDPOINTING 模式,这正是语音 Agent 要的:知道谁在说,以及什么时候说完。

如果你要在对话还在进行时做会议转写或说话人分离,流式标签才是产品。如果只是一份已经结束的 Zoom 导出,用 MAI-Transcribe-2 在 Azure 上做分离就够,也更便宜。
结论:多人实时房间选 Muse Voice Transcribe。文件级说话人归属选 MAI-Transcribe-2。
谁覆盖的语言更多?
按语言数量,MAI-Transcribe-2 胜出。按 Meta 实际演示的双语口语,Muse Voice Transcribe 更贴近。
Azure 为 MAI-Transcribe-2 列出 60 个 locale,比 1.5 的 43 个更多,包含中文(zh)和粤语(yue)。默认是自动语种识别。微软还提到 Hinglish、Spanglish 这类语码转换,以及专名、术语的 keyword biasing,外加 干净稿 / 逐字稿 开关。
Muse Voice Transcribe 训练覆盖 70+ 种语言,上线时 25 种经过充分验证。Meta 自己的演示大量使用普通话、英语和句中中英夹杂,再加上 keyword / context biasing。这比一张 60 行语言表更接近双语团队的真实说话方式。生产承诺也更窄:Meta 建议开发者先从 25 种验证语言开始。

做多语言转写时,实用规则是:必须用一个批处理模型覆盖很多 locale,选 MAI-Transcribe-2。难点是实时会话里的中英夹杂,且语言在验证集合内,选 Muse Voice Transcribe。
结论:覆盖面看 MAI-Transcribe-2。验证语言里的实时语码转换看 Muse Voice Transcribe。
实际怎么调用?
MAI-Transcribe-2 是 Azure Speech Fast Transcription 上的公开预览模型。Muse Voice Transcribe 是 Meta 托管的流式 API,外加 Mac 听写。
调用 MAI-Transcribe-2 时,在 Azure Speech(API 版本 2025-10-15)把 enhancedMode.enabled 设为 true,把 enhancedMode.model 设为 MAI-Transcribe-2。音频须为 WAV / MP3 / FLAC,小于 300 MB。词级时间戳、短语列表、locale 和转写风格是额外字段。OpenRouter 也列出 microsoft/mai-transcribe-2,经 Azure 报价 $0.10/小时。Microsoft Learn 仍将该能力标为 公开预览,没有 SLA,并写明不建议用于生产负载。
Muse Voice Transcribe 在 Meta Model API 上的模型名是 muse-voice-transcribe-1.0。实时音频走 wss://api.meta.ai/v1/asr/realtime。已有文件走 POST https://api.meta.ai/v1/asr/transcribe。权重没有开源。在 Mac 上,按住 Fn 听写已经接到 Meta AI for Mac 和 Muse Code。微软这次没有对等的一键听写入口。
如果只要可读笔记、不想接 API,可以跳过两边控制台,直接用浏览器实时转写。这条路径用来把正在发生的对话记下来,不是用来对表里每一项模型分数。
结论:处理文件走 Azure 或 OpenRouter 上的 MAI-Transcribe-2。实时和 Mac 听写走 Muse Voice Transcribe。微软的预览状态是真实约束。
各自多少钱?
按一小时音频算,MAI-Transcribe-2 是 $0.10,Muse Voice Transcribe 是 $0.18。 微软说 $0.10 是限时优惠,到 2026 年底。MAI-Transcribe-1.5 仍标 $0.36/小时。Artificial Analysis 把 MAI-Transcribe-2 归一成 $1.67 / 1,000 分钟,也就是每小时 $0.10。Meta 公开价是 $3.00 / 1,000 分钟。
隐性成本不一样。Azure 需要 Foundry Speech 资源、预览条款和区域选择。Meta 是纯托管 API,不能自建。流式还会按你实际处理的音频计费,endpointing 没切掉的静音也算。批处理更容易估成本,因为文件时长已知。
浏览器工具的定价买的是产品工作流,不是原始模型分钟。只有自己搭流水线时,才拿 API 分钟价对比。
按文件分钟价,MAI-Transcribe-2 更便宜。在流式 API 里,Muse Voice Transcribe 仍然便宜,而且这一分钟里包含说话人分离和 endpointing。
谁该选哪个?
音频已经是文件,选 MAI-Transcribe-2。对话正在发生,选 Muse Voice Transcribe。
字幕和归档团队。 选 MAI-Transcribe-2。词级时间戳、干净/逐字风格、60 语覆盖、$0.10/小时,就是批处理栈。
语音 Agent 和听写团队。 选 Muse Voice Transcribe。Endpointing、自适应延迟和 WebSocket API 才是实时栈。只需要听写的 Mac 用户可以留在 Meta AI for Mac。
采访和会议记录。 先在浏览器里试采访转写或会议转写。人还在说就能看到可读草稿,再导出 TXT。以后若要把录音做成更便宜的归档,再走 Azure。
两边都不合适。 你需要端侧或开放权重。Meta 没有放出 Muse 权重。MAI-Transcribe-2 跑在 Azure 上。只有锁死或隔离网才值得去看开源 ASR。
在浏览器里开始实时转写。如果目标是把正在发生的对话变成笔记,不必先搭 Azure Speech 或 Meta Model API。
常见问题
MAI-Transcribe-2 是否比 Muse Voice Transcribe 更好?
不是全面更好。价格、多语言覆盖和非流式 AA-WER 上,MAI-Transcribe-2 是更强的批处理模型。流式 WER、说话人数量和 endpointing 上,Muse Voice Transcribe 是更强的实时模型。按批处理还是实时来选。
mal-transcribe-2 是不是就是 MAI-Transcribe-2?
是。Mal-transcribe-2 是听到 “MAI” 后的常见拼写。产品名是微软的 MAI-Transcribe-2。截至 2026 年 9 月 4 日,Azure 和 OpenRouter 目录里没有单独的 Mal Transcribe 模型。
一个产品里能两个都用吗?
能。常见做法是用 Muse Voice Transcribe(或其他流式 ASR)出实时草稿,再用 MAI-Transcribe-2 处理保存下来的文件,做成更便宜、带时间戳的归档。这要两次 API 调用,但避免逼一个模型两头都做不好。
能自己部署吗?
两次发布都没有公开权重。Muse Voice Transcribe 只能走 API。MAI-Transcribe-2 跑在 Azure Speech、Microsoft Foundry、MAI Playground 和 OpenRouter 上。
2026 年 9 月,MAI-Transcribe-2 能上生产吗?
按预览来对待。Microsoft Learn 写明 Fast Transcription 的 enhanced mode 是公开预览,没有 SLA。Muse Voice Transcribe 已经在为 Mac 听写和公开开发者 API 供电。如果你要写对客 SLA,预览状态的权重不应低于 WER。
结论
| 维度 | 胜出 |
|---|---|
| 批处理精度(AA-WER) | MAI-Transcribe-2 |
| 流式精度 | Muse Voice Transcribe |
| 文件吞吐 | MAI-Transcribe-2 |
| 实时延迟和 endpointing | Muse Voice Transcribe |
| 语言覆盖面 | MAI-Transcribe-2 |
| 实时多说话人标签 | Muse Voice Transcribe |
| 每小时 API 价格 | MAI-Transcribe-2 |
| 总体 | 文件选 MAI-Transcribe-2。实时语音选 Muse Voice Transcribe。 |
有现成录音,选 MAI-Transcribe-2。需要在人还在说话时拿到文字、说话人和轮次边界,选 Muse Voice Transcribe。不想先接 API,可以打开预置演示,或直接开始实时转写。相关页面:说话人分离、多语言转写。