跳过主要内容
对比

10秒出稿,还是边说边认人:MAI-Transcribe-2 vs Muse Voice Transcribe(2026)

微软 MAI-Transcribe-2 一小时录音大约 10 秒出稿;Meta Muse Voice Transcribe 边说边认出 20 个人。2026 年两套转写场景怎么选。

微软在 2026 年 9 月 3 日发布了 MAI-Transcribe-2。Meta Superintelligence Labs 两天前刚发布 Muse Voice Transcribe。这两个名字,再加上常见错搜 mal-transcribe-2,落在同一新闻周期里。真正有用的问题不是笼统问谁更好,而是你要把模型雇来干什么。

核心取舍是批处理还是实时。MAI-Transcribe-2 是面向文件、字幕和归档的高吞吐语音转文字模型。Muse Voice Transcribe 是流式音频感知模型:人还在说,它就开始出字,标出说话人,并判断一句话何时结束。本文是资料对比,依据厂商文档和第三方榜单,不是我们用私有音频做的对打测试。Muse Voice Transcribe 编辑部撰写,2026 年 9 月 4 日。

先看结论

  • 批处理选 MAI-Transcribe-2:60 种语言、限时 $0.10/音频小时、Artificial Analysis 非流式 AA-WER 2.0%。
  • 实时选 Muse Voice Transcribe:流式最终稿 WER 3.1%、说完后 0.16 秒出稿、原生支持 20+ 说话人分离和 endpointing。
  • 不要把 2.0% 和 3.1% 当成同一张榜。批处理和流式是两套测试。
  • 如果只想在浏览器里实时转写、先不接 Azure 或 Meta API,直接用 Muse Voice Transcribe 工作台。

快速对比表

维度MAI-Transcribe-2Muse Voice Transcribe
最适合批量文件、字幕、归档实时会议、听写、语音 Agent
厂商Microsoft AIMeta Superintelligence Labs
发布时间2026-09-032026-09-01
API 价格$0.10/小时(限时至 2026 年底)$0.18/小时($3 / 1,000 分钟)
AA-WER(批处理)2.0%(第 2)不是该模型的主榜
AA-WER Streaming不是发布主打数据3.1% @ 0.16s(截至 2026-09-01 第 1)
速度1 小时音频约 10 秒转完;AA 测得 410.7x80ms 音频块;按词自适应延迟
语言60 种,默认自动语种识别训练 70+ 种,上线时 25 种经过充分验证
说话人分离有,走 Fast Transcription API一次流式推理覆盖 20+ 说话人
词级时间戳流式轮次输出
转写风格干净稿 / 逐字稿不是主打开关
怎么用Azure Speech(公开预览)、Foundry、OpenRouterMeta Model API、Mac 版 Meta AI、Muse Code
我们的判断批处理成本和多语言文件胜出实时、带说话人的 ASR 胜出

哪个更准?

先看你打开的是哪张榜。 MAI-Transcribe-2 打的是微软要卖的批处理精度。Muse Voice Transcribe 打的是 Meta 要卖的流式精度。把这两个数字排成一张总榜,是分类错误。

微软称 MAI-Transcribe-2 在 FLEURS 上对命名竞品取得最低字错率。2026 年 9 月 3 日新闻稿给出 60 语平均 5.2%。模型页给出 Top 25 语 3.4%。独立的 Artificial Analysis 非流式榜(检索于 2026-09-04)上,它的 AA-WER 为 2.0%,仅次于 Fun-Realtime-ASR-preview 的 1.7%,优于 ElevenLabs Scribe v2 的 2.2% 和 Gemini 3.5 Transcribe 的 2.6%。

Meta 称 Muse Voice Transcribe 截至 2026 年 9 月 1 日在 Artificial Analysis 流式语音转文字榜上排第一。这些流式数字来自 Meta 发布图以及媒体转述,本文没有去刮一张实时的 AA 流式页面。MarkTechPostVentureBeat 转述的数字是:最终稿 WER 3.1%,说完后 0.16 秒出稿。Cartesia Ink-2(语义 endpoint)是 3.4% / 0.43s。ElevenLabs Scribe v2 Realtime 是 3.6% / 0.14s。

Streaming final-transcript WER (lower is better) Streaming final-transcript WER. Muse Voice Transcribe 3.1%; Cartesia Ink-2 semantic 3.4%; Scribe v2 Realtime 3.6%; GPT Live / Grok stream 3.9%; Gemini 3.5 Live 4%. Source: Artificial Analysis AA-WER Streaming via Meta and VentureBeat, 2026-09-01. Streaming final-transcript WER (lower is better) Muse VoiceTranscribe 3.1 Cartesia Ink-2semantic 3.4 Scribe v2Realtime 3.6 GPT Live / Grokstream 3.9 Gemini 3.5 Live 4 Source: Artificial Analysis AA-WER Streaming via Meta and VentureBeat (2026-09-01)
Source: Artificial Analysis AA-WER Streaming figures reported by Meta and VentureBeat, 2026-09-01.

这两个百分比不能互换。AA-WER v2 大约平均了 8 小时偏英语的音频(AgentTalk、VoxPopuli、Earnings22)。AA-WER Streaming 测的是直播定稿。2.0% 的批处理模型在会议里仍可能显得慢;3.1% 的流式模型做长字幕仍可能输在价格上。

一句话:批处理精度看 MAI-Transcribe-2。流式精度看 Muse Voice Transcribe。按你要做的产品选榜。

哪个更快:批量吞吐还是实时延迟?

音频已经是文件,MAI-Transcribe-2 更快。人还在说话,Muse Voice Transcribe 更快。

微软发布稿称该模型比 OpenAI GPT-Transcribe 快 10 倍、比 ElevenLabs Scribe v2 快 7 倍、比 Gemini 3.5 Transcribe 快 5 倍,1 小时音频大约 10 秒转完。Artificial Analysis 给出 MAI-Transcribe-2 的中位速度因子是 410.7x,GPT Transcribe 40.0x,Scribe v2 53.8x,Gemini 3.5 Transcribe 89.7x。独立测量和微软口径形状一致。

Batch speed factor (higher is faster) Batch speed factor. MAI-Transcribe-2 410.7x; MAI-Transcribe-1.5 190.3x; Gemini 3.5 Transcribe 89.7x; Scribe v2 53.8x; GPT Transcribe 40x. Source: Artificial Analysis non-streaming leaderboard, 2026-09. Batch speed factor (higher is faster) MAI-Transcribe-2 410.7 MAI-Transcribe-1.5 190.3 Gemini 3.5Transcribe 89.7 Scribe v2 53.8 GPT Transcribe 40 Source: Artificial Analysis non-streaming leaderboard (2026-09)
Source: Artificial Analysis non-streaming speed factor, retrieved 2026-09-04.

Muse Voice Transcribe 并不追求把成品文件按 410 倍速啃完。它按 80ms 切音频,用强化学习在难词上多听一会儿、在容易的词上更快提交。Meta 称之为 adaptive delay。流式榜上真正重要的是 最终稿 3.1% WER / 0.16s,以及 首个 partial 3.6% WER / 0.13s。Azure 也把 MAI-Transcribe 接到了 Voice Live,微软并不是完全不做流式。v2 发布叙事仍然是批处理效率。

工作室桌面上的长音频时间轴被转成带时间戳的稿件,示意批量语音转写。

结论:已录好的音频看 MAI-Transcribe-2。人还在说、要马上出字,看 Muse Voice Transcribe。

谁更会分说话人?

实时说话人标签,Muse Voice Transcribe 胜出。只需要录完再分离,MAI-Transcribe-2 就够。

说话人分离是 MAI-Transcribe-2 这一代才加上的。1.5 没有这项。Azure MAI-Transcribe 文档 允许在 Fast Transcription 上把 diarization.enabled 设为 true。这适合呼叫中心归档、字幕、以及就诊后再处理的临床笔记。

Meta 把说话人分离、ASR 和 endpointing 做进同一个流式模型,不需要额外后处理。研究博客演示了 8 人实时对话,产品口径是 1 小时以上音频、20+ 说话人。VentureBeat 转述 Meta 图上的平均 说话人分离错误率 17.5%(AMI-IHM、AMI-SDM、VoxConverse)。Meta Model API 在 push-to-talk 之外提供 DIARIZATIONENDPOINTING 模式,这正是语音 Agent 要的:知道谁在说,以及什么时候说完。

会议室里四个人开会,墙上显示带说话人标签的实时字幕。

如果你要在对话还在进行时做会议转写说话人分离,流式标签才是产品。如果只是一份已经结束的 Zoom 导出,用 MAI-Transcribe-2 在 Azure 上做分离就够,也更便宜。

结论:多人实时房间选 Muse Voice Transcribe。文件级说话人归属选 MAI-Transcribe-2。

谁覆盖的语言更多?

按语言数量,MAI-Transcribe-2 胜出。按 Meta 实际演示的双语口语,Muse Voice Transcribe 更贴近。

Azure 为 MAI-Transcribe-2 列出 60 个 locale,比 1.5 的 43 个更多,包含中文(zh)和粤语(yue)。默认是自动语种识别。微软还提到 Hinglish、Spanglish 这类语码转换,以及专名、术语的 keyword biasing,外加 干净稿 / 逐字稿 开关。

Muse Voice Transcribe 训练覆盖 70+ 种语言,上线时 25 种经过充分验证。Meta 自己的演示大量使用普通话、英语和句中中英夹杂,再加上 keyword / context biasing。这比一张 60 行语言表更接近双语团队的真实说话方式。生产承诺也更窄:Meta 建议开发者先从 25 种验证语言开始。

咖啡馆里两人交谈,附近出现中英夹杂字幕,示意语码转换转写。

多语言转写时,实用规则是:必须用一个批处理模型覆盖很多 locale,选 MAI-Transcribe-2。难点是实时会话里的中英夹杂,且语言在验证集合内,选 Muse Voice Transcribe。

结论:覆盖面看 MAI-Transcribe-2。验证语言里的实时语码转换看 Muse Voice Transcribe。

实际怎么调用?

MAI-Transcribe-2 是 Azure Speech Fast Transcription 上的公开预览模型。Muse Voice Transcribe 是 Meta 托管的流式 API,外加 Mac 听写。

调用 MAI-Transcribe-2 时,在 Azure Speech(API 版本 2025-10-15)把 enhancedMode.enabled 设为 true,把 enhancedMode.model 设为 MAI-Transcribe-2。音频须为 WAV / MP3 / FLAC,小于 300 MB。词级时间戳、短语列表、locale 和转写风格是额外字段。OpenRouter 也列出 microsoft/mai-transcribe-2,经 Azure 报价 $0.10/小时。Microsoft Learn 仍将该能力标为 公开预览,没有 SLA,并写明不建议用于生产负载。

Muse Voice Transcribe 在 Meta Model API 上的模型名是 muse-voice-transcribe-1.0。实时音频走 wss://api.meta.ai/v1/asr/realtime。已有文件走 POST https://api.meta.ai/v1/asr/transcribe。权重没有开源。在 Mac 上,按住 Fn 听写已经接到 Meta AI for Mac 和 Muse Code。微软这次没有对等的一键听写入口。

如果只要可读笔记、不想接 API,可以跳过两边控制台,直接用浏览器实时转写。这条路径用来把正在发生的对话记下来,不是用来对表里每一项模型分数。

结论:处理文件走 Azure 或 OpenRouter 上的 MAI-Transcribe-2。实时和 Mac 听写走 Muse Voice Transcribe。微软的预览状态是真实约束。

各自多少钱?

按一小时音频算,MAI-Transcribe-2 是 $0.10,Muse Voice Transcribe 是 $0.18。 微软说 $0.10 是限时优惠,到 2026 年底。MAI-Transcribe-1.5 仍标 $0.36/小时。Artificial Analysis 把 MAI-Transcribe-2 归一成 $1.67 / 1,000 分钟,也就是每小时 $0.10。Meta 公开价是 $3.00 / 1,000 分钟

API price per 1,000 audio minutes (2026) API price per 1,000 audio minutes. MAI-Transcribe-2 1.67 USD; Muse Voice Transcribe 3; Cartesia Ink-2 4; Scribe v2 Realtime 6.5. Source: Artificial Analysis and vendor list prices, 2026-09. API price per 1,000 audio minutes (2026) MAI-Transcribe-2 1.67 Muse VoiceTranscribe 3 Cartesia Ink-2 4 Scribe v2Realtime 6.5 Source: Artificial Analysis and vendor list prices (2026-09)
MAI-Transcribe-2 的 $1.67 / 1,000 分钟来自 Artificial Analysis(即 $0.10/小时)。Muse 的 $3 来自 Meta。Cartesia $4 与 Scribe v2 Realtime $6.50 来自 MarkTechPost,2026-09。

隐性成本不一样。Azure 需要 Foundry Speech 资源、预览条款和区域选择。Meta 是纯托管 API,不能自建。流式还会按你实际处理的音频计费,endpointing 没切掉的静音也算。批处理更容易估成本,因为文件时长已知。

浏览器工具的定价买的是产品工作流,不是原始模型分钟。只有自己搭流水线时,才拿 API 分钟价对比。

按文件分钟价,MAI-Transcribe-2 更便宜。在流式 API 里,Muse Voice Transcribe 仍然便宜,而且这一分钟里包含说话人分离和 endpointing。

谁该选哪个?

音频已经是文件,选 MAI-Transcribe-2。对话正在发生,选 Muse Voice Transcribe

字幕和归档团队。 选 MAI-Transcribe-2。词级时间戳、干净/逐字风格、60 语覆盖、$0.10/小时,就是批处理栈。

语音 Agent 和听写团队。 选 Muse Voice Transcribe。Endpointing、自适应延迟和 WebSocket API 才是实时栈。只需要听写的 Mac 用户可以留在 Meta AI for Mac。

采访和会议记录。 先在浏览器里试采访转写会议转写。人还在说就能看到可读草稿,再导出 TXT。以后若要把录音做成更便宜的归档,再走 Azure。

两边都不合适。 你需要端侧或开放权重。Meta 没有放出 Muse 权重。MAI-Transcribe-2 跑在 Azure 上。只有锁死或隔离网才值得去看开源 ASR。

在浏览器里开始实时转写。如果目标是把正在发生的对话变成笔记,不必先搭 Azure Speech 或 Meta Model API。

常见问题

MAI-Transcribe-2 是否比 Muse Voice Transcribe 更好?

不是全面更好。价格、多语言覆盖和非流式 AA-WER 上,MAI-Transcribe-2 是更强的批处理模型。流式 WER、说话人数量和 endpointing 上,Muse Voice Transcribe 是更强的实时模型。按批处理还是实时来选。

mal-transcribe-2 是不是就是 MAI-Transcribe-2?

是。Mal-transcribe-2 是听到 “MAI” 后的常见拼写。产品名是微软的 MAI-Transcribe-2。截至 2026 年 9 月 4 日,Azure 和 OpenRouter 目录里没有单独的 Mal Transcribe 模型。

一个产品里能两个都用吗?

能。常见做法是用 Muse Voice Transcribe(或其他流式 ASR)出实时草稿,再用 MAI-Transcribe-2 处理保存下来的文件,做成更便宜、带时间戳的归档。这要两次 API 调用,但避免逼一个模型两头都做不好。

能自己部署吗?

两次发布都没有公开权重。Muse Voice Transcribe 只能走 API。MAI-Transcribe-2 跑在 Azure Speech、Microsoft Foundry、MAI Playground 和 OpenRouter 上。

2026 年 9 月,MAI-Transcribe-2 能上生产吗?

按预览来对待。Microsoft Learn 写明 Fast Transcription 的 enhanced mode 是公开预览,没有 SLA。Muse Voice Transcribe 已经在为 Mac 听写和公开开发者 API 供电。如果你要写对客 SLA,预览状态的权重不应低于 WER。

结论

维度胜出
批处理精度(AA-WER)MAI-Transcribe-2
流式精度Muse Voice Transcribe
文件吞吐MAI-Transcribe-2
实时延迟和 endpointingMuse Voice Transcribe
语言覆盖面MAI-Transcribe-2
实时多说话人标签Muse Voice Transcribe
每小时 API 价格MAI-Transcribe-2
总体文件选 MAI-Transcribe-2。实时语音选 Muse Voice Transcribe。

有现成录音,选 MAI-Transcribe-2。需要在人还在说话时拿到文字、说话人和轮次边界,选 Muse Voice Transcribe。不想先接 API,可以打开预置演示,或直接开始实时转写。相关页面:说话人分离多语言转写