实时转写
在说话过程中跟随文字。
实时转写
选择后才会启动麦克风
你的文字会显示在这里
开始录音,或打开预置演示查看说话人轮次和中英混合文字。
继续在本页使用 Mal Transcribe 2,或打开相邻任务:实时笔记、说话人标签、会议、采访或混合语言会话。
Mal Transcribe 2 是 Microsoft 的 MAI-Transcribe-2 语音转文字模型,面向会议、采访、字幕和混合语言音频。
Muse Voice Transcribe 是语音与文本目录:你在这里使用 Mal Transcribe 2,不必另购 Microsoft、OpenAI 或 ElevenLabs 账号。先用上方工作台开始,再用对照表判断它何时优于 Whisper、ElevenLabs Scribe 或本站实时转写。
Mal Transcribe 2 是 Microsoft 的 MAI-Transcribe-2 语音转文字模型。在 Muse Voice Transcribe 上,它是目录工具:语音进、文字出,约 60 种语言、说话人分离、词级时间戳和关键词偏置。本页不需要另开 Azure、OpenAI 或 ElevenLabs 账号。
Muse Voice Transcribe 是独立的语音转文字服务商。Mal Transcribe 2 即通过本目录提供的 Microsoft MAI-Transcribe-2 模型。下列 WER、延迟、语言和厂商标价来自 Microsoft 材料,复核于 2026 年 9 月 4 日,不是本站实测。站点定价仍然适用。
最后更新:
Mal Transcribe 2 是 Microsoft 的 MAI-Transcribe-2 语音转文字模型,面向真实录音中的多语言转写:噪声、口音、语码转换和多人说话。在 Muse Voice Transcribe 上,它是目录里的一个工具,而不是单独的 Microsoft 控制台。
模型说明和基准表见 Microsoft AI 与 Azure Speech 文档。
有用的结果应该容易扫读:说话人标签、经过时间、混合语言轮次,以及 TXT 导出。打开工作台中的预置样例,或看下方布局。样例是 21 秒、四轮对话,包含 Speaker A、Speaker B 和一句中英混合内容。
| 说话人 | 时间 | 文字 |
|---|---|---|
| 说话人 A | 00:04 | 感谢参加。我们先从采访问题开始。 |
| 说话人 B | 00:09 | 当然,我已经准备好了。第一个主题是上线时间表。 |
| 说话人 A | 00:15 | 很好。我们交谈时,我会保持转写窗口打开。 |
| 说话人 B | 00:21 | 好的。分享前我们可以先复查最终文字。 |
该示例展示本页转写格式。需要在其他编辑器中使用时,复制或下载 TXT。
| 项目 | 值 |
|---|---|
| 模型 | Mal Transcribe 2(MAI-Transcribe-2) |
| 任务 | 在 Muse Voice Transcribe 上做语音转文字 |
| 语言 | 约 60 种,带自动语言识别 |
| 内置能力 | 说话人分离、词级时间戳、关键词偏置、clean 或 verbatim 风格 |
| 典型音频 | 会议、通话、采访、字幕、噪声音频 |
| 本页导出 | 复制或纯 TXT |
| 厂商账号 | 不需要:在本目录使用模型,不必分别购买每家供应商 |
| 公开 WER | FLEURS 前 25 种语言平均 3.4%;Artificial Analysis 2%(第 2)。Microsoft 数字,非本站实测 |
| 公开推理延迟 | 1 小时音频约 10 秒模型推理(Microsoft) |
| 公开厂商标价 | 每小时音频 $0.10,Microsoft 限时标价。本站仍按站点定价 |
模型事实来自 Microsoft、Whisper 与 ElevenLabs 公开材料,复核于 2026 年 9 月 4 日。WER、延迟和厂商标价为 Microsoft 公布值,不是本站实测。站点事实描述 Muse Voice Transcribe 目录。
按任务在 Mal Transcribe 2、Whisper、ElevenLabs Scribe 或 Muse Voice Transcribe 中选择,而不是按 Logo。Mal Transcribe 2 是本站提供的 Microsoft MAI-Transcribe-2 模型。Whisper 是开源权重基线。ElevenLabs Scribe 是该厂商语音产品旁的托管转写。Muse Voice Transcribe 是本站的实时录入工具。
| 需求 | Mal Transcribe 2 | Whisper | ElevenLabs Scribe | Muse Voice Transcribe |
|---|---|---|---|---|
| 最适合 | 多语言文件、噪声、说话人分离、领域术语 | 开源权重、自托管、自定义研究流水线 | 与 ElevenLabs 语音和 TTS 一起用的托管转写 | 人还在说话时的短实时笔记 |
| 如何使用 | 在本页以目录模型运行 Mal Transcribe 2 | 自托管或自行对接 API | ElevenLabs 产品,或你已购买 Scribe 时的该厂商 | 本站实时转写工作台 |
| 语言 | 约 60 种,带自动语言识别 | Whisper Large v3 覆盖面很广 | Scribe 材料中为 90+ 语言 | 五种实时识别语言选择 |
| 说话人标签 | 内置说话人分离 | 通常需要额外分离栈 | Scribe 包含 | 适合实时跟随;完整分离用本页 |
| 时间戳 | 词级时间戳 | 取决于实现,可能是片段或词级 | 词级时间戳 | 每行实时文字旁的经过时间 |
| 领域词汇 | 关键词偏置 | 热词因部署而异 | 关键词提示 | 导出后修正术语 |
| 速度形态 | 公开评测中的快速批次转写 | 取决于你的 GPU 和实现 | 批次 Scribe,另有实时 Scribe | 边说边出中间结果 |
| 是否另开厂商账单 | 在本站不需要 | 自托管或自行购买 OpenAI 时需要 | 自行购买 ElevenLabs 时需要 | 包含在本站 |
在本站选择 Mal Transcribe 2,是为了不必自建 Whisper 流水线,也不必切到只用 ElevenLabs 的栈。
Mal Transcribe 2 覆盖约 60 种语言并带自动语种检测,减少混合内容的设置成本。输入是语音,输出是可编辑的源语言文本。如需翻译,那是另一步。
分离结果和时间戳随转写一起返回。这是相对原版 Whisper 的优势,后者通常还要再接说话人流水线。只有音频能确认时,才把 Speaker A 换成真名。
模型面向噪声、距离和语码转换,这是它相对安静环境下实时初稿的优势。重叠说话、生僻名和数字仍需人工过一遍。
关键词偏置可约束产品、法律或临床词汇。Clean 适合去口头禅的字幕,verbatim 保留语气词。不必为此维护一套自定义 Whisper。
流程和其他站内工具一样:打开页面、录入语音、复查转写、导出文本。负责转换的模型是 Mal Transcribe 2。
打开本页顶部的 Mal Transcribe 2 工作台。使用本目录模型不需要 Azure、OpenAI 或 ElevenLabs 账号。模型可自动识别语言;只有在需要约束会话时才固定语种。
模型返回带说话人轮次和时间戳的文本。在转写区查看逐行结果。环境安静时可暂停,对话结束时完成。
检查专有名词、数量,以及打断处标签是否切错。只有音频支持时,才把 Speaker A 或 B 换成已确认姓名。
把初稿导入笔记、编辑器或字幕流程。需要纯实时、会议清单或采访布局时,使用本站相关工具。
当录音是事实来源、你需要可搜索、可做字幕或可引用的文字时,使用 Mal Transcribe 2。
主持人或客户负责人从口头讨论开始。运行 Mal Transcribe 2,保留说话人轮次和时间戳,再整理成笔记。预期结果是可搜索转写,不是自动生效的纪要。这对应带说话人分离的会议转写。
编辑拿到嘈杂、有时还跨语言的源音频。用 Mal Transcribe 2 的 clean 风格出字幕或节目笔记,再导出 TXT。预期结果是带词级时间的第一版字幕。这对应视频多语言语音转文字。
研究者记录问答,有时切换语言。把采访者与嘉宾轮次分开,再对照音频核实引用。预期结果是可分析的带标签轮次。这对应带说话人标签的采访转写。
Mal Transcribe 2 擅长多语言和噪声音频。姓名、数字和说话人身份在复核前仍是初稿。
重叠说话、极端噪声、生僻名和快速插话仍可能切错轮次或漏掉数字。发布前应对照来源。
Speaker A 只代表聚类后的声音,不是已核实的人。只有会议上下文或音频能确认时才写上姓名。
无障碍、医疗和法律流程可能需要合格人工转写。除非流程允许,否则把本输出当作第一稿。
告知参与者语音会转成文字,并控制谁能拿到 TXT。敏感场景可能需要比通用语音转文字更严的流程。
Mal Transcribe 2 返回口语对应的文字。如需另一种语言,翻译是另一步。
使用本目录模型不必另开 Azure 账单。用量限制见定价页。说话人标签是声音聚类,不保证固定人数。
Mal Transcribe 2 是 Microsoft 的 MAI-Transcribe-2 语音转文字模型。它把音频变成文字,并提供多语言、说话人分离、时间戳和关键词偏置。在 Muse Voice Transcribe 上,它是目录工具,而不是单独的 Microsoft 控制台。
若需要托管的多语言语音转文字,并且要内置说话人分离和时间戳,Mal Transcribe 2 通常更省事。若需要开源权重或自托管,Whisper 更合适。公开评测在速度和部分准确率表上把它放在 Whisper Large v3 前面;仍应用你自己的音频测试。
如果你已经在用 ElevenLabs 做语音和 TTS,Scribe 会很合适。若要在本语音转文字目录里使用 Microsoft 的多语言批次模型、说话人分离和关键词偏置,选这个模型。按任务选模型,不要只看一张总榜。
不需要。Muse Voice Transcribe 是语音与文本转换服务商。你在这里使用目录模型,不必分别购买每家供应商。站点定价仍然适用。若想自己签那些厂商合同,仍可使用对方控制台。
使用本页顶部工作台。开始任务,跟随文字,复查说话人轮次和关键细节,然后复制或下载 TXT。若下一步是纯实时笔记、会议或采访,打开本站相关页面。
拿到 Mal Transcribe 2 的 TXT 后,可打开定价、帮助或产品介绍。实时、会议、采访和说话人标签流程仍在上方卡片中。
打开工作台,先做一次短测试,再导出 TXT。本页就是 Muse Voice Transcribe 上的 Mal Transcribe 2 工具:一个目录,不必另购 Microsoft。
返回工作台