跳过主要内容

实时转写

转写已完成,可复查

00:21

说话人 A

感谢参加。我们先从采访问题开始。

00:04

说话人 B

当然,我已经准备好了。第一个主题是上线时间表。

00:09

说话人 A

很好。我们交谈时,我会保持转写窗口打开。

00:15

说话人 B

好的。分享前我们可以先复查最终文字。

00:21

说话人分离与转写中的说话人标签

说话人分离回答“谁在什么时候说话”,把音频切分为不同说话人的轮次。上方预置转写展示带时间戳的双人布局和导出效果。它只是界面演示:切换到实时麦克风后,内容统一标为“你”,不会自动识别多位参与者。

直接回答

说话人分离会根据不同声音聚类,并使用 Speaker A、Speaker B 等中性标签。它不同于识别“说了什么”的语音转文字,也不同于把声音绑定到真实姓名的身份识别。标签只能辅助复查,重要归属必须对照原始音频确认。

Muse Voice Transcribe 是独立工具,与 Meta 没有关联。双人内容是预置产品样例,不是本页实时模型处理结果。

最后更新:

透明的双人标签示例

工作台默认显示一段 21 秒、四轮的固定转写:Speaker A 发起采访,Speaker B 回答,随后双方各再说一轮。每段都有中性标签和时间戳,也能以 TXT 形式复制或下载。

预置输出
Speaker A [00:04]: Thanks for joining. Let us start with the interview questions.
Speaker B [00:09]: 当然,我已经准备好了。The first topic is the launch timeline.
Speaker A [00:15]: Great. I will keep the transcript open while we talk.
Speaker B [00:21]: Perfect. We can review the final text before sharing it.

该样例只证明显示与导出格式,不证明自动估算人数、声音身份匹配或准确率。重置后使用麦克风时只会显示“你”,避免把预置结果误认为实时分离。

本工作台的可核验事实

本工作台的可核验事实
项目
预置转写4 个轮次 / 21 秒
预置说话人标签2 个:Speaker A、Speaker B
实时说话人标签
时间戳粒度每个轮次 1 个
导出格式仅 TXT
分离准确率未测量
说话人身份识别不支持

来源:本页可见工作台和预置转写。核验日期:2026 年 9 月 3 日。

语音转文字、说话人分离和身份识别的区别

这三个词对应不同任务。下表可以避免把转写格式误认为说话人身份能力。

语音转文字、说话人分离和身份识别的区别
概念回答的问题当前页面状态
语音转文字说了什么?实时麦克风初稿
说话人分离谁在什么时候说话?预置 Speaker A/B 示例
说话人身份识别哪个已知的人说话?不支持

说话人标签为转写增加什么

标签让多人对话更容易阅读,但仍需要上下文和人工复核。

按轮次区分说话人

中性标签把一位参与者的话与下一位分开,但不会推断真实姓名、角色或身份。

带时间参考的对话结构

时间戳帮助返回原音频核对决定、引用或可疑边界。本样例不提供逐字时间轴。

可读的多人 TXT 导出

复制和下载会保留每行之前的标签,便于进入研究笔记或编辑器继续整理。

结果可人工修正

复查者可以合并错误拆分、修正归属,或在有证据时把中性标签替换为姓名。

如何复查说话人分离结果

把自动标签当作结构化初稿,先核对轮次,再确认身份。

  1. 01

    确认实际声音数量

    先听原音频确认人数。背景电视、观众反应或同一人音量变化都可能被误判为新声音。

  2. 02

    核对每个轮次边界

    重点检查打断、简短回应和重叠说话,这些位置最容易把内容分给错误参与者。

  3. 03

    把中性标签映射到已确认姓名

    只有上下文或原音频能确认身份时才替换标签,无法确定时应保留中性称呼。

  4. 04

    修正文字并导出

    同时检查姓名、数字、引用和专业词,再复制或下载。需要审计时应另行保存合规的原音频。

说话人标签的使用场景

多位参与者都提供重要信息时,标签能减少反复回放。

采访和定性研究

分开采访者问题和参与者回答,便于扫描主题和候选引用,但引用和身份仍需核实。

会议、圆桌和客服通话

跟踪多人的决定、异议和交接。行动项负责人必须对照录音或会议记录确认。

播客和录制对话

为剪辑和节目笔记提供第一版轮次结构,音乐、插入片段和重叠说话仍需编辑修正。

说话人分离的限制

整齐的标签也可能是错的。

分离不等于身份识别

Speaker A 只代表若干片段被聚为同一声音,并不能证明现实中的姓名或身份。

重叠和短语音很难处理

打断、笑声、简短回应、相似声音和一人移动位置都可能导致错误合并或拆分。

浏览器样例边界明确

预置转写有两个标签,实时麦克风只有“你”。本页不承诺自动实时分离或准确率。

多人音频涉及隐私

应取得同意、控制访问并确认处理位置。本页不承诺通用本地处理或录音存储控制。

浏览器语音识别参考来源

实时流程依赖浏览器 API。以下公开文档说明本页涉及的权限和识别接口。

常见问题

什么是说话人分离?+

它按照“谁在什么时候说话”把音频切分,并输出 Speaker A、Speaker B 等中性聚类标签。

说话人分离和身份识别一样吗?+

不一样。前者只聚类声音片段,后者尝试绑定已知人物。中性标签不能当作身份凭证。

本页会自动分离我的麦克风声音吗?+

不会。双人内容是预置样例,实时麦克风内容统一标记为“你”。

自动标签有多准确?+

结果受收音、声学、声音相似度、重叠和片段长度影响,本页不为预置样例发布准确率。

可以导出带标签的文本吗?+

可以,预置样例可复制或下载为带 Speaker A 和 Speaker B 的纯 TXT。

结合真实流程理解说话人标签

在实时转写页面测试麦克风能力,在会议转写页面查看完整复查流程,或打开原始 Muse Voice Transcribe 演示。

检查预置说话人标签样例

查看四个轮次并复制文本,确认标签在纯文本中的格式后,再决定是否重置工作台。

返回说话人样例