
文章摘要
Muse Voice Transcribe 在一个模型中实现实时流式语音识别(ASR)、20+ 位说话人分离(说话人分离)和端点检测。在 70+ 种语言上训练并支持无缝代码切换,在 Artificial Analysis 的流式语音转文本和公开说话人分离基准上均排名第一。
Muse Voice Transcribe 指南 2026:Meta 的实时音频感知模型
2026 年 9 月 2 日,Meta(AI at Meta)发布了Muse Voice Transcribe——Meta Superintelligence Labs 首款实时音频感知模型。
先给结论:Muse Voice Transcribe 在一个模型中实现实时流式语音识别(ASR)、20+ 位说话人分离(说话人分离)和端点检测。在 70+ 种语言上训练并支持无缝代码切换,在 Artificial Analysis 的流式语音转文本和公开说话人分离基准上均排名第一。
演示中,它实时追踪一间房间里 8 个人的对话,精确知道谁说了什么。本文介绍 Muse Voice Transcribe 是什么、工作原理、能力和应用。
Muse Voice Transcribe 是什么
Muse Voice Transcribe 是 Meta Superintelligence Labs 开发的实时音频感知模型。
| 项目 | 内容 |
|---|---|
| 开发方 | Meta Superintelligence Labs |
| 发布时间 | 2026 年 9 月 1 日 |
| 模型 | Muse Spark 家族(自回归多模态) |
| 语言 | 70+ 种语言训练、25 种充分验证 |
| 功能 | 流式 ASR、说话人分离、端点检测 |
| 排名 | Artificial Analysis 语音转文本与说话人分离均第 1 |
| 应用 | Meta AI 与 Muse Code 的语音听写 |
| 官方页面 | research.meta.ai/blog/introducing-muse-voice-transcribe |
为什么重要
Meta CEO 扎克伯格主张「AI 的未来是为所有人(for everyone)」——不是单一集中的超级智能,而是为每个人服务的个人超级智能。为此,AI 眼镜等设备必须像人类一样听懂真实对话,而不只是语音命令。
真实对话充满重叠、打断和口音。所以流式、端点检测和说话人分离至关重要。Muse Voice Transcribe 就是那个「耳朵」基础。
工作原理:三大核心功能
① 流式 ASR
Muse Voice Transcribe 是Muse Spark 家族的自回归多模态模型。
- 音频按80ms 分块处理(12.5Hz),每个分块转换为 1 个软令牌
- 每个分块,模型决定「继续听下一个分块」还是「输出文本令牌」
- 继续听时预测
<|next_audio|>令牌,下一输入替换为实际音频分块 - 音频流结束时插入
<|empty_audio|>令牌,模型输出全部剩余文本
② 说话人分离(Diarization)
在流式 ASR 基础上添加特殊令牌实现:
<|start_of_turn|>标记说话人切换<|speaker_A|>–<|speaker_Z|>标签区分说话人- 实时识别 20+ 位说话人
示例:
<|start_of_turn|>Hello, how are you doing?<|speaker_A|>
<|start_of_turn|>Did anything fun over the weekend?<|speaker_A|>
<|start_of_turn|>Hey I'm good!<|speaker_B|>
③ 端点检测
<|speech_onset|>标记语音开始<|speech_endpoint|>标记用户说完的瞬间
对实时对话至关重要:用户一停就能立即响应。
能力(Capabilities)
语言覆盖
70+ 种语言训练,其中25 种充分验证。初始版本推荐使用 25 种验证语言。
代码切换
双语者常在一句话中混用语言(如「明天九点有个 doctor appointment」)。Muse Voice Transcribe 原生支持句内/句间任意代码切换,并通过上下文偏置——知道你的联系人、关键词和地点——提升准确率。
长上下文
1 小时以上音频与20+ 位说话人原生处理,无需后处理。
应用
Muse Voice Transcribe 为Meta AI 与 Muse Code 的一键语音听写提供支持。
- 可用于任意应用、屏幕上的任意窗口
- 只需长按 Fn 键即可开始
- 演示中实时追踪 8 人对话,精确显示谁说了什么
总结
Muse Voice Transcribe 是 Meta「为所有人的个人超级智能」愿景的音频感知基础。
- ✅ 实时流式 ASR(80ms 分块)
- ✅ 20+ 位说话人分离
- ✅ 端点检测(语音开始/结束)
- ✅ 70+ 种语言、无缝代码切换
- ✅ 1 小时以上长上下文、无需后处理
- ✅ Artificial Analysis 语音转文本与说话人分离均第 1
- ✅ Meta AI 与 Muse Code 语音听写
实时对话 AI、AI 眼镜语音界面、多语言会议转写——对这类需求,Muse Voice Transcribe 是 2026 年最重要的语音模型之一。
链接
- Meta 官方博客:https://research.meta.ai/blog/introducing-muse-voice-transcribe
- X 帖子:https://x.com/AIatMeta/status/2094839236016976028
- 相关文章(Muse Glimmer):https://cldnavi.com/blog/muse-glimmer-guide-2026/
相关文章
相关文章

2026年8月10日
【2026】用 Unsloth 运行 Muse Glimmer 完全指南!18GB 内存即可运行・微调 Meta 的 30B 智能体模型

2026年9月3日
OpenCode 上免费使用 Meta Muse Spark 1.3!Zen/Go 指南 2026(Contributor 版详解)

2026年8月10日
【2026】Meta Muse Glimmer 完全指南!30B 开源模型正在改变本地 AI 智能体

2026年7月10日
【2026】Meta Muse 完全指南!智能体型图像生成与隐私争议的全貌

2026年8月6日
【2026】Muse Code 完全指南!Meta 发布的终端编码智能体与 Muse Spark 1.2 深度解读

2026年9月26日
【2026】MuseAI-Skills 解读:Meta「Muse」的 68 个技能与运行环境快照