编译/VR陀螺
近日,Meta发布实时音频感知模型Muse Voice Transcribe,这是Meta Superintelligence Labs推出的首个实时语音转写模型。该模型会将输入音频切分为80毫秒片段,并在每个片段结束时判断是继续等待上下文,还是立即输出下一段文字。
Meta表示,模型会根据不同词语的识别难度动态调整等待时间。对于较容易识别的内容,会更快完成输出;遇到更复杂的词语时,则会增加监听时间,以在识别准确率和转写延迟之间取得平衡。相关策略通过强化学习训练完成。
根据Artificial Analysis的独立测试,Muse Voice Transcribe英文单词错误率为3.1%,说话结束后的输出延迟约为0.16秒。相比之下,ElevenLabs Scribe v2 Realtime的错误率为3.6%、延迟约0.14秒,AssemblyAI Universal-3.5 Pro Realtime的错误率为4.0%。

除实时转写外,Muse Voice Transcribe还将说话人识别、说话人切换检测及语句边界判断整合在同一模型中。系统可同时区分20名以上说话人,并支持超过1小时的连续录音处理,无需后期处理。Meta还展示了8人在同一空间内交谈时,模型实时区分不同说话人的演示。
语言能力方面,Meta称该模型训练覆盖70多种语言,其中25种经过较为完整的测试,同时支持一段话中切换不同语言。开发者还可以提供语言、关键词及上下文提示,以提高专有名词等内容的识别准确率。

价格方面,Muse Voice Transcribe定价为每小时0.18美元,即每1000分钟3美元。作为对比,Cartesia Ink-2为4美元,ElevenLabs Scribe v2 Realtime和Deepgram Flux均为6.5美元。
Meta此次发布也明显指向AI眼镜等持续在线的个人AI设备。公司在演示中强调,稳定的实时语音识别是个人AI Agent理解真实对话的重要基础,而说话人识别和长时间连续转写能力,也能够用于AI眼镜在多人交流环境下获取和处理语音信息。
目前,Meta AI和Muse Code中的语音输入功能已经采用Muse Voice Transcribe,开发者也可以通过Meta Model API调用该模型。Meta暂未公布其参数规模、训练数据量及具体音频来源,模型权重也未开放。
来源:egamers
投稿/爆料:tougao@youxituoluo.com
稿件/商务合作: 林南(微信 19250561593) 六六(微信 13138755620)
加入行业交流群:林南(微信 19250561593)
元宇宙数字产业服务平台
下载「陀螺科技」APP,获取前沿深度元宇宙讯息