据报Meta Platforms(META)发布首款实时音频感知模型 支持多人多语言流式转写

金吾财讯
 来自广东

金吾财讯 | 据外媒报道,Meta Platforms(META)正式发布Muse Voice Transcribe,这是公司首款实时音频感知模型,开发者可通过Meta Model API调用该服务。

定价方面,服务费用为每1000分钟音频3美元,折合每小时0.18美元。该模型将流式语音识别、说话人分离、端点检测整合在一套流程内,可边说话边输出转写文本,无需等待音频完整录制完成。

业务能力上,该模型能够区分同一段录音里20名以上不同发言者,自动识别语句停顿边界;训练覆盖70余种语言,发布时完成25种语言验证,支持时长超1小时音频,也适配句内、句间的多语言切换。开发者还可以通过语言、关键词、上下文偏置,提升特定术语、业务场景下识别精度。

技术层面,Meta采用自适应延迟机制,动态权衡识别时延与准确率,针对每一个词汇判断需要接收多少音频再输出结果,兼顾实时响应效果与识别质量。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻