千问发布Qwen-Audio-3.1五款语音模型 支持实时交互

CNMO科技
 来自北京

【CNMO科技消息】9月23日,千问正式发布Qwen-Audio-3.1系列语音大模型,覆盖语音识别、语音合成和实时语音交互三大核心模型,并新增音频创作模型TTS-Next和音频理解模型ASR-Next。

千问

千问

其中,Qwen-Audio-3.1-ASR主打语音识别与文本整理,支持30种语言和16种中文方言,首字响应时间约160毫秒,可实现边说边转写。该模型还加入原生转写润色能力,能够自动去除语气词与重复表达,并对语义进行重组。

Qwen-Audio-3.1-ASR-Next则将处理范围从语音文本扩展至完整音频信息,支持分角色语音识别,可对应呈现说话人、时间戳和转写文本。同时,该模型还能理解人物情绪、环境声和机械声,用于声音描述、事件定位、音频问答与推理等场景。

在生成端,Qwen-Audio-3.1-TTS支持多语种和方言合成,并可在同一音色下实现跨语言自然迁移。除基础发音外,模型还支持通过指令控制情绪、语速和表达方式。此外,新推出的Qwen-Audio-3.1-TTS-Next进一步扩展到音频创作,可基于文本、时间戳和参考音频统一生成人声、音效与环境音,用于构建包含角色、情绪、场景和空间关系的全声景作品。

据CNMO科技了解,Qwen-Audio-3.1-Realtime支持全双工实时交互,可同时说和听,用户可随时插话或打断。该模型除理解语音文字外,还可识别声音背后的情绪与意图,并在对话中调用API、知识库和业务系统完成任务。

目前,Qwen-Audio-3.1系列模型API已上线千问AI平台。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻