【CNMO科技消息】9月23日,千问正式发布Qwen-Audio-3.1系列语音大模型,覆盖语音识别、语音合成和实时语音交互三大核心模型,并新增音频创作模型TTS-Next和音频理解模型ASR-Next。

千问
其中,Qwen-Audio-3.1-ASR主打语音识别与文本整理,支持30种语言和16种中文方言,首字响应时间约160毫秒,可实现边说边转写。该模型还加入原生转写润色能力,能够自动去除语气词与重复表达,并对语义进行重组。

Qwen-Audio-3.1-ASR-Next则将处理范围从语音文本扩展至完整音频信息,支持分角色语音识别,可对应呈现说话人、时间戳和转写文本。同时,该模型还能理解人物情绪、环境声和机械声,用于声音描述、事件定位、音频问答与推理等场景。

在生成端,Qwen-Audio-3.1-TTS支持多语种和方言合成,并可在同一音色下实现跨语言自然迁移。除基础发音外,模型还支持通过指令控制情绪、语速和表达方式。此外,新推出的Qwen-Audio-3.1-TTS-Next进一步扩展到音频创作,可基于文本、时间戳和参考音频统一生成人声、音效与环境音,用于构建包含角色、情绪、场景和空间关系的全声景作品。

据CNMO科技了解,Qwen-Audio-3.1-Realtime支持全双工实时交互,可同时说和听,用户可随时插话或打断。该模型除理解语音文字外,还可识别声音背后的情绪与意图,并在对话中调用API、知识库和业务系统完成任务。
目前,Qwen-Audio-3.1系列模型API已上线千问AI平台。


