
观点网讯:7月20日,千问正式发布语音合成大模型Qwen-Audio-3.0-TTS。
该模型包含面向实时交互的Flash版本和面向高质量生成的Plus版本,并支持Free-style自然语言指令控制。
其中,Flash版本首包延时达到300ms级别,以满足实时交互场景的低延迟需求。
新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升。
免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。

观点网讯:7月20日,千问正式发布语音合成大模型Qwen-Audio-3.0-TTS。
该模型包含面向实时交互的Flash版本和面向高质量生成的Plus版本,并支持Free-style自然语言指令控制。
其中,Flash版本首包延时达到300ms级别,以满足实时交互场景的低延迟需求。
新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升。
免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”