千问新一代原生全模态模型 Qwen3.8-Omni-Flash正式上线

鞭牛士Bianews
 来自北京

9月18日消息,千问大模型宣布新一代原生全模态模型 Qwen3.8-Omni-Flash正式上线。

据了解,该模型的核心目标是提升其在真实生产力场景中的 Agent 能力,推动全模态模型从“理解全模态内容”进一步走向“规划任务、调用工具并完成创作”。在具备编程、文本知识工作和 GUI 操作等通用 Agentic 能力的基础上,Qwen3.8-Omni-Flash 进一步拓展了以音视频为核心的 Agentic 应用,在视频剪辑、音乐视频创作、影视制作与解说、音视频转图文摘要和音视频对话等,需要综合处理文本、图像、音频与视频的工作流中取得了显著效果。

Qwen3.8-Omni-Flash 与其在生产环境中的应用

据介绍,Qwen3.8-Omni-Flash 支持 1M 长序列,在累计 30 项评测上,相比上一代 Qwen3.5-Omni-Plus,平均得分提升超过26%。

在音视频 Agent、Coding 和长程任务方面,模型在 WildClawBench-MM 上大幅提升36.5分,在 AgenticVBench 上提升22.3分,并在 UniClawBench 上取得 69.6的高分。

基础能力方面,模型在长音频/音视频理解、音视频推理、音视频 Caption 和多说话人识别上均有明显提升:例如,LongAudioSpan 提升8.3分,OmniVideoBench 提升 9.6 分,OmniCap-IF 的 CSR / ISR 分别提升 8.5 / 14.1 分,AliMeeting 的 DER / cpWER 从 88.11 / 89.61 降至 3.35 / 17.18。

通过扩展数据、上下文与 Agentic Environment,Qwen3.8-Omni-Flash 的音视频能力接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。

同时,Qwen3.8-Omni-Flash的API 每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。

图片

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻