艾瑞网
 来自北京

【行业动态:阿里发布Qwen3.8-Omni-Flash,每小时音频输入价格降98%,Agentic长视频理解把token消耗砍掉45.7%】

阿里9月17日上线原生全模态模型Qwen3.8-Omni-Flash,支持文本、图像、音频与视频输入,1M上下文,原生支持最长一小时音视频输入。官方目标是把全模态模型从「理解内容」推进到「规划任务、调用工具并完成创作」,重点场景是视频剪辑、音乐视频创作、影视制作与解说、音视频转图文摘要和音视频对话。29项评测平均得分较上一代Qwen3.5-Omni-Plus提升超25%,音视频能力接近Gemini 3.8 Flash、音频整体超过;WildClawBench-MM提升36.5分,AliMeeting的DER与cpWER从88.11与89.61降至3.35与17.18。

价格与消耗是官方主动强调的部分。API每小时音频输入价格较上一代降幅超过98%、音视频超过93%,计算口径为2分钟素材输入成本乘以30、音视频取720p与1fps。用法上,Agentic理解不再从头到尾处理整段长视频,而是从问题出发、由粗到细多轮取证:OmniVideoBench上准确率从63.4升至67.8,同时每次查询的token消耗从145,736降至79,117,降幅约45.7%。演示含短剧翻译(角色台词识别、口语化翻译、角色克隆配音、音轨重混、成片质检串成一条流程)与长电影解说。官方还让它在12小时内自主提升Qwen2.5-Omni-3B的四川话识别,四轮构建3,413条数据,字符错误率从25.79%降到15.30%。同步开源Qwen-MM-Plugins与Qwen-Live Harness。

和前天Gemini 3.8 Live放在一起看,语音与音视频线上两家在四十八小时内先后把计价单位换成「每小时」,98%的降幅意味着上一代价格已失去参考意义。更值得记的是45.7%:同一个模型、同一段视频,改变的是「看什么」的策略,token就少了近一半、准确率还升了。可证伪的判断:接下来一年,长视频类任务的账单差异会主要来自Agent怎么取证,而不是模型单价。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻