GPT-5.2图像可逆性仅达人类六成 理解变化仍存局限

CNMO科技
 来自北京

【CNMO科技消息】9月14日,CNMO科技从韩媒获悉,韩国光州科学技术院宣布,研究团队开发出了名为C3-Bench的新评估标准,用于检验AI在比较两张图像时,能否准确找到并描述与给定情境相关的重要变化。

ChatGPT

ChatGPT

研究团队指出,现有评估数据往往集中在特定场景或变化上,缺乏对情境重要性的明确界定。为弥补这一不足,团队从自然场景、卫星及航空遥感图像、图像编辑、异常检测四个领域选取了51种现实变化情境,并构建了包含4996个图像对应的C3-Bench数据集。研究人员表示,团队为每种情境具体规定了AI应寻找的变化、应忽略的差异以及描述变化时需遵循的标准。

在评估方式上,研究团队不再仅比较答案与标准句子的词汇重合度,而是从内容准确性、变化描述的具体性、语句自然度和情境相关性四个方面综合评分。针对400个图像组,人和GPT-5.2分别描述图像变化,综合评分满分为10分,人类得7.45分,GPT-5.2得5.72分,相差1.73分。然而,在语句自然度单项上,GPT-5.2以8.53分高于人类的8.32分。

研究团队还测试了AI在图像顺序反转时,描述变化是否能前后一致,即“可逆性”。结果显示,人类可逆性得分为93%,而GPT-5.2仅为61%。研究人员表示,这表明AI生成自然语句的能力与准确识别图像中重要变化的能力并不等同,在理解变化方向上仍存在局限。该研究成果已被12日在瑞典马尔默举行的国际学术会议ECCV 2026收录。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻