【CNMO科技消息】9月29日,Claude Sonnet 5.5正式上线后的多项测试数据陆续公布。相比单纯关注新模型发布,更值得关注的是它的实际性能和成本表现:Anthropic公布的Terminal-Bench 4.0成绩达到70.6%,而独立评测机构Artificial Analysis测得其在最高推理强度下的综合Intelligence Index为56分,同时单个测试任务平均成本达到7.60美元。

Claude
从模型能力来看,Sonnet 5.5在Terminal-Bench 4.0上拿到70.6%,明显高于上一代Sonnet 5的10.3%,也高于Opus 5.5的66.4%。在CursorBench 4.0中,Sonnet 5.5得分55.5%,Sonnet 5为34.1%;在GDPval-AA v2.1知识工作测试中,Sonnet 5.5达到1844分,与Opus 5.5的1846分仅相差2分。

不过,性能提升并不完全等同于成本下降。Sonnet 5.5的官方API价格其实没有变化,输入仍为每百万Token 2美元,输出为每百万Token 10美元,缓存读取为每百万Token 0.20美元。Anthropic所谓“每项任务成本最高降低30%”,主要来自模型完成同一任务时需要更少的Token和更少的执行步骤,而不是单个Token直接降价。

Artificial Analysis的测试进一步揭示了不同推理强度下的成本差异。在最高Effort设置下,Sonnet 5.5平均每项任务成本达到7.60美元,同时每项任务平均产生约19.3万Output Token;作为对比,Opus 5.5约为5.98美元,Sonnet 5约为5.09美元。也就是说,在最高推理强度下,Sonnet 5.5虽然性能已经逼近旗舰模型,但单任务实际成本反而高于Opus 5.5。

Token消耗也是此次测试中比较突出的数据。Artificial Analysis统计显示,Sonnet 5.5在最高Effort下完成综合测试时累计产生约4.10亿Output Token,远高于该评测中同类模型约8800万Token的中位数。单任务平均约19.3万Output Token,其中推理Token约14.2万。
因此,Sonnet 5.5目前呈现出的特点比较明确:模型本身的Token单价没有变化,但在部分实际任务中,可以通过减少Token消耗、工具调用和重复执行来降低整体成本;而当Effort拉到最高水平后,模型为了追求更高完成度会消耗大量Token,单任务成本也随之上升。对于开发者来说,真正值得关注的并不是“每百万Token多少钱”,而是完成一个有效任务究竟需要多少Token,以及不同Effort设置下的性能成本比。


