人工智能 / ARTICLE

Claude Opus 5.5 模型页登上 Hacker News:智能、性能、价格三列该怎么读

Artificial Analysis 发布了 Claude Opus 5.5 的模型页,把智能、性能与价格并排对比,链接在 Hacker News 拿到 274 分。榜单之外,选模型的人真正要回答的是另一个问题:哪一列可以牺牲。

Artificial Analysis 给 Claude Opus 5.5 做了一个模型页,标题把三件事并排放着:智能、性能、价格。这个链接在 Hacker News 上拿到 274 分、83 条评论。排行榜遍地都是的年份,一个单模型页面还能挤进首页,本身就说明了一些事。

智能、性能、价格是三件不同的事

“智能”一般是几组标准化测试的加权结果。它回答的是模型在受控题目上的上限,不回答它能不能在你那套代码里跑通一个真实改动。分数有用,因为可比;边界也清楚,因为题目本身会被针对性地优化。

“性能”通常指首字延迟和吐字速度。批处理任务基本可以忽略这两项,交互式产品则直接受它们支配。同一份输出,首字慢两秒,就是两种产品体验。

“价格”最容易被看错。每百万 token 的标价只是起点,真正进账单的是输入输出比例、缓存命中、重试和失败调用,以及为了拿到合格结果要多跑几轮。一个单价贵一倍、但一次就给出可用答案的模型,常常比便宜却需要反复纠正的更省钱。

把三项放在一张表上,结论往往不是“某一列最强”,而是“在你的场景里,哪一列可以牺牲”。

评论区在吵什么

83 条评论不算热闹,但这类帖子的争论通常落在几处:评测题能不能代表真实工作负载;小版本号的提升是否值回迁移成本;公布价格与实付账单之间的差距。

对小团队,迁移成本是实打实的。提示词要重调,评测要重跑,边界情况要重新摸一遍。名字里多一个 .5,并不意味着值得为此停下手里的活。对大公司,决定性因素往往在别处:合规、区域可用性、合同条款,这些比排行榜上的几分更能左右采购。

第三方页面之所以被转来转去,而不是直接看厂商公告,原因不是厂商会撒谎,而是厂商的对比表天然围绕自家模型最占优的任务来搭,读者心里有数。中立页面同样要做取舍——选哪些基准、各占多少权重、按哪档价格算——这些取舍恰好是评论区要追问的对象。方法透明,争论至少还能围绕方法展开。

还有一类读者只看评论。他们不打算换模型,只想确认自己现在的选择还没落后太远。这类需求支撑了相似页面的持续流量。

该看哪一列

这类页面的价值在于压缩:给定预算和延迟要求,哪个模型够用。它不负责告诉你项目该怎么写,也不负责替你判断一次迁移值不值。

三列对应三种提问方式。想知道能力天花板,看智能;想知道用户会不会等,看性能;想知道月底账单长什么样,看价格——但记得把后两项按自己的流量结构重算一遍。274 分说明很多人正在做同一道选择题,至于答案,各人手里的表并不一样。


来源Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max)(Hacker News RSS)

END