Anthropic于周二正式发布Claude Opus 5.5,这是其全新Claude 5.5家族中的首款模型。公司声称,该模型在保持旗舰级性能的同时显著降低了调用成本。
据Anthropic介绍,Opus 5.5在大多数任务上的表现已达到其价格最高的旗舰模型Claude Fable 5.1的水平。在运行成本上,它比所取代的Opus 5低20%,比Fable 5.1低60%。

从版本与家族序列看,Opus 5.5是Anthropic目前最先进的模型。Opus是该系列中体量最大的公开可用模型,其次为Sonnet,最小的是Haiku。Anthropic坦言,Fable与Opus之间的实际差距比基准分数所显示的更小,而公开可用性与更低的单位token成本,使Opus 5.5成为大多数Claude用户的显而易见之选。
回顾迭代节奏:Opus 5于7月发布,定价更低且在多数基准上得分高于Fable 5;Fable 5.1于9月初到来并扭转局势,在Anthropic公布的所有基准上均击败Opus 5。此次Opus 5.5再度缩小差距,而这一次的着力点是价格,而非原始分数。
开发者平台Lovable曾在7月对Opus 5进行自有编码测试,其在Anthropic分享的一份声明中表示,该模型相比前代“更稳定,多次运行间的方差小得多”——这与Anthropic此番再度强调的效率主张如出一辙。
Opus 5.5也是自CEO达里奥·阿莫迪(Dario Amodei)发表呼吁行业放缓的评论文章以来,Anthropic交付的首个模型。阿莫迪认为,AI能力的提升速度正在超过用于约束它的安全测试。“我们必须放慢改进AI模型能力的速度,”他在本月早些时候写道。
Anthropic通过智能体编码来衡量大部分进展——即由AI代理自主执行多步骤操作,而不仅仅是回答单条提示词。在Terminal-Bench 4.0上,Opus 5.5取得66.4%,高于Fable 5.1的55.8%和GPT-6 Astra的57.9%;FrontierCode测试中,Opus 5.5为54.4%,Fable 5.1为50.3%。

在采用Elo评分、覆盖44种职业真实专业工作的GDPval-AA v2.1上,Opus 5.5得分1846,Fable 5.1为1735,Opus 5为1708。
不过Opus 5.5并非全面领先。在AutomationBench上,GPT-6 Astra以41.4%略胜Opus 5.5的40.0%;在Terminal-Bench-Science 0.1上,Astra以64.6%大幅领先Opus 5.5的58.7%。
更大的卖点在于成本。Opus 5.5的输入token价格从Opus 5的每百万5美元降至4美元,输出token从25美元降至20美元,缓存读取费用下降60%至每百万token 0.20美元。

由于Opus 5.5在两项能力上与Anthropic的Mythos级模型(该公司限制最严的一层,仅供经过审查的网络安全与生物学研究人员使用)相当,它上线时配备了与Fable 5.1相同的安全防护措施。多数网络安全任务会被自动路由至较旧的Opus 4.8,这一做法此前曾遭到不少开发者与用户批评。
Opus 5.5现已在Anthropic各平台上线,包括亚马逊云科技(AWS)、谷歌云和微软Azure。Anthropic表示,Sonnet 5.5与Haiku 5.5将在未来数周内跟进,并把同样的降价措施覆盖至整个产品线。
