导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

OpenAI发布GPT-6 Sol与Luna,低价对标Anthropic Claude Opus 5.5

OpenAI周二推出两款新模型GPT-6 Sol和GPT-6 Luna,此时距Anthropic发布其新旗舰Claude Opus 5.5仅数分钟。Sol与Luna的定位低于GPT-6 Astra。Astra于9月3日发布,OpenAI当时称其为“全球最智能、对齐程度最高的模型”。

Myriad:哪家公司将下一个IPO?点击预测。

Astra仍是OpenAI处理最难任务的首选,而Sol和Luna则是更便宜、更快速、面向日常工作负载的选项。OpenAI的模型分层策略与Anthropic相似:Astra对标Fable,Sol对标Opus,Terra对标Sonnet,Luna在升级后对标Haiku。

为保持竞争力,OpenAI还调整了定价。两款模型的API费用较GPT-5.6的促销每token费率下降50%。Token是模型读写文本的片段,通常略少于一个完整单词;企业按百万token计费,因为AI规模化账单会迅速累积。Sol目前每百万输入token收费2美元、每百万输出token收费10美元,低于此前的4美元和20美元;Luna降至0.10美元和0.50美元,低于此前的0.20美元和1.20美元。整体来看,OpenAI在每个层级上的报价都低于Anthropic。

OpenAI发布GPT-6 Sol与Luna,低价对标Claude Opus 5.5

性能声明主要围绕Zapier构建的AutomationBench展开。该基准测试AI智能体能否使用横跨销售、营销、运营、支持、财务和人力资源的47种工具完成完整业务流程,并以通过率计分。GPT-6 Sol在最高推理设置下得分33.2%,每任务成本0.27美元。根据OpenAI自己的数据,Claude Opus 5在最高设置下得分26.9%,但每任务成本高出11倍以上。GPT-6 Sol在同一测试中还小幅领先Anthropic价格更高的旗舰Claude Fable 5.1。

OpenAI GPT-6 Sol与Luna基准测试表现

在Agents' Last Exam中,GPT-6 Sol最高努力模式得分56.4%。该测试评估AI智能体在55个子行业中长期、具有经济价值的工作表现,并按完成百分比评分。OpenAI称,这一成绩超过Claude Opus 5的最佳得分,同时每任务成本低60%。推理努力是OpenAI加入的一项调节参数:调高后,模型会在回答前花更多时间和算力自我复核,通常同时提高准确率与成本。

在计算机使用方面,即AI智能体像人一样点击、输入和导航软件,GPT-6 Sol在OSWorld 2.0上以60.5%对60.3%几乎追平Claude Opus 5的中等努力得分,而成本约低80%。OSWorld测试长期、真实的计算机任务,并根据任务正确完成程度给出部分分数。

目前,GPT-6 Sol和GPT-6 Luna已在ChatGPT Work和Codex中面向Plus、Pro、Business、Enterprise和Edu订阅用户上线。Luna还通过桌面应用覆盖免费和Go用户。两款模型尚未进入普通ChatGPT应用,OpenAI表示将在当天逐步推送,以保持服务稳定。