Claude Opus 5 在大多数基准测试中超越 Fable 5,价格仅为其一半
Claude Opus 5 今天发布。与 Anthropic 的领先模型 Claude Fable 5 相比,Opus 5 对企业的运行成本更低,后者被公司定位为付费用户的日常前沿产品。更重要的是,Opus 5 在重要基准测试中也表现更佳。
为了理解 Opus 5 的定位:Anthropic 的产品线分为四个层级。Haiku 快速且便宜,Sonnet 属于中档,Opus 是重型工作马。在其上方是 Mythos 类——这是 Anthropic 在春季推出的一个层级——其中包括面向公众的 Claude Fable 5,以及 Claude Mythos 5,这是一个通过 Project Glasswing 为经过审查的网络安全研究人员和关键基础设施运营商保留的版本,限制较少。
作为订阅旗舰,Fable 5 的表现不佳。它于 6 月 9 日发布,三天后因美国政府发布紧急出口管制令,因其存在越狱漏洞而被全球撤回,并于 6 月 30 日重新上线——但立即转为仅限积分的模式,不再包含在标准计划中。现在,Opus 5 填补了 Fable 5 无法保持的空缺。
开发者平台 Lovable 拥有数百万用户,在其内部评估中运行了 Opus 5,并指出其优势不仅体现在原始分数上:“它不仅在我们最困难的代理编码任务上表现更好,比 Opus 4.7 提高了 22%,而且运行时的稳定性更高,方差大大减少,”Fabian Hedin 在 Anthropic 分享的声明中表示。
基准测试
听起来可能有些奇怪,但 Opus 在几乎所有对普通用户重要的方面都超过了 Fable,而没有被标记为 Mythos 类。
在 Frontier-Bench v0.1——一个测试 AI 编码代理是否能够完成端到端真实软件工程任务的基准,按通过的任务百分比评分——Opus 5 达到了 43.3%。Fable 5 则为 33.7%。OpenAI 的 GPT-5.6 Sol,Anthropic 的主要商业竞争对手,得分为 34.4%。
最显著的差距出现在 ARC-AGI-3,这是一个基于新颖难题的真实问题解决测试,模型无法从训练数据中记忆,按解决的难题百分比评分。Opus 5 达到了 30.2%;GPT-5.6 Sol 得分为 7.8%;而 Fable 5 根本没有进行测试。在 GDPval-AA v2——一个通过 Elo 评分的知识工作基准,Elo 是一种用于衡量真实专业任务相对表现的国际象棋风格排名系统——Opus 5 达到了 1,861,而 Fable 5 为 1,747,GPT-5.6 Sol 为 1,736。
Zapier 在 AutomationBench 上测试了 Opus 5,这是一个评估模型是否能够在没有人工帮助的情况下完成完整业务工作流程的评估。他们的判决是:该模型“从一个原始的账户健康工作簿开始,完整运行了一次防止流失的序列:标记高风险账户,通知正确的负责人,并为保留操作进行总结。之前的模型没有通过;Opus 5 达到了 100%。”
Anthropic 还将 Opus 5 作为研究升级进行推广。DNA 测序公司 Ultima Genomics 表示,该模型“表现得更像一位谨慎的科学家,而不是我们运行过的任何模型。它选择正确的统计测试来排除混杂因素,通过独立方法交叉检查自己的结果,并在长时间的多步骤分析中保持轨道。”
也就是说,这两个领域——法律和健康——是 Fable 5 仅以微弱优势表现突出的唯一领域。
此次发布在 Moonshot AI 发布 Kimi K3 一周后进行,Moonshot AI 是一家由阿里巴巴支持的北京初创公司,Kimi K3 是一个 2.8 万亿参数的开放权重模型(意味着任何人都可以下载底层代码独立运行),Moonshot 将其描述为世界上最大的开放 AI 系统。独立基准测试一致将 Kimi K3 排名第三,落后于 Fable 5 和 GPT-5.6 Sol,但在特定领域超越了这两者。
Opus 5 现已通过 API 提供,每百万输入令牌 5 美元,每百万输出 25 美元。(令牌是 AI 模型在输入和输出中可以处理的信息基本单位)。还提供一种快速模式,运行速度约为默认速度的 2.5 倍,价格是基础价格的两倍——每百万输入令牌 10 美元,每百万输出 50 美元。
此次发布可能结束了对 Fable 5 缺乏公开可用性的焦虑。Opus 也通过订阅向所有人开放。
免责声明:本内容仅用于一般品牌传播与信息说明之目的,不构成任何金融、投资、法律或税务建议。文中提及的活动、奖励、线上活动或相关信息,不应被视为对购买、出售、交易任何加密资产,或使用任何服务的推荐、招揽或邀请。加密资产具有高波动性,并存在价值损失风险。WEEX 服务及线上活动的可用性可能因地区而异,并受当地适用法律法规及用户资格要求限制。部分活动可能不适用于某些司法辖区。您有责任确保访问及使用 WEEX 服务符合当地适用法律法规。在参与任何涉及加密资产的活动前,请充分评估相关风险。
猜你喜欢

Elliptic报告揭示比特币ATM诈骗如何从现金转向链上钱包

ARCA:中小企业每年可提交多达89份申报表,面临高达1000万比索的罚款

三阶段谈判:LLA勾勒出明年不举行PASO的战略

FBI利用谷歌Cookies、500个食品订单和一个Monero种子短语识别Steam恶意软件资助者

FATF表示加密货币旅行规则的采纳正在上升,但执法仍滞后

Coinbase在股票和预测市场扩张中重组高层

法院命令冻结Onil资产,因未付款的投诉在Reclame Aqui激增

维拉赫塞尔一名2岁女孩去世,司法部门调查原因:其母曾因其他两名女儿的死亡被宣判无罪

Wise计划在GENIUS法案框架下重新提交国家信托银行申请

Wasabi Wallet推出2.8版本,支持P2P过滤和coinjoin比特币支付

SEC执法副主任萨姆·沃尔登将辞职,机构领导层重组

玛莎·福兹

什么是布林带?交易一分钟

特朗普将在白宫记者晚宴上复出,因袭击事件而暂停的晚宴

7年Ledger漏洞让攻击者在几秒钟内从五个签名重建私钥

封存于铝箔中:BMAG对交易卡的新关注

Coinbase 认为比特币积累与第三季度宏观压力相碰撞

未参与《辛普森一家》,却每年赚取高达1000万美元:詹妮弗·蒂莉的故事

SpaceX放弃猎鹰9,全面押注‘星舰’…股价面临转折点

Bitcoin Dev Kit 4.0推出实验性支持静默支付和BIP-353

Solana与Monad白皮书比较(2026)

人工智能:比特币矿工的合同总额达到1500亿美元

Exaion:MARA在法国的挖矿意图被指隐瞒,依据美国提起的诉讼

天然气费用调整:重新定义更新系统及其对账单的影响

聪明钱现在都在往哪跑?

Strategy在熊市中改变游戏规则。公司股票将何去何从?

墨西哥与美国在T-MEC贸易谈判第三轮中未达成协议

OpenAI因一名牧师的诉讼被指控其ChatGPT的医疗建议加重了健康问题

汇丰银行以21亿美元出售新加坡保险业务:将带来哪些变化











