文章详情

XM交易:Anthropic发布Claude Fable 5.1,基准成绩明显提升

币界网报道:

Anthropic 于 9 月 1 日推出 Claude Fable 5.1 和 Claude Mythos 5.1。这是该公司在 6 月发布 Fable 5 后,对相关模型线进行的首次更新,重点围绕科研、代码任务表现以及订阅接入方式调整展开。

关键测试成绩提升

Anthropic 这次重点展示了几项面向科研和代码任务的基准结果。Fable 5.1 在 Terminal-Bench-Science 0.1 中拿到 52.6%,明显高于 Fable 5 的 24.7%,也高于 Opus 5 的 29.0%。

Terminal-Bench 4.0 主要测试模型在命令行环境中连续写代码、运行和调试的能力。Fable 5.1 的成绩为 55.8%,高于 Fable 5 的 42.0%,也略高于 Opus 5 的 52.3%。

Mythos 5.1 在同一测试中达到 60.9%。Anthropic 称,这一差距与两者采用的安全过滤设置不同有关。

在人文学科与多学科推理测试 Humanity's Last Exam 中,Fable 5.1 在不调用外部工具时得分 60.9%,使用外部工具后升至 65.0%。这两项成绩也都高于 Opus 5。

价格仍高于 Opus 5

尽管新模型在官方公布的测试中全面反超 Opus 5,但价格并未下调。Fable 5.1 的输入价格为每百万 token 10 美元,输出价格为每百万 token 50 美元;Opus 5 对应价格分别为 5 美元和 25 美元。

这意味着,Fable 5.1 虽然性能更强,但使用成本仍是 Opus 5 的两倍。Anthropic 的说法是,Fable 5.1 在较低或中等推理强度下,也能达到或超过旧版 Fable 5 的表现,从而降低实际使用成本。

不过,从日常任务场景看,用户是否会因此放弃更便宜的 Opus 5,仍取决于具体工作负载和预算。

订阅权限继续分层

在接入方式上,Fable 5.1 已上线 Claude API,并可通过 Amazon Bedrock、Google Cloud 和 Microsoft Foundry 使用。

但它并未全面纳入所有 Claude 订阅档位。Pro 套餐以及标准版 Team、Enterprise 席位,使用 Fable 5.1 时仍需消耗按量计费额度,计费标准与 API 相同。

Max 套餐以及高级版 Team、Enterprise 席位,则可将 Fable 5.1 计入订阅权益,使用上限为每周额度的 50%。

至于 Mythos 5.1,当前仍只向通过审核的网络安全和生命科学专业人士开放,接入路径延续了 Anthropic 之前的验证机制。