Claude Fable 5.1 与 Mythos 5.1:新功能详解
Anthropic 最新前沿模型,分两个安全防护层级——成本更低、智能体任务能力更强,现已足以推动真实科学研究。

2026 年 9 月 1 日,Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1——同一底层模型以两个安全防护层级的形式推出。Fable 5.1 今日正式面向公众开放;Mythos 5.1 采用相同模型但安全限制更宽松,仅向经过审核的网络安全和生命科学机构开放。如果只记住一件事:它在长时间智能体任务上比 Fable 5 更智能,在上下文密集型工作中成本明显更低,其研究成果更是最大亮点。
以下是实际变化内容,以及这些变化对你构建智能体的意义。
Fable 5.1 与 Mythos 5.1:同一模型,两个层级
Anthropic 将这两个版本作为单一模型、配以两套安全防护机制发布,详见其官方公告:
- Fable 5.1 — 配备生产级安全防护的通用版本。可通过 API(
claude-fable-5-1)、Claude.ai、Claude Code、Claude Cowork,以及 AWS、Google Cloud 和 Azure 访问。 - Mythos 5.1 — 相同权重但安全限制更宽松,仅通过两个受信访问计划开放:面向防御性安全工作的网络安全验证计划,以及与美国政府合作运营的生命科学验证计划。
命名上的区分很重要,因为这两个"模型"在某些基准测试上得分不同,纯粹是由于 Fable 的安全防护会对特定任务进行干预。Anthropic 表示,未来的安全防护改进将缩小这一差距。
在 Anthropic 的产品线中,Fable 位于 Haiku、Sonnet 和 Opus 之上,是能力最强的层级。
相比 Fable 5 有哪些新变化
与 2026 年 6 月发布的 Fable 5 相比,有三点值得关注:成本、智能体能力和科学研究。
1. 成本更低,主要得益于缓存读取
Fable 5.1 的主要降价来自缓存读取——即模型复用已处理过的上下文。Anthropic 将该价格下调了 75%,降至每百万 token 0.25 美元。连锁效应如下:
- 典型工作负载成本降低约 25%(按 token 计费)。
- 上下文密集型智能体工作负载最高降低约 45%(缓存读取占账单大头时)。
其他价格不变:输入 token 每百万 10 美元,输出 token 每百万 50 美元。因此,如果你运行需要反复读取大量上下文的长时程智能体,这是实实在在的降价;如果你的调用较短且以输出为主,降幅则相对有限。
Fable 5.1 在低或中等努力程度下的质量与 Fable 5 持平甚至更优——这意味着你通常可以调低努力程度,以更低成本获得相同结果。(注意默认值有所不同:Claude Code 默认为高,Claude Cowork 和 Claude.ai 默认为中。)
2. 长时程智能体任务能力更强
最明显的提升体现在长时间运行、工具密集型任务上。根据 Anthropic 发布的基准测试对比表,Fable 5.1 在编程、计算机使用和业务工作流方面均优于 Fable 5:
| 基准测试 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 55.8%(Mythos 5.1 为 60.9%) | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2(知识工作) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0(严格模式) | 41.7% | 36.1% | 39.6% | — |
| Humanity's Last Exam(含工具) | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
数据来源:Anthropic。最大的单项差距出现在智能体科学研究领域,得分较 Fable 5 翻了一倍有余。
除基准测试外,定性评价是:Fable 5.1 在长时间运行中保持清晰的任务专注度,并能解决根本原因而非走捷径。Anthropic 援引投资公司 Millennium 的案例:Fable 5.1 通过反汇编供应商库并与核心转储进行匹配,追踪到了一个百万分之一概率的崩溃问题——该问题多年来无法解释,其他任何模型(包括 Fable 5)均无法破解。
3. 科学研究才是真正的亮点
值得重点关注的是研究工作,主要在 Mythos 5.1 层级上完成:
- 蛋白质设计: 在使用开源折叠和设计工具的情况下,Mythos 5.1 针对 12 个靶点设计出高亲和力结合剂,命中率接近 50%——Anthropic 表示当前典型命中率为 10–15%——并在 Adaptyv Bio 竞赛的三个靶点上以约 10 倍亲和力超越最佳参赛作品。
- 行星地图绘制: Fable 5.1 训练了一个神经网络,利用 30 年前 NASA Magellan 雷达数据为金星三分之一的区域构建了更高分辨率的高程图,将细节精度从 10–20 公里提升至 2–3 公里。Anthropic 将以 Creative Commons 许可证发布该成果。
- GPU 内核优化: Mythos 5.1 编写了自定义内核,在输出完全一致的前提下,将七个开源基因组学和蛋白质模型的速度提升了最高 2.5 倍,将全基因组分析的预估 GPU 成本降低了 30–60%。
这些是演示成果,并非同行评审结果——但它们具体、在部分领域经过外部验证,并指向了智能体模型的发展方向。
成本、数据留存与安全防护
除原始能力外,Anthropic 还借此次发布回应了三个长期存在的企业诉求。
数据留存。 一个名为企业前沿安全防护(Enterprise Frontier Safeguards,EFS)的新系统,通过将数据存储在客户自己的云基础设施上、由客户自行进行人工审查,为客户提供零数据留存级别的隐私保护。该系统将于今年秋季分阶段推出;在此之前,符合条件的客户可以在零数据留存的条件下运行 Fable 5.1。
减少误报。 安全防护现在对良性内容的误判更少——Anthropic 表示网络安全防护的误报减少了 60%,Claude Code 用户每次会话中遇到的网络安全防护干预也将减少约 60%。Fable 5.1 现在可用于发现软件漏洞(防御性工作),但漏洞利用生成、渗透测试和二进制漏洞扫描仍会路由至 Opus 模型处理。
防蒸馏。 新的 API 账户不再能够在保留思维记录的同时编辑 Claude 的先前上下文——这关闭了一种已记录在案的、用于提取推理轨迹的技术手段。现有账户暂不受影响,但该变更将适用于未来版本的所有用户。
是否应该切换?
按使用场景快速判断:
- 长时程编程智能体 — 很可能值得切换。智能体能力提升加上缓存读取节省,正是针对多步骤、上下文密集型运行场景设计的。Cognition(Devin)表示将在发布时把 Opus 5 流量迁移至 Fable 5.1,从代码审查开始。
- 短时、输出密集型调用 — 此处降价幅度较小,因为降价主要来自缓存读取而非输出 token。在假设节省之前请先测试。
- 网络安全或生命科学研发 — 你会遇到 Fable 将双重用途任务路由至 Opus 的情况。Mythos 5.1 正是为此而生,但仅通过经审核的访问计划开放。
- 隐私敏感型企业 — EFS 是你最关注的亮点,但它将在秋季分阶段推出,请在做出承诺前确认你所在平台的可用性。
对大多数开发者而言,诚实的总结是:同等顶级质量,在过去昂贵的工作负载上成本更低,安全防护的干预也更少。
用你自己的 AI 工作团队来实现这一切
Fable 5.1 的真正优势在于长时间运行、工具密集型工作——这与填满真实工作日的多智能体任务形态完全吻合。Eigent 是一款开源"协作"桌面应用,可在本地运行多智能体 AI 工作团队,让你能够将 Claude 等前沿模型指向你自己机器上的编程、研究和文档工作流——如果你对数据留存有顾虑,这是一个天然契合的选择。查看它如何处理多步骤工程任务,请参阅我们的 GitHub PR 审查工作流,或立即下载 Eigent,搭建你自己的智能体工作流。
Recent Posts

Gemini 3.8 Flash:编程与 AI 智能体的全新升级
Gemini 3.8 Flash 在保持与 3.7 Flash 相同低价的前提下,大幅提升了编程能力和智能体推理能力,并推出全新的 3.8 Flash Cyber 变体。本文涵盖基准测试、定价及使用方法。

GPT-6 Astra:OpenAI 新模型究竟能做什么
GPT-6 Astra 是 OpenAI 的全新旗舰模型。本文详解其功能、基准测试表现、定价方案,以及 AGI 相关报道背后的注意事项。

Muse Spark 1.3:Meta 前沿编程与智能体模型详解
Muse Spark 1.3 是 Meta 最新的前沿编程与智能体模型。查看基准测试、定价、xhigh 与 max 变体对比、版本变化及与竞品的横向比较。