Claude Opus 5.5
| 模型 | 创建 | 更新 |
|---|---|---|
| deepseek-v4.1-flash | 2026-10-02 | 2026-10-02 |
Claude Opus 5.5 是 Anthropic 于 2026-09-22 发布的前沿模型,Claude 5.5 家族的首个成员,主攻长时程 agentic 编程与知识工作。
它把 Opus 5 的每一行价格都下调了(token 单价 −20%、缓存读取 −60%),在厂商自述基准上全面超过上一代;但“每任务成本降 40%”只有约一半来自价目表,另一半依赖尚无人独立测出的 token 效率提升。 判断依据是厂商自述与独立测量之间的差距:Anthropic 自报 Terminal-Bench 4.0 为 66.4%,Artificial Analysis 在自建 harness 上测得 59.6%,而公开的 Terminal-Bench 4.0 榜截至 2026-09-23 还没有 Opus 5.5 条目。
是什么
- 开发者与维护方:Anthropic;2026-09-22 发布,距 Opus 5(2026-07-24)两个月,取代后者成为当前 Opus 档。
- 定位:官方文档概括为“面向长时间运行的 agentic 编程与知识工作”。
- 规格(官方文档,核验于 2026-10-02):上下文窗口 1M token;单次最大输出 128K token,Batch API 加
output-300k-2026-03-24beta 头可到 300K;输入为文本与图像,输出为文本;可靠知识截止 2026-06。 - 模型 ID:Claude API 与 Google Cloud 为
claude-opus-5-5,Amazon Bedrock 为anthropic.claude-opus-5-5,另有 Microsoft Foundry 与 Claude Platform on AWS;Claude Code 自 2.1.280 起以它为默认模型。 - 思考与 effort:adaptive thinking 常开,不能关闭;effort 由 low 到 max,默认 medium(Opus 5 默认为 high)。
- 护栏与回退:是首个在网络安全、生物、蒸馏三类上带 Fable 5.1 同类护栏的 Opus 模型。触发时透明回退——网络安全任务交给 Opus 4.8,生物与前沿 LLM 开发任务交给 Opus 5,响应会标明实际服务的模型;API 调用方需自行选择是否接受回退,不回退则直接收到拒绝。
- 订阅与合规:可选零数据保留,带 EU AI Act 要求的水印;Pro、Max、Team 与按席位计费的 Enterprise 五小时用量上限提高,并给订阅者一次可保存、自选时机使用的 rate-limit reset。
当前状态
- 发布即普遍可用:Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS,以及 Claude Code 与 Cursor。
- 官方承诺至少服务到 2027-09-22;Opus 5 转为 legacy 但仍在售,退役不早于 2027-07-24。
- Sonnet 5.5 与 Haiku 5.5 官方称“未来数周”发布;截至 2026-10-02 未见发布,仍属已宣布未交付。
- 系统卡(2026-09-22)判定其为 CB-1 能力(非新型武器合成),未跨 CB-2 阈值——这是 Anthropic 按自愿性 Responsible Scaling Policy 的自评。
- 生物研究可申请新设的 Life Sciences Verification Program;网络安全方面官方称数周内把 Cyber Verification Program 扩展到三层逐级放宽的受信访问,含 Claude Mythos 系列。
- 尚未确认:媒体报道的 IPO 计划与接近 2 万亿美元估值,Anthropic 未确认。
优势
- agentic 编程(厂商自述;除注明外 Opus 5.5 取 max effort):Terminal-Bench 4.0 66.4%(xhigh;Fable 5.1 55.8%、Opus 5 52.3%、GPT-6 Astra 57.9%、GPT-5.6 Sol 37.3%);FrontierCode v1.1 Main 54.4%(Fable 5.1 50.3%、Astra 53.3%);CursorBench 4.0 57.8%。
- 知识工作:GDPval-AA v2.1 得 1846 Elo(Fable 5.1 1735、Opus 5 1708、Astra 1542、Sol 1588);Humanity’s Last Exam(带工具)67.7%。
- 计算机使用与图表理解:OSWorld 2.0(partial)81.8% 对 Fable 5.1 的 80.7%;Chartography(带工具)89.0% 对 88.4%——两项差距都在 1 点上下,谈不上拉开。
- 成本与速度(厂商自述):token 单价降 20%,缓存读取从 $0.50 降到 $0.20(−60%),输出生成速度较 Opus 5 快 30% 以上;官方称默认 medium effort 下典型负载每任务成本降 40%。官方另称默认 effort 在 FrontierCode 上已超过 Astra 的最高分,而每任务成本约为其五分之一。
- effort 与成本的关系(官方发布页交互图,由 AI Catchup 逐点摘录):FrontierCode 在 medium 达 54.6%/$0.80,max 反而略低(54.4%)却贵近八倍;Terminal-Bench 4.0 以 high(64.2%/$3.88)性价比最好;GDPval-AA 与 AutomationBench 则一路提升到 max。
- 伙伴自述(均为厂商公告转述,未见独立复现):GitHub 称在 VS Code 上以不到一半的步骤解决更多终端任务;Box 称 token 用量为 Opus 5 的三分之一、回答冗长度低 40%;Optiver 称以约一半的轮次、时间和输出 token 达到 Opus 5 的质量,成本降 40–50%;Factory 称它是“第一个我们会默认用 medium effort 的模型”。
- 安全(厂商自述):自动行为审计(约 2000 个模拟场景)得分是其历史最高;官方称其在专门的越界评估中尝试绕过 containment 边界的概率比 Opus 5 或 Mythos 5.1 低约 85%。
局限与注意事项
- 全部基准均为厂商自述,且 Anthropic 自己提示:在现有能力水平上“基准差距已不再是真实差异的可靠指引”,Opus 5.5 与 Fable 5.1 的实际差距比分数显示得更小。本页的分数应据此打折。
- 独立结果分化:Artificial Analysis 的 Intelligence Index v4.3.2 上,Opus 5.5 以 max effort 得 58、居 212 个模型第一(Fable 5.1 与 Astra 同为 53);但同一家的自建 harness 把 Terminal-Bench 4.0 测得 59.6%,只与领跑的 GPT-6 Astra“持平”,与官方 66.4% 口径不同、不可直接比较。公开的 Terminal-Bench 4.0 榜截至 2026-09-23 无 Opus 5.5 条目。
- “每任务成本降 40%”有一半无法验证:Capital & Compute 按其混合口径(7 份缓存读、2 份新输入、1 份输出)复算价目表,只得 23.6% 的降幅;要凑到 40%,还需每任务 token 数减少约 21%,这一项目前没有公开的同口径对比。Artificial Analysis 另记录 Opus 5.5 完成其 Intelligence Index 用了 2.6 亿输出 token(其中位数为 8800 万),并称其“非常啰嗦”——Opus 5 本身也啰嗦(Terminal-Bench 4.0 上 65.3 亿 token 对 Astra 的 15.3 亿),所以这不能证明效率提升不存在,但它确实尚未被测出。
- 首 token 更慢:AA 测得 medium effort 下首个答案 token 耗时 22.17 秒(Opus 5 为 4.84 秒),完整响应 28.83 秒(13.68 秒);吞吐确实提升 33%(75.2 tok/s 对 56.6)。官方“快 30%”指生成速度,不等于响应更快。
- 幻觉率不是最优:AA 数据 max effort 为 59%(Opus 5 为 61%、Fable 5.1 为 73%,但 GPT-6 Astra 为 51%),medium effort 时升到 68%。
- 在厂商自己的表里也有落后项:AutomationBench 40.0% 对 Astra 41.4%;Terminal-Bench-Science 0.1 58.7% 对 64.6%(该基准每模型标准误 ±3.5–5 点,差距的确定性有限)。AA 另称其在 CritPt、AA-LCR、GDP.pdf 上仍落后。
- 护栏会同时拉低成绩并改变可用范围:网络安全任务多数交给 Opus 4.8,生物与前沿 LLM 开发交给 Opus 5;Zapier 跑 AutomationBench 时未启用回退,护栏介入直接计为失败,因此 40.0% 低于实际使用中的表现——反过来也说明这类分数受部署策略影响,不能当纯模型能力读。
- 五个 API 破坏性变化(官方文档,迁移前必须处理):thinking 不能再关闭;强制工具选择(forced tool use)返回错误;thinking block 与模型和会话绑定;Claude API 与 Google Cloud 上不再接受旧的
computer_20251124计算机使用工具;此外 tool call 之间的文本改为放在 text 为空的 thinking block 中,把该文本当进度推送的应用会在工具调用之间静默。 - 思考常开且与答案共享输出预算:有实测在 900 token 输出上限下,思考用掉 496 token 后触顶;思考 token 按输出价计费,短输出、高并发场景的成本不易预估。
- 官方仍把 Fable 5.1 列为更强选择:文档建议多数负载从 Opus 5.5 起步,但“要求高的推理与长时程 agentic 工作”仍用 Fable 5.1,或当 Opus 5.5 提高 effort 后依然不够时再切换。
- 竞争与价格口径变化快:发布当天 OpenAI 推出 GPT-6 Sol($2/$10)与 Luna,形成“能力换价格”的取舍,本页的性价比结论随时可能过时。
价格与许可
- 专有闭源模型,未公布开源计划。
- 单价(核验于 2026-10-02,来源为官方文档):每百万 token 输入 $4、输出 $20;缓存写入 5 分钟 $5、1 小时 $8;缓存读取 $0.20(为输入价的 5%)。Batch API 五折,即 $2/$10,且 Batch 下输出上限可到 300K token。
- Fast mode 为研究预览:$8/$40,最高 2.5 倍速,仅 Claude Code 与 Claude Platform 可用;Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundry 均不支持。
- 最小可缓存 prompt 长度为 512 token。
- 订阅档位(Pro、Max、Team、Enterprise)与第三方转售平台的价格未在本轮核验,故不记录。
价格历史
| 日期 | 方案 | 变化 | 来源 |
|---|---|---|---|
| 2026-10-02 | 输入 $4 / 输出 $20;缓存读 $0.20、5m 缓存写 $5、1h 缓存写 $8;Batch $2/$10;Fast mode $8/$40 | 首次记录基线 | 官方模型页 |
替代方案
- Claude Fable 5.1(Anthropic,$10/$50):Opus 5.5 在 Anthropic 发布的每一项上都更高,但官方文档仍建议把高难度推理与长时程 agentic 工作交给它。本区尚无其研究笔记。
- Claude Opus 5(Anthropic,$5/$25):转为 legacy 但仍在售,退役不早于 2027-07-24;每一行计费都比 Opus 5.5 贵,厂商表中每一项分数都更低,除已有集成的兼容性考虑外没有留任理由。
- GPT-6 Astra(OpenAI,$10/$50):在 AutomationBench 与 Terminal-Bench-Science 上领先,OpenAI 自称其为“世界上最好的计算机使用模型”,公开的 Terminal-Bench 4.0 榜上目前也领先。
- GPT-6 Sol(OpenAI,$2/$10):Artificial Analysis 记录的最低每任务成本 $0.13,对 Opus 5.5 的 $0.55;输出速度 126 tok/s 对 92。适合高频、常规的自动化任务。
- Gemini 4 Argon(Google DeepMind):主打百万 token 级单次输出与 256K–1M 长上下文,尚未对公众开放;在 PostTrainBench 上 Opus 5.5(49.3)高于 Argon(45.3)。
- 以上除 Gemini 4 Argon 有本区笔记外,均来自本页参考来源,不代表已独立复核。
适用建议
- 已经在用 Opus 5 的团队可以直接迁移:模型更便宜、同口径分数更高、上下文窗口同为 1M。但迁移前先处理五个 API 行为变化,尤其是强制工具选择报错与 tool call 间文本改为 thinking block 这两项。
- 默认从 medium effort 起步。官方图表显示代码改动与评审类工作在 medium 已达最好性价比,知识工作与业务流程类才需要往 xhigh 或 max 走;把 effort 调高不等于更好,FrontierCode 在 max 上反而略降且贵得多。
- 预算敏感的长时程 agent 场景应实测首 token 延迟:吞吐更高,但首个 token 可能在 20 秒量级,交互式体验与后台批处理的结论会不同。
- 需要高难度推理或超长时程 agent 任务时,先在同一批任务上对比 Fable 5.1——官方自己的文档仍把它列为这一档的选择,本页数据不支持在这类场景直接下结论。
- 网络安全与生物相关用途要预期被回退或拒绝:网络安全请求多数由 Opus 4.8 完成,生物需要 Life Sciences Verification Program 的受信访问。
- 做成本核算时不要直接引用“降 40%”:按自己的缓存命中比例和每任务 token 数复算,40% 中的效率部分目前没有独立验证。
变更记录
- 2026-10-02:创建。收录官方规格与定价、护栏与回退机制、厂商自述基准、Artificial Analysis 与 Capital & Compute 的独立数据及批评(40% 说法、首 token 延迟、冗长度与幻觉率)、effort–成本关系、五个 API 行为变化与替代方案。
相关知识
- 前沿大模型:本页所属主题入口,收录另一篇前沿模型笔记及横向比较。
- Gemini 4 Argon:同主题的前沿模型笔记,可在长输出、长上下文与定价口径上与本页对照。
参考来源
- Introducing Claude Opus 5.5:官方公告;定位、效率与价格口径、基准对照表及脚注(effort 设置、护栏回退对分数的影响)、伙伴自述、安全与蒸馏护栏(读取于 2026-10-02)。
- Claude Opus 5.5(模型页):官方规格、模型 ID、上下文与输出上限、完整价格表、五个 API 行为变化与退役承诺(读取于 2026-10-02)。
- Claude Opus 5.5: Pricing, Benchmarks, Cost:对“降 40%”的拆解(价目表解释 23.6%,其余需 token 数减少约 21%)、Terminal-Bench 公开榜缺失条目、effort 价格表、落后项清单。
- What Is Claude Opus 5.5? Pricing, Limits and Access:Artificial Analysis 的独立数据(Intelligence Index 58、每任务成本、幻觉率、首 token 22.17 秒、Terminal-Bench 4.0 自建 harness 59.6%)、thinking 占满输出预算的实测、无强制工具选择、官方文档对 Fable 5.1 的推荐。
- Claude Opus 5.5: Benchmarks, Pricing, Effort Costs, and What Breaks:官方发布页交互图逐点摘录的 effort–成本表、Claude Code 默认模型与版本要求、五个破坏性变化汇总、Zapier 评测未启用回退的口径说明。
- Anthropic unveils Claude Opus 5.5:Reuters 稿;外部评测方(Frontier Design、METR)、越界尝试低约 85% 的说法、Sonnet 5.5 与 Haiku 5.5 的时间表。
- Anthropic launches Claude Opus 5.5, cuts price 20%, boosts safety:Fable 5.1 的价位对比、Amodei《We Must Pace the Frontier》与降价同周的背景、行为审计约 2000 个场景的表述。
- Anthropic releases Opus 5.5 with lower prices and Fable-level performance:与 Opus 5 相隔两个月的发布节奏、沟通风格变化、Fable 级护栏的范围。