隆重推出 Claude Opus 4.8(官方公告中文翻译)
约 3000 字大约 10 分钟
ClaudeAnthropicLLM
2026-05-29
本文为 Anthropic 官方公告的中文翻译。原文:Introducing Claude Opus 4.8(发布于 2026 年 5 月 28 日,分类 Product / Announcements)。
隆重推出 Claude Opus 4.8
我们将 Claude Opus 升级到了一个新版本:Claude Opus 4.8。它在 Opus 4.7 的基础上构建而成,在各项基准测试中均有提升,并且是一位更高效的协作伙伴。它从今天起以相同的价格提供。
Opus 4.8 在发布的同时还带来了若干新功能。claude.ai 上的用户现在可以控制 Claude 在某项任务上投入多少 Effort。Claude Code 新增了"动态工作流"(dynamic workflows)功能,使其能够应对超大规模的问题。而 Opus 4.8 的快速模式(fast mode)——模型能以 2.5 倍速度工作——现在的价格比此前各代模型便宜了三倍。
Opus 4.8 的能力
下表展示了 Opus 4.8 在编程、智能体(agentic)能力、推理以及实际知识工作任务等测试中,与其前代及其他模型的对比情况。更多细节以及范围广得多的各项能力评测,请参阅 Claude Opus 4.8 系统卡(System Card)。
(原文此处为基准测试对比图表)
与 Opus 4.8 协作
早期测试者发现,Claude Opus 4.8 在执行智能体任务时更可靠、判断也更敏锐。以下是众多测试者关于与 Opus 4.8 协作体验的评价:
Claude Opus 4.8 的判断力明显更好。在 Claude Code 中,它会问对的问题、能发现自己的错误、在方案不合理时提出反对意见,并会在跨多个服务的复杂探索中先建立起把握,然后再做出重大改动。这是一个非常适合用来构建的模型。
—— Tom Pritchard,资深工程师(Staff Engineer)
在我们的 Super-Agent 基准测试上,Claude Opus 4.8 是唯一一个能端到端完成每一个测试用例的模型,在成本持平的情况下击败了此前各代 Opus 模型以及 GPT-5.5。对于翻译、深度研究、幻灯片制作和分析等智能体产品而言,它带来了强大的可靠性。
—— Kay Zhu,联合创始人兼 CTO
在 CursorBench 上,Claude Opus 4.8 在每一个努力档位上都超过了此前各代 Opus 模型。工具调用的效率有了实质性提升,在同等智能水平下使用更少的步骤,并能将端到端任务贯彻到底。
—— Michael Truell,联合创始人兼 CEO
Claude Opus 4.8 在我们的法律智能体基准测试(Legal Agent Benchmark)上取得了有史以来的最高分,并且是首个在"全部通过"(all-pass)标准下整体突破 10% 的模型。对于实质性的法律工作而言,这种准确率的提升会直接转化为我们的客户能够放心交付多少真正的律师工作量。
—— Niko Grupen,应用研究主管(Head of Applied Research)
Claude Opus 4.8 相较于 Opus 4.7 感觉像是一次重大的体验升级:更快、更易协作,也更善于在长会话中保持上下文和风格方向。Opus 4.8 是我在那些需要嗓音、品味与技术执行同时兼顾的工作中,一直信赖的模型。
—— Katie Parrott,资深撰稿人(Staff Writer)
Claude Opus 4.8 是我们测试过的最强的计算机操作(computer-use)与浏览器智能体模型,在 Online-Mind2Web 上得分 84%,相较 Opus 4.7 和 GPT-5.5 都是一次有意义的飞跃。它能以我们客户的智能体工作负载所需要的方式保持反思并专注于任务,从而实现端到端的可靠性。
—— Miguel Gonzalez,技术负责人(Tech Lead)
Claude Opus 4.8 能干净利落地使用工具,并以我们自主化工程工作负载所需的一致性来遵循指令,从而保持无人值守地持续运行。它相较 Opus 4.6 有所改进,并修复了我们在 Opus 4.7 上看到的注释冗长和工具调用方面的问题。Anthropic 的这次发布,直接转化为在 Devin 上进行构建的工程师们更快的能力提升。
—— Scott Wu,CEO
在我们的长时运行评测中,Claude Opus 4.8 的分析质量持续高于此前各代 Opus 模型。它完成得更快,并产出更丰富、信息密度更高的结果。总体而言,信噪比明显更好。最大的差异在于 Opus 4.8 倾向于主动标记分析的输入和输出中存在的问题,而其他模型经常会遗漏这一点、留给用户去发现。
—— Michael Ran,高级投资经理(Sr. Investment Associate)
在 CoCounsel Legal 中,与此前各代 Opus 模型相比,Claude Opus 4.8 在一致性和推理质量上带来了实质性提升。对于我们客户所依赖的高风险专业工作流而言,这种可靠性至关重要。在我们为法律和税务专业人士构建受信责(fiduciary-grade)级别的 AI 系统时,这样的进步有助于提升现实工作流中可信 AI 表现的标准。
—— Joel Hron,首席技术官(CTO)
Claude Opus 4.8 为企业级 AI 树立了新标杆。在 Genie(Databricks 面向数据与知识工作的 AI 智能体)中,新的 Opus 模型带来了智能体推理能力的阶跃式提升,能比此前任何 Opus 更快地处理更深入的多步骤问题。其多模态实力还让 Genie 能够直接对 PDF、图表及其他非结构化内容进行推理,且 token 成本比 Opus 4.7 低 61%。
—— Hanlin Tang,CTO,神经网络(Neural Networks)
对于 Hebbia 编排器(orchestrator)中的金融文档工作流,Claude Opus 4.8 提供了与 Opus 4.7 同样出色的质量,但引用精度明显更好、检索时的 token 效率也更高,对于我们客户每天处理的那类密集申报文件而言效果极佳。
—— Aabhas Sharma,CTO
(原文共 11 条评价,以上为轮播展示的内容)
Opus 4.8 最显著的改进之一是它的诚实度(honesty)。我们训练所有模型都要诚实——例如,避免做出它们无法支撑的论断。但 AI 模型有一个普遍问题:它们有时会贸然下结论,在证据薄弱的情况下仍自信地宣称自己在工作中取得了进展。早期测试者反馈,Opus 4.8 更倾向于标记出对自身工作的不确定之处,也更不容易做出缺乏依据的论断。这一点在我们的评测中得到了印证:评测显示,Opus 4.8 放任自己所写代码中的缺陷不予指出的概率,约为其前代的四分之一(即低约 4 倍)。
一如既往,我们在发布前对该模型进行了详细的对齐(alignment)评估。在正面特质方面,我们的对齐团队得出结论:Opus 4.8"在我们对支持用户自主性、为用户最大利益行事等亲社会特质(prosocial traits)的衡量上达到了新高"。该评估还显示,Opus 4.8 表现出失准行为(如欺骗或配合滥用)的比率大幅低于 Opus 4.7,并与我们对齐表现最佳的模型 Claude Mythos Preview 相当。完整的对齐评估,连同一整套部署前安全测试,已在 Claude Opus 4.8 系统卡中报告。
(原文此处为对齐评测相关图表)
今天同步发布
除 Claude Opus 4.8 之外,我们还推出以下更新:
- 动态工作流(Dynamic workflows)。这项以研究预览(research preview)形式提供的新功能,让 Claude 能在 Claude Code 中承担更宏大的任务。Claude 可以规划工作,然后在单个会话中运行数百个并行子代理(subagents)(而借助 Opus 4.8,这些代理可以运行更长时间)。随后它会先验证自己的输出,再向用户汇报。例如,搭载 Opus 4.8 的 Claude Code 现在能够从启动到合并,完成跨数十万行代码的代码库级别迁移,并以现有的测试套件作为衡量标准。关于动态工作流的更多内容——该功能面向 Claude Code 的 Enterprise、Team 和 Max 套餐提供——可阅读这篇文章。
- claude.ai 和 Cowork 中的 Effort 控制(Effort control)。在模型选择器旁新增了一个控件,让用户选择 Claude 在一次回答中投入多少 Effort。在更高的 Effort 档位上,Claude 会更频繁、更深入地思考,从而给出更好的回答;在更低的 Effort 档位上,Claude 会更快地回应,并更慢地消耗用户的速率限额(rate limits)。用户现在可以做出这一选择——Effort 控制在所有套餐上均可使用。
- Messages API 现在接受在 messages 数组内部插入 system 条目。 开发者可以在任务进行中更新 Claude 的指令,而不会破坏提示缓存(prompt cache),也无需将更新通过一次用户回合(user turn)来路由。这可以在给定的运行框架(harness)中,于代理运行时更新其权限、token 预算或环境上下文。
(原文此处为视频:「Embrace long-running tasks with Opus 4.8 and Claude Code」)
关于 Effort 的说明
Opus 4.8 默认采用高(high)Effort 档位,我们判断这是质量与用户体验的最佳整体平衡。在编程任务上,该 Effort 档位花费的 token 数与 Opus 4.7 的默认设置相近,但性能更好。用户可以选择"extra"(在 Claude Code 中为"xhigh")或"max",模型会花费更多 token 以获得更好的结果;我们建议在高难度任务和长时运行的异步工作流中使用"extra"。我们已提高了 Claude Code 中的速率限制,以适应更高 Effort 档位带来的更高 token 用量;用户可以根据各自项目的实际情况选择合适的档位。
接下来是什么?
用户会发现 Opus 4.8 是相较其前代一次幅度不大但切实可感的提升。我们仍有更多工作要做:我们正在研发并发布一些模型,让它们以更低的成本提供许多与 Opus 相同的能力。
不仅如此,我们还计划发布一类智能水平比 Opus 更高的全新模型。作为 Project Glasswing 的一部分,目前已有少数组织在将 Claude Mythos Preview 用于网络安全工作。这种能力级别的模型在能够普遍发布之前,需要更强的网络安全防护措施。我们正在迅速推进这些防护措施的研发,预计将在未来几周内把 Mythos 级别的模型带给我们所有的客户。
可用性
Claude Opus 4.8 从今天起在所有平台上可用。常规使用的定价与 Opus 4.7 保持不变:每百万输入 token 5 美元、每百万输出 token 25 美元。快速模式的定价为每百万输入 token 10 美元、每百万输出 token 50 美元。开发者可以通过 Claude API 使用 claude-opus-4-8。
脚注
- Terminal-Bench 2.1: 我们使用 Terminus-2 公共运行框架报告了所有模型的分数。GPT-5.5 使用 Codex CLI 运行框架报告的分数为 83.4%。
- OSWorld-Verified: 我们调整了运行 OSWorld-Verified 评测的方式,以更准确地反映模型在真实世界中的表现,并已将 Opus 4.7 的分数更新为 82.3%。关于这些更新的更多内容,请参阅系统卡。
- Finance Agent v2: Gemini 3.5 Flash 在 Finance Agent v2 上得分 57.9%,相较 Gemini 3.1 Pro 有显著提升。
