编程与专业工作表现
公告将 Opus 5 定位为适合编程和专业工作的强大模型,在 Frontier-Bench v0.1 上取得了业界领先结果,并在 CursorBench 3.2 和与 AA Coding Agent Index 相关的评估中表现出色。
Claude Opus 5 是 Anthropic 最新的 Opus 级模型,公告称其于 2026 年 7 月可用。页面将其描述为一款周到且主动的模型,适用于日常使用、长期运行的 agent、编程以及其他专业知识工作任务。
Anthropic 将 Opus 5 定位为比早期模型更高效,且价格与 Opus 4.8 相同,同时在不同 effort 设置下结果都会提升。公告还称它是 Claude Max 上的新默认模型、Claude Pro 上最强的模型;而定价页则将 Opus 放在 Claude 更广泛的 Free、Pro、Max、Team、Enterprise 和 API 套餐结构中。
公告将 Opus 5 定位为适合编程和专业工作的强大模型,在 Frontier-Bench v0.1 上取得了业界领先结果,并在 CursorBench 3.2 和与 AA Coding Agent Index 相关的评估中表现出色。
Anthropic 表示,用户可以使用 effort 设置来优化智能表现,或节省 token 以获得更快、更便宜的结果;并且 Opus 5 在日常使用中比其他模型更高效。
该模型被描述为在验证自身工作并谨慎迭代直到成功方面强得多,示例聚焦于调试、根因分析和多步骤完成。
页面强调了在知识工作和问题解决基准上的提升,例如 ARC-AGI 3、Zapier AutomationBench、OSWorld 2.0、GDPval-AA v2、HLE、AutomationBench 和 DeepSearchQA。
Anthropic 表示 Opus 5 在生命科学评估上有所改进,涵盖结构生物学、有机化学和生物信息学,包括在分子结构推断和蛋白质相关任务上的具体提升。
公告称 Opus 5 可以生成更强的视觉输出,包括空气动力学流动可视化和简化的交互式细胞插图。
将 Opus 5 用于需要模型进行调试、重构行为或将项目推进到可用结果的编程任务。公告中的示例包括根因分析、FreeCAD 重建任务以及棘手的软件修复。
将其用于受益于检查假设并在长时间运行中持续专注的多步骤知识工作。Anthropic 强调了业务任务自动化、分析工作以及其他需要谨慎迭代的专业工作流。
将其用于结构生物学、有机化学、生物信息学及相关生命科学分析等研究导向工作。页面特别提到其在分子结构推断和蛋白质相关任务上的更强表现。
当任务需要计算机使用或类浏览器交互,而不仅仅是文本生成时使用它。来源提到了 OSWorld 2.0 和其他计算机使用基准,以及端到端业务任务示例。
将其用于涉及生成或改进图表和交互式插图的视觉解释任务。Anthropic 引用了更强的生成视觉效果,包括风洞可视化和简化的细胞插图。
Claude Opus 5 被呈现在 Anthropic 的 Claude 套餐中,定价页将其显示为 Opus 级模型。在定价页上,Opus 包含在 Pro、Max、Team 和 Enterprise 套餐对比中,其中更高层级(如 Max)的使用权限更强。
来源将 Opus 5 描述为 Claude Max 的新默认模型,以及 Claude Pro 上最强的模型。定价页还展示了 Claude 的网页、移动端和桌面应用,且不同套餐提供的附加功能有所不同。
该公告强调了 agent 式编程、知识工作、研究以及计算机使用工作流。它还提到更强的视觉输出,但页面没有提供针对 Opus 5 的单独产品设置流程或连接器列表。
公告称 Opus 5 比其他模型更高效,并可通过 effort 设置在智能水平与 token 使用、速度和成本之间取得平衡。它还说明在网络安全任务上仍落后于 Mythos 5。
ByteAsk 是面向 C 和 C++ 的终端优先 AI 编码 agent,可直接编辑仓库,并在展示 diff 前用真实编译器、调试器、sanitizers 和测试验证修改。提供免费版与付费方案。
Ghost 是一款基于终端的 AI 助手,可在命令行中聊天、生成代码并运行任务。内置免费模型,支持 Linux、macOS 和 Windows,且为开源项目。
CreateOS Sandbox 是基于 Firecracker 微型虚拟机的隔离计算环境,用于运行代码和 agent 工作负载,支持私有网络、SDK、CLI 和 MCP 程序化控制。
hob 是面向编码 agent 的独立工作区,可将 agent 会话、终端、历史记录和后续工作围绕你已在用的工具与提供商有序管理,适合重视本地路由、历史和工作区结构控制的开发者。
Manta AI 是面向团队的自治式网页应用测试工具,可从 URL 自动探索应用、映射行为、捕捉回归,并用自然语言生成测试,无需脚本或维护选择器。
Redline 是一款面向 Claude Code 的预算管理工具,可按时间、token、成本或计划百分比限制会话进度,并借助原生 hooks 和 statusline 让任务平稳完成,不会突然中断。