SWE-2 icon

SWE-2

SWE-2 是 Cognition 的智能编码模型,可规划、实现、测试并验证软件变更,支持多种工作强度级别,并通过 Devin Desktop 和 CLI 提供,后续将推出 Devin Web 与 Fusion 版本。

SWE-2

SWE-2 概览

SWE-2 是 Cognition 面向智能软件工程工作的编码模型。它旨在规划并执行代码变更,同时在多种推理工作强度级别之间平衡编码性能、推理成本和推出时间。

该模型可在 Devin Desktop 和 CLI 中使用,源文章还称其正在推出 Devin Web 和 Fusion 版本。Cognition 将 SWE-2 定位为面向软件工作流的模型:智能体需要检查代码库、实现变更、编写测试并验证最终工作成果。

主要功能

多种推理工作强度级别

SWE-2 支持 medium、high 和 max 三种工作强度级别,可根据任务复杂度和成本考量匹配可用的推理工作强度。

聚焦代码库探索

该模型会将探索重点放在代码库中与任务相关的部分;在所引用的评测中,这有助于其比 SWE-1.7 更早开始实现。

更广泛的测试覆盖

据报道,在编码任务中,SWE-2 会编写更多端到端测试,并更可靠地检查回归问题和边界情况。

灵活执行任务

当预期路径受阻时,该模型可以在用户声明的边界内寻找其他路径,包括在一个所报告的示例中,根据可访问的 Slack 历史记录重建数据。

面向验证的行为

该模型会重新推导结论、验证假设并运行产物来收集证据,而不是仅依赖表层描述。

考虑成本的后训练

其后训练采用经过成本惩罚的奖励,并根据基础模型的成本—性能曲线进行调优,目标是在一次 RL 运行中提升各工作强度级别下的性能。

潜在使用场景

  • 常规代码变更

    对于简单修复或中等编码任务,可使用 medium 工作强度级别,适合优先考虑快速推进和较低推理成本的情况。

  • 复杂实现工作

    对于规模更大或不确定性更高、需要额外规划、代码库探索和验证的工程任务,可分配 high 或 max 工作强度。

  • 测试与回归工作

    让智能体在实现工作流中创建端到端测试,并检查回归问题或边界情况。

  • 受阻任务调查

    通过查找用户已授权的数据和工具范围内的替代路径,使用该模型调查受阻的任务。

  • 基于证据的调试

    要求智能体通过重新推导结论并运行相关产物来验证假设,而不是接受未经验证的解释。

Pros and Cons

Pros

  • 提供多个工作强度级别,可在不同成本与任务复杂度之间进行权衡。
  • 据报道,在所引用的 FrontierCode 1.1 Main 评测中,相较于 SWE-1.7,可减少探索轮次并降低平均成本。
  • 增加了侧重端到端测试、替代路径和基于证据验证的行为。
  • 可在 Devin Desktop 和 CLI 中使用,并已宣布将推出 Devin Web 和 Fusion 版本。

Cons

  • 现有来源未提供定价、套餐限制、集成、设置要求、安全细节或团队管理信息。
  • 基准测试结果会因任务和工作强度级别而异,因此概括性得分并不能确定其在每个软件项目中的表现。

FAQ

SWE-2 可在哪里使用?

SWE-2 可在 Devin Desktop 和 CLI 中使用,源文章称其正在推出 Devin Web 和 Fusion 版本。

什么是 SWE-2?

SWE-2 是一个从 Kimi K3 进行后训练的编码模型,面向多个推理工作强度级别下的智能软件工程任务。

SWE-2 的不同工作强度级别有何区别?

来源介绍了 medium、high 和 max 三种工作强度级别。medium 适用于简单和中等任务,可实现更高的成本效率;high 和 max 则会为复杂任务投入更多工作强度。

SWE-2 在效率方面与 SWE-1.7 相比如何?

在 FrontierCode 1.1 Main 评测中,根据源文章,SWE-2 medium 的得分高于 SWE-1.7,同时平均减少 58% 的轮次,平均成本降低 81%。

Quick Facts

类别
开发者工具
产品类型
智能编码模型
平台
Devin Desktop 和 CLI;已宣布将推出 Devin Web 和 Fusion 版本
工作强度级别
Medium、high 和 max
基础模型
Kimi K3,一款拥有 2.8T 参数的模型
FrontierCode 1.1 Main 得分
在所引用的基准测试中,SWE-2 的得分为 50.0%