多种推理工作强度级别
SWE-2 支持 medium、high 和 max 三种工作强度级别,可根据任务复杂度和成本考量匹配可用的推理工作强度。
SWE-2 是 Cognition 面向智能软件工程工作的编码模型。它旨在规划并执行代码变更,同时在多种推理工作强度级别之间平衡编码性能、推理成本和推出时间。
该模型可在 Devin Desktop 和 CLI 中使用,源文章还称其正在推出 Devin Web 和 Fusion 版本。Cognition 将 SWE-2 定位为面向软件工作流的模型:智能体需要检查代码库、实现变更、编写测试并验证最终工作成果。
SWE-2 支持 medium、high 和 max 三种工作强度级别,可根据任务复杂度和成本考量匹配可用的推理工作强度。
该模型会将探索重点放在代码库中与任务相关的部分;在所引用的评测中,这有助于其比 SWE-1.7 更早开始实现。
据报道,在编码任务中,SWE-2 会编写更多端到端测试,并更可靠地检查回归问题和边界情况。
当预期路径受阻时,该模型可以在用户声明的边界内寻找其他路径,包括在一个所报告的示例中,根据可访问的 Slack 历史记录重建数据。
该模型会重新推导结论、验证假设并运行产物来收集证据,而不是仅依赖表层描述。
其后训练采用经过成本惩罚的奖励,并根据基础模型的成本—性能曲线进行调优,目标是在一次 RL 运行中提升各工作强度级别下的性能。
对于简单修复或中等编码任务,可使用 medium 工作强度级别,适合优先考虑快速推进和较低推理成本的情况。
对于规模更大或不确定性更高、需要额外规划、代码库探索和验证的工程任务,可分配 high 或 max 工作强度。
让智能体在实现工作流中创建端到端测试,并检查回归问题或边界情况。
通过查找用户已授权的数据和工具范围内的替代路径,使用该模型调查受阻的任务。
要求智能体通过重新推导结论并运行相关产物来验证假设,而不是接受未经验证的解释。
SWE-2 可在 Devin Desktop 和 CLI 中使用,源文章称其正在推出 Devin Web 和 Fusion 版本。
SWE-2 是一个从 Kimi K3 进行后训练的编码模型,面向多个推理工作强度级别下的智能软件工程任务。
来源介绍了 medium、high 和 max 三种工作强度级别。medium 适用于简单和中等任务,可实现更高的成本效率;high 和 max 则会为复杂任务投入更多工作强度。
在 FrontierCode 1.1 Main 评测中,根据源文章,SWE-2 medium 的得分高于 SWE-1.7,同时平均减少 58% 的轮次,平均成本降低 81%。
ByteAsk 是面向 C 和 C++ 的终端优先 AI 编码 agent,可直接编辑仓库,并在展示 diff 前用真实编译器、调试器、sanitizers 和测试验证修改。提供免费版与付费方案。
Ghost 是一款基于终端的 AI 助手,可在命令行中聊天、生成代码并运行任务。内置免费模型,支持 Linux、macOS 和 Windows,且为开源项目。
Vi3ecode 是面向 AI 编程代理的持续开发环境,保留项目上下文、终端、Git、记忆、流程、评审与沟通,围绕你正在使用的 agent 协同工作。
Lucid Train 是一款本地优先的 AI 编码工具,可将仓库代码生成架构图,并把图作为编码代理的规格说明。支持桌面应用与轻量 Rust CLI,可运行本地模型或使用自有 API key。
CreateOS Sandbox 是基于 Firecracker 微型虚拟机的隔离计算环境,用于运行代码和 agent 工作负载,支持私有网络、SDK、CLI 和 MCP 程序化控制。
hob 是面向编码 agent 的独立工作区,可将 agent 会话、终端、历史记录和后续工作围绕你已在用的工具与提供商有序管理,适合重视本地路由、历史和工作区结构控制的开发者。