多種推理工作量級別
SWE-2 支援 medium、high 與 max 工作量級別,可根據任務複雜度與成本考量,調整可用的推理工作量。
SWE-2 是 Cognition 的程式設計模型,用於代理式軟體工程工作。它旨在規劃並執行程式碼變更,同時在多種推理工作量級別之間平衡程式設計效能、推論成本與推出時間。
SWE-2 可在 Devin Desktop 與 CLI 中使用,來源文章也指出目前正陸續推出至 Devin Web 與 Fusion。Cognition 將 SWE-2 定位為軟體工作流程模型,適用於代理程式需要檢查程式碼庫、實作變更、撰寫測試並驗證成果的情境。
SWE-2 支援 medium、high 與 max 工作量級別,可根據任務複雜度與成本考量,調整可用的推理工作量。
模型會將探索集中在與任務相關的程式碼庫部分;在引用的評測中,這有助於它比 SWE-1.7 更早開始實作。
據報 SWE-2 會撰寫更多端對端測試,並在程式設計任務期間更可靠地檢查回歸問題與邊界案例。
當預期途徑受阻時,模型可以在使用者指定的界線內尋找其他路徑,包括在一個已報告的範例中,從可存取的 Slack 歷史紀錄重建資料。
模型會重新推導結論、驗證假設,並執行產出物以蒐集證據,而不只是依賴表面描述。
其後訓練採用經成本懲罰的獎勵,並根據基礎模型的成本效能曲線進行調整,目標是在單次 RL 執行中改善各工作量級別的效能。
對於直接的修正或中等程式設計任務,可使用 medium 工作量級別;這類任務重視快速進展與較低的推論成本。
對於較大型或較不確定的工程任務,可指派 high 或 max 工作量,以受益於額外的規劃、程式碼庫探索與驗證。
讓代理程式在實作工作流程中建立端對端測試,並檢查回歸問題或邊界案例。
使用模型調查受阻的任務,在使用者已授權的資料與工具範圍內尋找替代路徑。
要求代理程式透過重新推導結論並執行相關產出物來驗證假設,而不是接受未經驗證的解釋。
SWE-2 可在 Devin Desktop 與 CLI 中使用,來源文章指出目前正陸續推出至 Devin Web 與 Fusion。
SWE-2 是一款從 Kimi K3 進行後訓練的程式設計模型,專為支援多種推理工作量級別的代理式軟體工程任務而設計。
來源資料說明了 medium、high 與 max 三種工作量級別。Medium 定位為在簡單與中等任務上提供更具成本效益的效能,而 high 與 max 則會在複雜任務上投入更多工作量。
根據來源文章,在 FrontierCode 1.1 Main 評測中,SWE-2 medium 的得分高於 SWE-1.7,同時減少 58% 的回合數,平均成本也低 81%。
ByteAsk 是專為 C 與 C++ 打造的終端機優先 AI coding agent,先編輯儲存庫再用真實編譯器、除錯器、sanitizer 與測試驗證變更,並提供免費方案與付費方案。
Ghost 是一款終端機 AI 助手,可在命令列中聊天、產生程式碼並執行任務。內建免費模型,支援 Linux、macOS、Windows,且為開源工具。
Vi3ecode 是供 AI coding agents 使用的維護型開發環境,整合專案上下文、終端機、Git、記憶、流程與協作溝通,讓您在既有 agent 上順暢開發。
Lucid Train 是一款 local-first AI coding harness,可將 repository 程式碼轉成架構圖,並以圖作為 coding agents 的規格。提供桌面版與輕量 Rust CLI,支援本地模型或自有 API keys。
CreateOS Sandbox 是以 Firecracker micro-VM 執行程式與 agent 工作負載的隔離運算環境,支援私有網路、SDK、CLI 與 MCP 程式化控制。
hob 是一個獨立的 coding agents 工作區,整合 agent sessions、終端機、歷史紀錄與後續工作,並維持你既有的工具與供應商設定。適合想保有本機路由、歷史與工作區結構控制權的開發者。