SWE-2 icon

SWE-2

SWE-2 是 Cognition 的代理式程式設計模型,可規劃、實作、測試與驗證軟體變更,支援多種工作量級別,並透過 Devin Desktop 與 CLI 提供。

SWE-2

SWE-2 概覽

SWE-2 是 Cognition 的程式設計模型,用於代理式軟體工程工作。它旨在規劃並執行程式碼變更,同時在多種推理工作量級別之間平衡程式設計效能、推論成本與推出時間。

SWE-2 可在 Devin Desktop 與 CLI 中使用,來源文章也指出目前正陸續推出至 Devin Web 與 Fusion。Cognition 將 SWE-2 定位為軟體工作流程模型,適用於代理程式需要檢查程式碼庫、實作變更、撰寫測試並驗證成果的情境。

主要功能

多種推理工作量級別

SWE-2 支援 medium、high 與 max 工作量級別,可根據任務複雜度與成本考量,調整可用的推理工作量。

聚焦程式碼庫探索

模型會將探索集中在與任務相關的程式碼庫部分;在引用的評測中,這有助於它比 SWE-1.7 更早開始實作。

更廣泛的測試涵蓋範圍

據報 SWE-2 會撰寫更多端對端測試,並在程式設計任務期間更可靠地檢查回歸問題與邊界案例。

靈活執行任務

當預期途徑受阻時,模型可以在使用者指定的界線內尋找其他路徑,包括在一個已報告的範例中,從可存取的 Slack 歷史紀錄重建資料。

以驗證為導向的行為

模型會重新推導結論、驗證假設,並執行產出物以蒐集證據,而不只是依賴表面描述。

考量成本的後訓練

其後訓練採用經成本懲罰的獎勵,並根據基礎模型的成本效能曲線進行調整,目標是在單次 RL 執行中改善各工作量級別的效能。

潛在使用情境

  • 例行程式碼變更

    對於直接的修正或中等程式設計任務,可使用 medium 工作量級別;這類任務重視快速進展與較低的推論成本。

  • 複雜實作工作

    對於較大型或較不確定的工程任務,可指派 high 或 max 工作量,以受益於額外的規劃、程式碼庫探索與驗證。

  • 測試與回歸工作

    讓代理程式在實作工作流程中建立端對端測試,並檢查回歸問題或邊界案例。

  • 受阻調查

    使用模型調查受阻的任務,在使用者已授權的資料與工具範圍內尋找替代路徑。

  • 以證據為基礎的偵錯

    要求代理程式透過重新推導結論並執行相關產出物來驗證假設,而不是接受未經驗證的解釋。

Pros and Cons

Pros

  • 提供多種工作量級別,以因應不同的成本與任務複雜度取捨。
  • 據報在引用的 FrontierCode 1.1 Main 評測中,相較於 SWE-1.7 可減少探索回合數與平均成本。
  • 加入聚焦於端對端測試、替代路徑及以證據為基礎之驗證的行為。
  • 可在 Devin Desktop 與 CLI 上使用,並據稱將推出至 Devin Web 與 Fusion。

Cons

  • 目前可取得的來源未提供定價、方案限制、整合、設定需求、安全性詳細資訊或團隊管理資訊。
  • 基準測試結果會因任務與工作量級別而異,因此標題所示的分數無法代表其在每個軟體專案中的效能。

FAQ

SWE-2 可在哪些平台使用?

SWE-2 可在 Devin Desktop 與 CLI 中使用,來源文章指出目前正陸續推出至 Devin Web 與 Fusion。

什麼是 SWE-2?

SWE-2 是一款從 Kimi K3 進行後訓練的程式設計模型,專為支援多種推理工作量級別的代理式軟體工程任務而設計。

SWE-2 的工作量級別有何不同?

來源資料說明了 medium、high 與 max 三種工作量級別。Medium 定位為在簡單與中等任務上提供更具成本效益的效能,而 high 與 max 則會在複雜任務上投入更多工作量。

SWE-2 與 SWE-1.7 的效率相比如何?

根據來源文章,在 FrontierCode 1.1 Main 評測中,SWE-2 medium 的得分高於 SWE-1.7,同時減少 58% 的回合數,平均成本也低 81%。

Quick Facts

類別
開發者工具
產品類型
代理式程式設計模型
平台
Devin Desktop 與 CLI;據稱將推出至 Devin Web 與 Fusion
工作量級別
Medium、high 與 max
基礎模型
Kimi K3,一款具有 2.8T 參數的模型
FrontierCode 1.1 Main 分數
SWE-2 在引用基準測試中的分數為 50.0%