SWE-2 icon

SWE-2

SWE-2は、ソフトウェア変更の計画・実装・テスト・検証に対応するCognitionのエージェント型コーディングモデルです。複数の推論レベルを備え、Devin DesktopとCLIで利用でき、Devin WebとFusionにも順次展開予定です。

SWE-2

SWE-2の概要

SWE-2は、エージェント型のソフトウェアエンジニアリング作業向けのCognitionのコーディングモデルです。複数の推論レベルにわたり、コーディング性能、推論コスト、展開時間のバランスを取りながら、コード変更の計画と実行を行うよう設計されています。

このモデルはDevin DesktopとCLIで利用でき、出典記事ではDevin WebとFusionへの展開が進められているとも説明されています。CognitionはSWE-2を、エージェントがコードベースを調査し、変更を実装し、テストを記述し、成果物を検証する必要があるソフトウェアワークフロー向けのモデルとして位置付けています。

主な機能

複数の推論レベル

SWE-2はmedium、high、maxの推論レベルに対応し、タスクの複雑さやコスト面の考慮事項に応じて、利用する推論量を調整できます。

コードベースに集中した探索

モデルはタスクに関係するコードベースの部分に探索範囲を絞ります。引用された評価では、SWE-1.7より早く実装を開始するのに役立っています。

より広範なテストカバレッジ

SWE-2は、コーディングタスク中により多くのエンドツーエンドテストを作成し、回帰やエッジケースをより確実に確認すると報告されています。

柔軟なタスク実行

想定していた経路が妨げられた場合、モデルはユーザーが示した範囲内で別の方法を探せます。報告された例の一つでは、アクセス可能なSlackの履歴からデータを再構成しています。

検証を重視した動作

モデルは結論を再導出し、仮説を検証し、表面的な説明だけに頼るのではなく、成果物を実行して証拠を集めます。

コストを考慮した追加学習

追加学習では、ベースモデルのコストと性能の曲線に合わせて調整した、コストを考慮した報酬を使用しています。1回のRL実行で複数の推論レベルにおける性能を向上させることを目的としています。

想定される用途

  • 定常的なコード変更

    迅速な進捗と低い推論コストを優先する、単純な修正や中程度のコーディングタスクにはmediumの推論レベルを使用します。

  • 複雑な実装作業

    追加の計画、コードベースの探索、検証が有効な、規模が大きいタスクや不確実性の高いエンジニアリングタスクには、highまたはmaxを割り当てます。

  • テストと回帰対応

    実装ワークフローの一環として、エージェントにエンドツーエンドテストを作成させ、回帰やエッジケースを確認させます。

  • 行き詰まった調査

    ユーザーが許可したデータとツールの範囲内で別の経路を探し、行き詰まったタスクを調査するためにモデルを使用します。

  • 証拠に基づくデバッグ

    未検証の説明を受け入れるのではなく、結論を再導出して関連する成果物を実行することで仮説を検証するよう、エージェントに指示します。

Pros and Cons

Pros

  • コストとタスクの複雑さのトレードオフに応じて選べる複数の推論レベルを提供します。
  • 引用されたFrontierCode 1.1 Mainの評価では、SWE-1.7と比べて探索のターン数と平均コストを削減したと報告されています。
  • エンドツーエンドテスト、代替経路、証拠に基づく検証に重点を置いた動作が追加されています。
  • Devin DesktopとCLIで利用でき、Devin WebとFusionへの展開も予定されていると説明されています。

Cons

  • 利用可能な出典には、料金、プランの制限、インテグレーション、セットアップ要件、セキュリティの詳細、チーム管理に関する情報が記載されていません。
  • ベンチマーク結果はタスクと推論レベルによって異なるため、全てのソフトウェアプロジェクトでの性能を代表するものではありません。

FAQ

SWE-2はどこで利用できますか?

SWE-2はDevin DesktopとCLIで利用でき、出典記事ではDevin WebとFusionへの展開が進められていると説明されています。

SWE-2とは何ですか?

SWE-2はKimi K3をベースに追加学習されたコーディングモデルで、複数の推論レベルに対応するエージェント型ソフトウェアエンジニアリングタスク向けに設計されています。

SWE-2の推論レベルにはどのような違いがありますか?

出典では、medium、high、maxの推論レベルが説明されています。mediumは単純なタスクや中程度のタスクで、よりコスト効率の高い性能を発揮する位置付けです。一方、highとmaxは複雑なタスクにより多くの推論を費やします。

効率の面でSWE-2はSWE-1.7とどのように比較されますか?

出典記事によると、FrontierCode 1.1 MainでSWE-2 mediumはSWE-1.7より高いスコアを記録し、ターン数は58%少なく、平均コストは81%低くなりました。

Quick Facts

カテゴリー
開発者向けツール
製品タイプ
エージェント型コーディングモデル
プラットフォーム
Devin DesktopとCLI。Devin WebとFusionへの展開予定
推論レベル
Medium、high、max
ベースモデル
Kimi K3、2.8Tパラメータモデル
FrontierCode 1.1 Mainスコア
引用されたベンチマークにおけるSWE-2のスコアは50.0%

SWE-2の代替品

ByteAsk icon

ByteAsk

ByteAskは、C/C++向けのターミナル起点AIコーディングエージェント。リポジトリを編集し、コンパイラやデバッガ、サニタイザ、テストで変更を検証してから差分を表示。無料枠あり。

Ghost icon

Ghost

Ghostは、チャット、コード生成、コマンドラインでのタスク実行に対応したターミナル向けAIアシスタントです。無料モデルを同梱し、Linux、macOS、Windowsで使えます。オープンソースです。

Vi3ecode icon

Vi3ecode

Vi3ecodeは、AIコーディングエージェント向けの開発環境です。プロジェクト文脈、ターミナル、Git、メモリ、フロー、レビュー、コミュニケーションを連携させます。

Lucid Train icon

Lucid Train

Lucid Trainは、リポジトリのコードからアーキテクチャ図を生成し、その図をコーディングエージェント向けの仕様として使うローカルファーストのAIコーディング支援です。デスクトップアプリと軽量なRust CLIで利用でき、ローカルモデルや自分のAPIキーにも対応します。

CreateOS Sandbox icon

CreateOS Sandbox

CreateOS Sandboxは、FirecrackerマイクロVM上でコードやエージェントのワークロードを実行できる分離型コンピュート環境です。SDK、CLI、MCPで制御可能。

hob icon

hob

hobは、エージェントのセッション、ターミナル、履歴、後続作業を、既存のツールやプロバイダーに合わせて整理できる独立したコーディングエージェント向けワークスペース。ローカルでの制御を重視する開発者に最適。