
【2026年】SWE-1.7完全ガイド!Devin搭載の最強AIエンジニアが1000トークンでOpus超え
「Opus 4.8並みの性能を1/3以下のコストで出せるコーディングモデルってある?」
SWE-1.7は、Opus 4.8に匹敵するコーディング性能を持ちながら、コストは1/3以下、生成速度は1000トークン/秒の最強コーディング特化モデルです。
2026年7月9日、Cognition(AIエンジニア「Devin」の開発元)が SWE-1.7 を正式リリースしました。
SWE-1.7は Kimi K2.7 をベースにCognition独自の強化学習(RL)を大規模適用したモデルで、FrontierCode 1.1で42.3% を記録。これはOpus 4.8(46.5%)にわずか4ポイント差という驚異的なスコアです。
しかも Cerebras上で1000トークン/秒 という爆速推論を実現し、コストも競合より大幅に低く抑えられています。
SWE-1.7とは?3行で
| 項目 | 内容 |
|---|---|
| 開発元 | Cognition(AIコーディングエージェント「Devin」の会社) |
| ベースモデル | Kimi K2.7(MoEアーキテクチャ) |
| トレーニング手法 | Cognition独自の強化学習(RL)パイプライン |
| 推論速度 | 1000トークン/秒(Cerebrasハードウェア) |
| 利用方法 | DevinのWeb / Desktop / CLIで利用可能 |
| 料金 | Devin無料プランで体験可能、Pro $20/月〜 |
| リリース日 | 2026年7月9日 |
ベンチマーク比較:Opus 4.8にどこまで迫ったか
Cognitionが公開したベンチマーク結果がこちら。コーディング特化モデルとして、最前線に立っていることがわかります。
主要コーディングベンチマーク
| モデル | FrontierCode 1.1 Main | Terminal-Bench 2.1 | SWE-Bench Multilingual |
|---|---|---|---|
| Opus 4.8 | 46.5% | 86.9% | 84.4% |
| GPT-5.5 | 43.0% | 84.2% | 76.8% |
| ⚡ SWE-1.7 | 42.3% | 81.5% | 77.8% |
| Opus 4.7 | 38.5% | 83.0% | 80.5% |
| Kimi K2.7 Code(ベース) | 30.1% | 72.7% | 73.5% |
| GLM-5.2 | 24.5% | 81.0% | 74.5% |
| Composer 2.5 | 25.6% | 76.0% | 71.6% |
ハイライト
🔹 FrontierCode 1.1 Main(Cognition独自の高品質コード評価) SWE-1.7は42.3%で、GPT-5.5(43.0%)とほぼ互角。Opus 4.8(46.5%)にも肉薄。ベースのKimi K2.7 Code(30.1%)から+12.2ポイントの大幅向上を達成しています。
🔹 Terminal-Bench 2.1(実 CLI タスク) 81.5%でトップモデルと遜色なし。実用的なコマンドライン操作ではフロンティアモデルと同等と言えます。
🔹 SWE-Bench Multilingual(多言語ソフトウェアエンジニアリング) 77.8%でGPT-5.5(76.8%)を上回る結果。多言語対応ではGPT-5.5より優れています。
SWE-1.7の真の価値:コストパフォーマンス
Cognitionのコスト対スコアグラフによると、SWE-1.7は1ロールアウトあたりのコストがOpus 4.8の約1/3〜1/4。同じFrontierCodeスコア帯では最もコストパフォーマンスに優れたモデルです。
料金比較:コスパ最強を数字で検証
Devin(SWE-1.7搭載)の料金プランは無料プランから用意されています。
| プラン | 料金 | 主な内容 |
|---|---|---|
| Free | $0 | SWE-1.7体験可能、制限あり |
| Pro | $20/月 | SWE-1.7無制限、通常の開発用途 |
| Max | $200/月 | 優先アクセス・高速キュー |
| Teams | $80/月 + $40/ユーザー | チーム管理・一括請求 |
| Enterprise | カスタム | VPCデプロイ・専用サポート |
競合モデルとのコスト比較(100万トークンあたり)
| モデル | 入力(1Mトークン) | 出力(1Mトークン) | 速度 |
|---|---|---|---|
| SWE-1.7(Devin経由) | サブスク内包 | サブスク内包 | 1000 tok/s |
| DeepSeek V4 Flash | $0.15 | $0.60 | 〜200 tok/s |
| Opus 4.8 | $5 | $25 | 〜60 tok/s |
| GPT-5.5 | $5 | $30 | 〜80 tok/s |
| Fable 5 | $10 | $50 | 〜40 tok/s |
| Grok 4.5 | $2 | $6 | 80 tok/s |
ただし注意:SWE-1.7は単体のAPIモデルとしては提供されておらず、Devinのサブスクリプション内で利用する形です。Devinのエージェントプラットフォーム全体のコストパフォーマンスとして評価する必要があります。
SWE-1.7はどうやって作られたのか?
Cognitionのブログ記事では、SWE-1.7のトレーニングに関する4つの重要な革新が説明されています。
① エントロピーを維持し訓練を安定化
大規模な強化学習では「エントロピー崩壊」(モデルが探索をやめて報酬が頭打ちになる現象)が問題になります。
SWE-1.7ではtop-pサンプリングとサンプリング分布リプレイを組み合わせることで、訓練中のエントロピーを一定に保ち、モデルが探索を続けられるようにしました。
② 3大陸にまたがるマルチクラスター訓練
RLの構造を活かし、トレーナーは1つのクラスター、推論エンジンは別のクラスターに分離。3大陸・4データセンターにまたがって訓練を実行しました。
重みの更新は圧縮してクラウドストレージ経由で配信。1兆パラメータモデルの更新が1〜2分で完了します。ハードウェア障害が発生しても、自動的に縮退して訓練を継続できるフォールトトレランスを実装。
③ 高品質データパイプライン
自動実行テストで各タスクを検証し、学習信号の低いタスクをフィルタリング。カンニング(reward-hacking)を防止する仕組みも徹底的に組み込みました。
④ 自己圧縮(Self-Compaction)で長時間タスクに対応
コンテキスト限界に近づくと、モデル自身が作業状態を要約し、その要約から再開する仕組み。これにより最大6時間の連続タスクを実行可能に。
さらに、交互長さペナルティ(通常フェーズと予算フェーズを交互に配置)で、簡単なタスクでは短く、難しいタスクでは長く考える動作を学習させています。
SWE-1.7のモデル行動の特徴
Cognitionの分析によると、SWE-1.7には以下の特徴的な行動が見られます。
徹底的なコードベース探索
バグ修正のタスクで、SWE-1.7はKimi K2.7と比べてファイル読み込み・検索・ツール呼び出しの回数が大幅に増加。根本原因を徹底的に調査し、エッジケースや敵対的入力を考慮した修正を行います。
凝縮された思考(Condensed Chain-of-Thought)
Kimi K2.7と比べて、SWE-1.7の思考には機能語の割合が低く、1文あたりの単語数が約半分。無駄のない効率的な推論スタイルを身につけています。
実験による検証
曖昧な仕様に対して、Pythonスクリプトを書いて実際に動作確認してから実装する傾向があります。「推測で実装」ではなく「実験で確認」する慎重さ。
やや過剰な変更範囲(トレードオフ)
より深く考える分、必要以上にファイルを変更したり、余分なテストを追加したりする傾向も。これは業界全体の傾向で、今後の改善ポイントとされています。
DevinでSWE-1.7を使う方法
方法1:Devin Web(ブラウザ)
- devin.ai にアクセス
- 無料アカウントを作成
- SWE-1.7がデフォルトで選択されているので、タスクを入力するだけ
方法2:Devin Desktop
- Devinのデスクトップアプリをダウンロード
- ログインしてタスクを開始
- Web版と同じ操作感で、ローカルファイルへのアクセスも可能
方法3:Devin CLI(最も本格的)
# 1. Devin CLIをインストール
npm install -g @cognition/devin-cli
# 2. APIキーを設定
export COGNITION_API_KEY="sk-cog-your-api-key"
# 3. プロジェクトディレクトリで初期化
cd /path/to/your/project
devin init
# 4. タスクを依頼
devin run "バグ修正:ログインフォームのバリデーションエラーを修正して"
おすすめの使い方
| シーン | おすすめインターフェース | 理由 |
|---|---|---|
| ちょっとしたバグ修正 | CLI | コードベースを理解した上でピンポイント修正 |
| 新機能の実装 | Desktop | ファイル編集の結果をリアルタイム確認 |
| コードレビュー | Web | どこからでもアクセス可能 |
| リファクタリング | CLI | 長時間タスクはCLIでバックグラウンド実行 |
| CI/CD自動修正 | API / CLI | 自動パイプラインに組み込み可能 |
DevinがMac VMに対応:iOSアプリのビルドからTestFlight配布まで(2026年9月15日追加)
Cognitionは2026年9月15日、Devinが自分のmacOS仮想マシン(Mac VM)を持てるようになったと発表しました。DevinのVMはこれまでLinuxが基本で、iOSアプリはMacでしかビルドできないため、Apple系アプリは自動化の空白地帯でした。今回そこが埋まり、Windows PC・Androidエミュレータに続く3つ目のプラットフォーム対応が揃ったことになります。
発表で挙げられている追加点は3つです。
- Mac VMとiOSシミュレータの上でアプリをビルド・テストできる
- テスト中の画面録画をSlackに送れる
- TestFlightのリンクを送れるので、実機ですぐ試せる
起動方法は3通り
| 起動方法 | 指定の仕方 | 向いている場面 |
|---|---|---|
| blueprint | リポジトリ設定に runs-on: macos | 特定リポジトリは常にMac VMで回す |
| Slack | メッセージに !mac | 会話から単発でMac VMにする |
| API | セッション作成時に platform: "macos" | スケジュールや自動化から指定する |
Dedicated SaaSの契約では、組織にmacOSの権限(entitlement)を付ける必要があるため、アカウント担当への依頼が要ります。
Linuxセッションとの違い
| 項目 | Linux(既定) | macOS |
|---|---|---|
| ホームディレクトリ | /home/ubuntu | /Users/devin |
| リポジトリの場所 | ~/repos/<リポジトリ名> | /Users/devin/repos/<リポジトリ名> |
| シェル | bash | zsh |
| パッケージ管理 | apt-get | brew(/opt/homebrew) |
| アップロードしたファイル | /home/ubuntu/.files/ | /Users/devin/.files/ |
BSD系のユーザーランドなので、sed -i は引数が必要(sed -i '')になる点も公式が明記しています。
最初から入っているもの
Xcode 26(既定・/Applications/Xcode.app)とXcode 27のRCが同居し、iOS 26とiOS 27のシミュレータ(それぞれiPhone端末が設定済み)が使えます。加えてxcodebuild・xcrun・simctl・Swift・Metalツールチェーン、Homebrew、Node.js・Python・Java・Rust、Chromeが入った状態でセッションが始まります。
何が自動で回るのか
- DevinはiOSシミュレータを直接起動して操作できます(simctlで起動・インストール・実行)。セッション画面の「iOS Simulator」タブで、タップしている様子をリアルタイムに見られます
- Computer UseがmacOSでも動きます。ショートカットは⌘C・⌘V・⌘TabなどMacの流儀で、macOSネイティブアプリのテストもできます
- 画面録画は自動で処理され(待ち時間を圧縮・重要な操作を強調)、SlackまたはWebアプリに添付で届きます。レビュー担当はPRをマージする前に、実際に動く様子を確認できます
- TestFlightへの配布は、App Store ConnectのAPIキーをsecretとして渡す手順が公式に用意されています
料金はLinuxと同一(当面)
macOSセッションの消費量はLinux(Ubuntu)セッションと同一で、macOS割増はありません。ただし公式が「プロモーション価格であり変更されうる」と明記しています。比較として、WindowsセッションはLinux比で約9%増です。Devin本体のプランはFree / Pro 月20ドル / Max 月200ドル / Teams 月80ドル〜(200人まで)で、大規模な組織はEnterpriseになります。
公式が明記している制限
| 制限 | 内容 |
|---|---|
| コンテナ | 入れ子の仮想化が使えずソフトウェアエミュレーション動作。CPUはネイティブ比15〜25倍遅く、起動にも数秒かかる。lintやパッケージング向きで、コンパイルには不向き |
| 実機テスト | USBパススルーがないため、ビルドとテストはシミュレータのみ。実機のiPhoneやiPadでは動かせない |
| Xcodeの追加 | 別バージョンを入れるにはApple IDの資格情報が必要で、ダウンロードも巨大。同梱版を DEVELOPER_DIR で切り替えるのが推奨 |
| 性能計測 | VM内の時間計測は実機の性能指標にはならない |
| スリープ復帰 | ディスクの内容(導入済みツール・ビルドキャッシュ)は残るが、起動中のプロセス(開発サーバー・シミュレータ)は再起動が必要 |
内容はCognitionの公式発表と公式ドキュメントによるもので、当サイトでMac VMの実機検証はしていません。Mac VMのCPU・メモリのスペックは公開資料では確認できませんでした。
他のモデルとの比較:どれを選ぶべきか?
| モデル | 得意分野 | 速度 | こんな人に |
|---|---|---|---|
| SWE-1.7(Devin) | コーディング特化・長時間タスク | 1000 tok/s | Devinユーザー・本格的なコード修正 |
| Opus 4.8 | 汎用性能最強クラス | 〜60 tok/s | 最高品質が必要なすべてのタスク |
| Grok 4.5 | Opus級の性能/低コスト | 80 tok/s | コスパ重視の汎用タスク |
| DeepSeek V4 Flash | 最安・軽量タスク | 〜200 tok/s | 予算最優先・単純タスク |
| GPT-5.5 | バランス型ハイエンド | 〜80 tok/s | 汎用的な高性能モデル |
| Fable 5 | 最高精度 | 〜40 tok/s | 品質最優先・コスト無制限 |
まとめ
SWE-1.7は「コーディングに特化した最強のコスパモデル」です。
- ✅ Opus 4.8に肉薄するコーディング性能(FrontierCode 42.3%)
- ✅ Cerebrasで1000トークン/秒の爆速推論
- ✅ Devinの無料プランで体験可能
- ✅ 長時間タスク(最大6時間)対応の自己圧縮技術
- ✅ コストパフォーマンスは競合比3〜4倍
注意点として、SWE-1.7は単体のAPIとしてではなく、Devinプラットフォーム内で利用するモデルです。 Devinのエージェント機能(自律的なコード修正・テスト・デプロイ)と組み合わせて真価を発揮します。
👉 SWE-1.7公式発表: cognition.com/blog/swe-1-7 👉 Devinで試す: devin.ai 👉 Devin Pricing: devin.ai/pricing 👉 元のXポスト(Cognition公式): @cognition
合わせて読みたい
- 【2026年】DS4Flash(DeepSeek V4 Flash)をローカルで動かす完全ガイド!96〜128GB VRAMを最大活用
- 【2026年】Agents-A1(35B MoE)とは?小さなパラメータでここまでできる驚きのエージェント特化モデルを徹底分析
- 【2026年】Qwen3.6-35B Genesis Hermes GGUF完全ガイド!検閲なし・マルチモーダルMoEをローカルPCで動かす方法
- 【2026年】AIモデルAPI料金完全比較!ChatGPT vs Claude vs Gemini vs DeepSeek vs MiMo
- 【2026年】Xiaomi MiMo API完全解説!DeepSeekと同価格のマルチモーダルAIモデル
この記事のまとめ
SWE-1.7は、Opus 4.8に匹敵するコーディング性能を持ちながら、コストは1/3以下、生成速度は1000トークン/秒の最強コーディング特化モデルです。
この記事をシェアする
関連記事

2026年6月26日
【2026年】Ornith-1.0完全解説!Claude Opus超え・MITライセンスの最強AIコーディングモデル

2026年9月2日
【2026年】Meta Muse Spark 1.3完全解説!コーディングAIの新星がDeepSWE 75.4でOpus 5超え

2026年9月2日
【2026年】Gemini 3.8 Flash完全解説!Googleの最強コーディングモデルがHLE 54.9%でOpus 5超え・サイバー特化版も登場

2026年7月8日
【2026年】Grok 4.5完全解説!Opus級の性能でコストは1/4、xAIの新モデルをDeepSeek V4と徹底比較

2026年7月21日
【2026年】Laguna S 2.1 徹底解説!118B MoEで1Mトークン・最大25倍のモデルを超えるオープンウェイトAIコーディングモデルの実力(ベンチマーク完全比較)

2026年9月7日
【2026年9月】Meta「Muse Spark 1.3 max」が一般公開!ベンチマークでOpus 5と同率1位のコーディング性能