Grok 4.6は長時間エージェント作業に強い新旗艦
xAI(X.AI LLC)は2026年8月12日、Grok 4.6を公開しました。Grok 4.5をベースに、長時間動き続けるエージェント処理と、より野心的なインタラクティブ・ビジュアル制作に焦点を当てたモデルです。
公式発表によると、調査・情報分析・コードベース横断の作業・アイデアを動くアプリに仕上げる作業を、多くのステップにわたって粘り強く続けられます。長いタスクでは、途中で自分の成果物をテスト・検証してから先へ進む挙動も増えたとされています。
API料金は入力$2.00・出力$6.00(100万トークンあたり)、コンテキストは500kトークン。発表当日からCursorとGrok Build、APIで使えます。
※ 用語:エージェント=指示を受けてから、ツール実行や修正を自律的に繰り返して作業を進めるAIの使い方です。
公式ベンチマークではGPT-5.6 Solと同点
9つのベンチマークを合成したAA Intelligence Indexは61で、GPT-5.6 Sol(61)と同点、Fable 5 Max(62)に1ポイント差、Grok 4.5(56)からは5ポイント上げています。

公式ページの評価表から主な数値を抜粋します(太字は公式表で各評価の最高値とされたもの)。
| 評価 | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
得意分野が偏っている点は正直に見ておきたいところです。知識労働系のGDPVal-AAでは首位の一方、DeepSWEやTerminal-Benchでは他社旗艦に差を付けられています。なお他社モデルのスコアは、各社の公表値をxAIがまとめたものです。
※ 用語:ベンチマーク=モデルの性能を共通の問題集で測って比較するテストのことです。
料金と提供状況・仕様
公式ドキュメントとあわせると、仕様は次のとおりです。
| 項目 | 内容 |
|---|---|
| 発表日 | 2026年8月12日 |
| モデルID | grok-4.6 |
| コンテキスト | 500kトークン |
| API料金 | 入力$2.00 / 出力$6.00(100万トークンあたり) |
| fast版 | 通常版の2倍の価格 |
| 知識カットオフ | 2026年2月1日 |
| 提供先 | Cursor、Grok Build、xAI API、OpenRouter・Vercel・Cloudflareなど |
発表から最初の1週間は、Grok BuildとCursorで含まれる利用量が2倍になるキャンペーンも案内されています。

※ 用語:知識カットオフ=モデルが学習データとして知っている情報の最終時点です。それ以降の出来事は、検索ツールなしでは答えられません。
個人開発でGrok 4.6を使えそうな場面
公式が押し出しているのは「大まかなプロダクトのアイデアを、動く最初のバージョンに変える」用途です。個人開発者なら次のような試し方が現実的です。
- Grok Buildで無料で触る — x.ai/buildからブラウザで試せます。まずはアプリの叩き台作りに
- CLIで手元のリポジトリに使う —
curl -fsSL https://x.ai/cli/install.sh | bashでインストールできます - APIで組み込む — 入力$2/出力$6なので、旗艦級モデルとしては小さく試しやすい価格です
新モデルを叩き台作りに使う流れは、Qwen3.8-Maxの記事で紹介したときと同じく「最初の一手を任せて、自分で仕上げる」のが失敗しにくいと感じます。
※ 用語:CLI=ターミナルに文字のコマンドを打ってソフトを操作する仕組みのことです。
個人的な見解と利用時の注意点
個人向けの見解
入力$2/出力$6は、最前線級のモデルとしては手を出しやすい水準だと感じています。特に「作業を投げてしばらく待つ」タイプの個人開発(リファクタリング、下調べ、プロトタイプ作り)とは相性が良さそうです。一方でTerminal-Benchの数値を見る限り、ターミナル操作が中心のタスクでは他モデルとの比較検証をおすすめします。
個人開発での安全確認
- 自分のコードや素材をAPIへ送る前に、入力データの取り扱い(学習への利用有無など)をxAIの利用規約・プライバシーポリシーで確認する
- ベンチマークは公式発表値です。本命の用途では、自分のタスクで小さく検証してから本採用する
- 「最初の1週間は利用量2倍」など期間限定の条件は、申し込み前に公式ページで最新情報を確認する
※ 用語:API=プログラムからモデルを呼び出すための窓口です。使ったトークン量に応じた従量課金で支払います。
まとめ
- Grok 4.6は2026年8月12日公開。長時間のエージェント作業と、アイデアを動くアプリへ変える用途に焦点を当てた新旗艦です
- AA Intelligence Index 61でGPT-5.6 Solと同点。ただしDeepSWEやTerminal-Benchでは他社旗艦が上で、得意分野には偏りがあります
- 料金は入力$2/出力$6・コンテキスト500k。Grok BuildやCursor、APIから今日すぐ試せます
※ 用語:旗艦(フラッグシップ)モデル=その開発元がいちばん高性能だと位置づける看板モデルのことです。







