目次
Grok 4.7とは、SpaceXAI(旧xAI)が2026年9月21日に公開した、コーディングと知識労働に向けた最新の大規模言語モデルです。 料金は前世代のGrok 4.6と同じ100万トークンあたり入力2ドル・出力6ドルからで、発表当日からCursor・Grok Build・Grok API・GitHub Copilotで使えます。この記事では、SpaceXAIの発表ページとGitHubの変更履歴を一次情報として、料金・公式ベンチマークの読み方・Grok 4.6との違い・公表されていないことを整理します。
1回あたりの入力・出力トークン数と月間の利用回数を入れると、モデル別の月額を円建てで比べられます。
単価は契約先の料金に合わせて変更できます。Grokの月額プラン料金は対象外です。
Grok 4.7とは何か — 「長く走る仕事」に寄せた更新
公式が前面に出しているのは、瞬間的な賢さではなく通しでやり切る力です。発表ページは「難しい仕事により長く取り組み、自分の作業をより注意深く確認する」と説明し、学習についても「数時間かかる問題に重みを置いた、より難しい課題の組み合わせで、強化学習をより長く回した」と書いています。
つまり狙いは、1往復の質疑応答の精度ではなく、調査・実装・検証までを人が見ていない間に進める使い方です。大規模言語モデルをAIエージェントとして動かす前提での更新、と読むのが素直です。GitHubの告知も「エージェント的なコーディングと、複数ステップにまたがる複雑なワークフロー向けに設計されている」という表現を使っています。
もう一つ、同社の常駐型エージェント製品との結びつきが明記されました。公式は「Grok Botの実行環境(harness)をネイティブに理解するようGrok 4.7を学習させた」としており、対話的な作業と一般的な知識労働が得意になった理由として挙げています。製品としてのGrok Botの仕組みや承認設計はGrok Botとはにまとめています。
料金はいくらか — Grok 4.6と同額のまま据え置き
公式の表記は「100万トークンあたり入力2ドル・出力6ドルから」で、Grok 4.6から変わっていません。あわせて、出力速度が2倍の高速版(fast variant)が2倍の単価で提供されると書かれています。
公式の比較表に載っている4モデルの単価は次のとおりです(いずれも100万トークンあたり・米ドル)。
| モデル(公式表記の推論設定) | 入力 | 出力 |
|---|---|---|
| Grok 4.7(xHigh) | 2 | 6 |
| Grok 4.6(High) | 2 | 6 |
| GPT-5.6 Sol(Max) | 4 | 20 |
| Claude Fable 5.1(Max) | 10 | 50 |
発表ページの見出しには「2倍の速さ、同等モデルの半額」という宣伝文句が置かれていますが、何を「同等モデル」とするかは公式に明示されていません。表の数字で言えば、入力単価はGPT-5.6 Solのちょうど半額、出力単価は約3分の1です。単価表だけで判断せず、同じ仕事を終えるまでに消費したトークン量で比べてください。推論に長く時間をかける設定ほど出力トークンは増えるため、単価が安くても1件あたりの費用は逆転しうるからです。実際の月額は生成AI API料金計算ツールに自社の利用量を入れると出せます。トークン量が分からない段階ならトークン数カウンターで概算してから当ててください。単価の下げ方の定石は生成AI APIのコスト管理入門にまとめています。
公式ベンチマークをどう読むか
発表ページには7項目の比較表が載っています。すべてSpaceXAI自身の報告値で、比較対象も推論設定も同社が選んだものである点を先に押さえてください。
| ベンチマーク(内容) | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0(ソフトウェア開発) | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1(ソフトウェア開発) | 71.0%※ | 65.2% | 72.7% | 70.0% |
| EEBench(電気工学) | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1(数時間のオフィス作業) | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0(数時間の端末作業) | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark(法務作業) | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional(臨床推論) | 56.7% | 48.5% | 60.5% | 62.1% |
※公式表の注記により、DeepSWEのGrok 4.7の値だけ「high effort」設定での測定。
読み取れることは3つです。
- GPT-5.6 Solには7項目中5勝2敗。負けたのはDeepSWEとHealthBench Professionalで、勝った5項目のうちEEBench(64.0%対39.4%)とHarvey Legal(19.6%対2.5%)は差が大きい
- Claude Fable 5.1には3勝4敗。とくにTerminal-Bench 4.0は38.0%対57.9%で約20ポイント離されている。数時間走らせる端末作業を任せたいなら、単価の安さだけで選ぶ理由にはならない
- 推論設定が揃っていない。Grok 4.7はxHigh、Grok 4.6はHigh、GPT-5.6 SolとFable 5.1はMaxでの測定値が並んでいる。設定を変えれば消費トークンも結果も動くため、この表は「横並びの公平な勝敗表」ではなく「各社の上位設定同士の参考値」として読む
文書・資料づくりについては、別途GDPvalという指標のElo値が公開されています。Fable 5.1(max)が1,735、Grok 4.7(xhigh)が1,695、Grok 4.6(high)が1,605、GPT-6 Astra(max)が1,542で、Grok 4.6からは90ポイント伸び、Fable 5.1には40ポイント届いていないという位置関係です。この4つの中で最も低いのはGPT-6 Astraの1,542で、Grok 4.7はこれを153ポイント上回っています。ただしこの1点をもって「AstraよりGrok 4.7が強い」と一般化するのは危険で、指標も推論設定も固定された1つの測定結果として扱うのが安全です。
Grok 4.6から何が変わったのか
公式が変更点として挙げているのは次の4点です。憶測を足さず、書かれていることだけを並べます。
| 項目 | 公式の説明 |
|---|---|
| ベースモデル | Grok 4.6より大きい、新しいベースモデルを使用 |
| 学習 | 数時間かかる問題に重みを置いた、より難しい課題の組み合わせで強化学習をより長く実施 |
| 得意になったこと | 自分の作業の検証、長い文脈の管理、文書とプレゼン資料の作成 |
| 実行環境 | Grok Botのharnessをネイティブに理解するよう学習 |
価格と速度はGrok 4.6と同じと公式が明記しているため、4.6を使っている場合、切り替えのコスト面の障壁はほぼありません。判断材料になるのは、上のベンチマークで差が大きかった領域(電気工学・法務・長時間の端末作業)が自社の用途に重なるかどうかです。
どこで使えるか
公式の記載を経路ごとに整理すると次のようになります。
| 経路 | 公式の記載 |
|---|---|
| Cursor | 発表当日から利用可 |
| Grok Build | 発表当日から利用可。x.ai/build から無料で開始できると案内 |
| Grok API | 提供あり |
| 他社のコーディング環境・モデルルーター・クラウド基盤 | 提供あり(個別のサービス名は発表ページに記載なし) |
| GitHub Copilot | 同日告知。Pro・Pro+・Max・Business・Enterpriseに順次展開 |
GitHub Copilot側は条件がやや細かく、押さえておく価値があります。モデル選択欄に出るのはVisual Studio Code・Visual Studio・Copilot CLI・Copilotクラウドエージェント・GitHub Copilotアプリ・JetBrains・Xcode・Eclipseで、課金は「提供元の表示価格に沿った従量課金」です。またBusiness・Enterpriseでは管理者がモデルポリシーで利用可否を管理でき、既定では新しいモデルが自動的に有効になる(管理者が既定を切っているか、このモデルを明示的に無効にしている場合を除く)と説明されています。社内で勝手に使われては困る場合は、管理者側の設定を先に確認してください。
なお公式は「展開は段階的で、まだ表示されなければ後で確認を」と書いています。発表日に契約プランの画面で見当たらなくても異常ではありません。
安全性について公表された数字
今回は安全機構の刷新が前面に出ています。公式は「まったく新しい安全機構の層(safeguard stack)で構築し、拒否と脱獄耐性についてこれまでで最も強い」と説明し、次の2つの数字を挙げています。
- LatchBioの生物安全性ベンチマークで62.4%(同社は首位と表現)
- HackerBench v0.3で、危険な二重用途プロンプトの通過率3.3%。正当なセキュリティ業務はほとんど妨げない、と説明
あわせて、一部のセキュリティ事業者に対して、防御研究のためのレッドチーム機能を招待制で提供し始めたとも書かれています。いずれも自社測定値であり、第三者による検証結果ではありません。「拒否されにくい」と「危険な要求を通さない」を同時に主張している点は、実際の業務プロンプトで自分で確かめる価値があります。社内利用のルールづくりはAIガバナンスの観点から整理してください。
公表されていないこと(2026年9月22日時点)
判断を急ぐときほど、書かれていないことを先に確認しておくのが安全です。発表ページとGitHubの告知には、以下の記載がありません。
| 項目 | 状況 |
|---|---|
| コンテキストウィンドウのトークン数 | 未記載(「長い文脈の管理が改善」という定性的な説明のみ) |
| 知識のカットオフ日 | 未記載 |
| 日本語UI・日本語性能に関する記載 | 未記載 |
| 高速版の具体的な単価 | 「2倍」とのみ記載(基準単価の2倍と読める) |
| Grok本体のチャット製品での提供時期 | 未記載 |
この5点は、Grok APIの公式ドキュメントやモデルカードで別途確認が必要です。本記事では確認できていないため、数値を推定して書くことはしません。
導入を判断する手順
- 現行モデルでの失敗率とやり直し回数を測る。ここが十分小さいなら、乗り換えても効果は出ません
- 差が大きかった領域から試す。公式ベンチマークで開きが出たのは長時間の端末作業・電気工学・法務系の作業です。汎用の要約や分類で試しても違いは見えにくくなります
- 単価ではなく1件あたりの費用で比べる。同じ仕事を終えるまでの出力トークン量を実測し、単価×実測量で並べます
- GitHub Copilot経由なら管理者設定を先に確認する。既定で自動有効になる挙動のため、利用範囲を決めてから展開します
- 小さくPoCを回す。プロンプトの作り込みより先に、どこで人が確認するかを決めます。自動で最後まで走らせる設計なら、途中の承認点の置き方はGrok Botとはの承認設計が参考になります
利用量が多い処理では、外部APIに出し続けるかどうか自体が論点になります。判断軸はローカルLLMとAPIの損益分岐点にまとめています。
よくある失敗
- 単価の安さだけで全社標準に決める。同じ仕事でも消費トークン量が違えば1件あたりの費用は逆転します。単価表は比較の入口にすぎません
- 公式ベンチマーク表を横並びの勝敗表として読む。推論設定がモデルごとに違い、DeepSWEにいたってはGrok 4.7の値だけhigh effortです
- 「発表当日から利用可」を全プランに展開済みと読む。GitHub Copilotは段階展開で、表示されるまでに時間差があります
- コンテキスト上限を確認せずに長い資料を渡す設計にする。トークン数の上限は今回の発表では公表されていません
- 安全機構の数値を第三者検証と受け取る。いずれも提供元の自社測定値です
- 生成AIの切り替えを実装だけで終える。モデルを替えると出力の癖が変わるため、既存プロンプトの再検証とレビュー手順の見直しまでが1セットです
出典: SpaceXAI発表ページ(Introducing Grok 4.7、2026年9月21日)、GitHub Changelog(Grok 4.7 is now available in GitHub Copilot、2026年9月21日)
よくある質問
Grok 4.7の料金はいくらですか?
公式の表記は100万トークンあたり入力2ドル・出力6ドルからで、前世代のGrok 4.6と同額です。出力速度が2倍の高速版(fast variant)は、その2倍の単価になります。公式の比較表では、GPT-5.6 Solが入力4ドル・出力20ドル、Claude Fable 5.1が入力10ドル・出力50ドルなので、出力単価はSolの約3分の1・Fable 5.1の約8分の1という位置です。GitHub Copilotで使う場合は、Copilotの従量課金の中で提供元の表示価格どおりに課金されるとGitHubが説明しています。
いつから誰が使えますか?
SpaceXAIは2026年9月21日の発表当日から、Cursorとグロック公式の開発者向け環境Grok Buildで利用できるとしています。あわせてGrok API、他社のコーディング環境、モデルルーターやクラウド基盤経由でも提供されます。同日GitHubも、GitHub CopilotのPro・Pro+・Max・Business・Enterpriseの各プランに順次展開すると告知しました。GitHub側は「展開は段階的(gradual)」と明記しているため、契約していてもすぐにモデル選択欄に出ないことがあります。
Grok 4.6から何が変わりましたか?
公式の説明では、より大きな新しいベースモデルを使い、数時間かかる難しい仕事に重みを置いた学習を長く回した、とされています。その結果として挙げられているのは、自分の作業を検証する力、長い文脈を扱う力、そして文書やプレゼン資料の作成です。加えてGrok Botの実行環境をモデル自身が理解するよう学習させたと説明されています。公式ベンチマーク表では、電気工学のEEBenchが53.0%から64.0%、長時間の端末作業を測るTerminal-Bench 4.0が20.3%から38.0%と差が大きく出ています。
コンテキストの広さや知識のカットオフは公表されていますか?
2026年9月22日時点の発表ページには記載がありません。公式が書いているのは「長い文脈の扱いが改善した」という定性的な説明までで、トークン数の上限も知識のカットオフ日も示されていないため、本記事では未確認として扱います。長い資料を丸ごと渡す前提で設計するなら、Grok APIの公式ドキュメントで実際の上限を確認してから見積もってください。