Gemini 3.1 ProvsGrok 4.6

Gemini 3.1 Pro
Grok 4.6
API pricing
Input price
$2.00$2.00
Output price
$12.00$6.00
Cached input price
$0.20$0.50
Cheapest input
$2.20Amazon Bedrock
Cheapest output
$6.60Amazon Bedrock
Benchmarks
BullshitBench v2
37%65%
DeepSWE 1.1
12%65.9%
Next.js Evals
69%85%
GDPval-AA v2
9651753
Benchmarks
Gray Swan IPI · k = 1
14.2%
Gray Swan IPI · k = 10
45.7%
Gray Swan IPI · k = 15
49.2%
SWE-Bench Pro
54.2%
SWE-Bench Verified
80.6%
FrontierCode v1.1 (Extended) · extended split
61.3%
APEX-SWE
56.4%
MLE-Bench
42.6%
Terminal-Bench 4.0
20.3%
Terminal-Bench 3.0
26%
Terminal-Bench 2.1
70.3%
Terminal-Bench 2.0
68.5%
APEX-Agents
57.5%
MCP Atlas
78.2%
Toolathlon
48.8%
BrowseComp
85.9%
Humanity's Last Exam · no tools
44.4%
Humanity's Last Exam · with tools
51.4%
ARC-AGI-2
77.1%
FrontierMath · Tier 1–3
36.9%
FrontierMath · Tier 4
16.7%
GPQA Diamond
94.3%
OSWorld-Verified
76.2%
Finance Agent v2
43%
Harvey's Legal Agent Benchmark
15.8%
AA Intelligence Index
61
GDPval-AA
1314
AA-Briefcase
1577
GDPval (win/tie rate)
67.3%
CharXiv Reasoning
83.3%
MMMU-Pro
80.5%
Blueprint-Bench 2
26.5%
MRCR v2 (8-needle) · 128k average
84.9%
MRCR v2 (8-needle) · 1M pointwise
26.3%
Overview
CompanyGoogleSpaceXAI
Release dateFeb 19 2026Aug 12 2026
AccessProprietaryProprietary

Other comparisons

Gemini 3.1 ProvsClaude Fable 5.1Grok 4.6vsClaude Fable 5.1Gemini 3.1 ProvsGPT-6 AstraGrok 4.6vsGPT-6 AstraGemini 3.1 ProvsMuse Spark 1.3Grok 4.6vsMuse Spark 1.3Gemini 3.1 ProvsDeepSeek-V4-Pro-0813Grok 4.6vsDeepSeek-V4-Pro-0813Gemini 3.1 ProvsMistral Medium 3.5Grok 4.6vsMistral Medium 3.5Gemini 3.1 ProvsKimi K3Grok 4.6vsKimi K3

Frequently asked questions

Grok 4.6 leads Gemini 3.1 Pro on 4 of the 4 benchmarks they both report (BullshitBench v2, DeepSWE 1.1, Next.js Evals, GDPval-AA v2). Both charge $2.00 per million input tokens. Grok 4.6 is cheaper on output: $6.00 vs $12.00 per million tokens. Figures are base-tier rates. Gemini 3.1 Pro shipped 174 days before Grok 4.6, so benchmark comparisons should account for the intervening progress.

Published specifications for these two models are limited — see each model page for the latest details.

On BullshitBench v2, Grok 4.6 leads at 65% vs Gemini 3.1 Pro at 37%. On DeepSWE 1.1, Grok 4.6 leads at 65.9% vs Gemini 3.1 Pro at 12%. On Next.js Evals, Grok 4.6 leads at 85% vs Gemini 3.1 Pro at 69%. On GDPval-AA v2, Grok 4.6 leads at 1753 vs Gemini 3.1 Pro at 965.