Gemini 3.5 FlashvsGrok 4.6

Gemini 3.5 Flash
Grok 4.6
Benchmarks
Nonsense detection
BullshitBench v2
20%
Prompt injection robustness
Gray Swan IPI · k = 1
14.1%
Prompt injection robustness
Gray Swan IPI · k = 10
54.2%
Prompt injection robustness
Gray Swan IPI · k = 15
60.5%
Agentic coding
SWE-Bench Pro
55.1%
Agentic coding
CursorBench v3.2
48.8%
69.9%Best
Agentic coding
CursorBench v3.1
49.8%
Agentic coding
DeepSWE 1.1
37%
65.9%Best
Agentic coding
FrontierCode v1.1 (Extended) · extended split
61.3%
Expert software engineering
APEX-SWE
56.4%
ML engineering
MLE-Bench
49.7%
Agentic terminal coding
Terminal-Bench 3.0
26%
Agentic terminal coding
Terminal-Bench 2.1
76.2%
Expert agentic work
APEX-Agents
57.5%
Multi-step tool use
MCP Atlas
83.6%
General tool use
Toolathlon
56.5%
Browser agent
BU Bench
58%
Multidisciplinary reasoning
Humanity's Last Exam · no tools
40.2%
Abstract reasoning
ARC-AGI-2
72.1%
Agentic computer use
OSWorld-Verified
78.4%
Agentic financial analysis
Finance Agent v2
57.9%
Agentic legal work
Harvey's Legal Agent Benchmark
15.8%
Overall intelligence
AA Intelligence Index
61
Knowledge work
GDPval-AA
1656
Knowledge work
GDPval-AA v2
1349
1753Best
Knowledge work
AA-Briefcase
1577
Chart reasoning
CharXiv Reasoning
84.2%
Multimodal reasoning
MMMU-Pro
83.6%
Spatial reasoning
Blueprint-Bench 2
33.6%
Long context
MRCR v2 (8-needle) · 128k average
77.3%
Long context
MRCR v2 (8-needle) · 1M pointwise
26.6%
Community preference
Arena Elo (Text)
1476
Community preference (code)
Arena Elo (Code)
1509
Overview
CompanyGoogleSpaceXAI
Release dateMay 19 2026Aug 12 2026
AccessProprietaryProprietary

Which is better: Gemini 3.5 Flash or Grok 4.6?

Grok 4.6 leads Gemini 3.5 Flash on 3 of the 3 benchmarks they both report (CursorBench v3.2, DeepSWE 1.1, GDPval-AA v2). Gemini 3.5 Flash shipped 85 days before Grok 4.6, so benchmark comparisons should account for the intervening progress.

Published specifications for these two models are limited — see each model page for the latest details.

On CursorBench v3.2, Grok 4.6 leads at 69.9% vs Gemini 3.5 Flash at 48.8%. On DeepSWE 1.1, Grok 4.6 leads at 65.9% vs Gemini 3.5 Flash at 37%. On GDPval-AA v2, Grok 4.6 leads at 1753 vs Gemini 3.5 Flash at 1349.

Frequently asked questions

Gemini 3.5 Flash was released by Google on May 19 2026.

Grok 4.6 was released by SpaceXAI on Aug 12 2026.

Grok 4.6 leads on CursorBench v3.2 — Gemini 3.5 Flash 48.8% vs Grok 4.6 69.9%.

Other comparisons