Claude Opus 4.8vsGemini 3.7 Flash

Claude Opus 4.8
Gemini 3.7 Flash
Specifications
Context window
1M1M
API pricing
Input price
$5.00$0.75
Output price
$25.00$3.75
Cached input price
$0.50$0.075
Cheapest input
$5.00Amazon Bedrock
Cheapest output
$25.00Amazon Bedrock
Benchmarks
BullshitBench v2
95%35%
ProgramBench
0%0%
Terminal-Bench 4.0
23.64%11.21%
Terminal-Bench 2.1
74.6%85.8%
Harvey's Legal Agent Benchmark
9.58%8.8%
GDPval-AA v2
16001525
Benchmarks
Gray Swan IPI · k = 1
0.5%
Gray Swan IPI · k = 10
4.1%
Gray Swan IPI · k = 15
5.5%
SWE-Bench Pro
69.2%
SWE-Bench Verified
88.6%
SWE-Bench Multilingual
84.4%
DeepSWE 1.1
65.3%
DeepSWE 1.0
55.8%
FrontierCode v1.1 (Main) · main split
43.6%
Next.js Evals
68%
Frontier-Bench v0.1
21.1%
Terminal-Bench 3.0
14.9%
BU Bench
74%
BrowseComp
84.3%
Humanity's Last Exam · no tools
49.8%
Humanity's Last Exam · with tools
57.9%
Humanity's Last Exam (Verified)
53.6%
ARC-AGI-2
72.08%
BioMysteryBench · hard
43.5%
BioMysteryBench · human solved
87.1%
LAB-Bench 2
82.1%
OSWorld 2.0
38.1%
OSWorld-Verified
83.4%
Agent's Last Exam · pass@1
26.3%
AutomationBench
30.4%
Finance Agent v2
53.9%
TaxEval v2
75.63%
MedScribe
85.75%
AA Intelligence Index
56
GDPval-AA
1890
CharXiv Reasoning
84.5%
GDP.PDF
34%
LVBench
85.4%
MRCR v2 (8-needle) · 128k average
97%
MRCR v2 (8-needle) · 1M pointwise
62.5%
threejseval
1526
Overview
CompanyAnthropicGoogle
Release dateMay 28 2026Aug 13 2026
AccessProprietaryProprietary

Other comparisons

Claude Opus 4.8vsGPT-6 AstraGemini 3.7 FlashvsGPT-6 AstraClaude Opus 4.8vsMuse Spark 1.3Gemini 3.7 FlashvsMuse Spark 1.3Claude Opus 4.8vsGrok 4.6Gemini 3.7 FlashvsGrok 4.6Claude Opus 4.8vsDeepSeek-V4.1-FlashGemini 3.7 FlashvsDeepSeek-V4.1-FlashClaude Opus 4.8vsMistral Medium 3.5Gemini 3.7 FlashvsMistral Medium 3.5Claude Opus 4.8vsKimi K3Gemini 3.7 FlashvsKimi K3

Frequently asked questions

Claude Opus 4.8 leads Gemini 3.7 Flash on 4 of the 6 benchmarks they both report. Gemini 3.7 Flash is cheaper on both input and output: $0.75 vs $5.00 per million input tokens, and $3.75 vs $25.00 per million output tokens. Claude Opus 4.8 shipped 77 days before Gemini 3.7 Flash, so benchmark comparisons should account for the intervening progress.

Context windows are 1M (Claude Opus 4.8) vs 1M (Gemini 3.7 Flash).

On BullshitBench v2, Claude Opus 4.8 leads at 95% vs Gemini 3.7 Flash at 35%. On ProgramBench, both models score 0%. On Terminal-Bench 4.0, Claude Opus 4.8 leads at 23.64% vs Gemini 3.7 Flash at 11.21%. On Terminal-Bench 2.1, Gemini 3.7 Flash leads at 85.8% vs Claude Opus 4.8 at 74.6%. On Harvey's Legal Agent Benchmark, Claude Opus 4.8 leads at 9.58% vs Gemini 3.7 Flash at 8.8%. On GDPval-AA v2, Claude Opus 4.8 leads at 1600 vs Gemini 3.7 Flash at 1525.