Gemini 3.1 ProvsComposer 2.5

Gemini 3.1 Pro
Composer 2.5
API pricing
Input price
$2.00
Output price
$12.00
Cached input price
$0.20
Benchmarks
SWE-Bench Pro
54.2%54%
Next.js Evals
69%81%
Terminal-Bench 2.1
70.3%73%
Terminal-Bench 2.0
68.5%69.3%
Benchmarks
BullshitBench v2
37%
Gray Swan IPI · k = 1
14.2%
Gray Swan IPI · k = 10
45.7%
Gray Swan IPI · k = 15
49.2%
SWE-Bench Verified
80.6%
SWE-Bench Multilingual
79.8%
DeepSWE 1.1
12%
DeepSWE 1.0
18%
MLE-Bench
42.6%
MCP Atlas
78.2%
Toolathlon
48.8%
BrowseComp
85.9%
Humanity's Last Exam · no tools
44.4%
Humanity's Last Exam · with tools
51.4%
ARC-AGI-2
77.1%
FrontierMath · Tier 1–3
36.9%
FrontierMath · Tier 4
16.7%
GPQA Diamond
94.3%
OSWorld-Verified
76.2%
Finance Agent v2
43%
GDPval-AA
1314
GDPval-AA v2
965
GDPval (win/tie rate)
67.3%
CharXiv Reasoning
83.3%
MMMU-Pro
80.5%
Blueprint-Bench 2
26.5%
MRCR v2 (8-needle) · 128k average
84.9%
MRCR v2 (8-needle) · 1M pointwise
26.3%
Overview
CompanyGoogleSpaceXAI
Release dateFeb 19 2026May 18 2026
AccessProprietaryProprietary

Other comparisons

Gemini 3.1 ProvsClaude Fable 5.1Composer 2.5vsClaude Fable 5.1Gemini 3.1 ProvsGPT-6 AstraComposer 2.5vsGPT-6 AstraGemini 3.1 ProvsMuse Spark 1.3Composer 2.5vsMuse Spark 1.3Gemini 3.1 ProvsDeepSeek-V4-Pro-0813Composer 2.5vsDeepSeek-V4-Pro-0813Gemini 3.1 ProvsMistral Medium 3.5Composer 2.5vsMistral Medium 3.5Gemini 3.1 ProvsKimi K3Composer 2.5vsKimi K3

Frequently asked questions

Composer 2.5 leads Gemini 3.1 Pro on 3 of the 4 benchmarks they both report (SWE-Bench Pro, Next.js Evals, Terminal-Bench 2.1, Terminal-Bench 2.0). Only Gemini 3.1 Pro has a verified first-party API price: $2.00 per million input tokens and $12.00 per million output tokens. No pay-as-you-go API rate is tracked for Composer 2.5. Gemini 3.1 Pro shipped 88 days before Composer 2.5, so benchmark comparisons should account for the intervening progress.

Published specifications for these two models are limited — see each model page for the latest details.

On SWE-Bench Pro, Gemini 3.1 Pro leads at 54.2% vs Composer 2.5 at 54%. On Next.js Evals, Composer 2.5 leads at 81% vs Gemini 3.1 Pro at 69%. On Terminal-Bench 2.1, Composer 2.5 leads at 73% vs Gemini 3.1 Pro at 70.3%. On Terminal-Bench 2.0, Composer 2.5 leads at 69.3% vs Gemini 3.1 Pro at 68.5%.