GPT-5.5vsComposer 2.5

GPT-5.5
Composer 2.5
Specifications
Context window
1.05M
API pricing
Input price
$5.00
Output price
$30.00
Cached input price
$0.50
Cheapest input
$5.00Azure
Cheapest output
$30.00Azure
Benchmarks
SWE-Bench Pro
58.6%54%
SWE-Bench Multilingual
77.8%79.8%
DeepSWE 1.0
64.3%18%
Terminal-Bench 2.1
78.2%73%
Terminal-Bench 2.0
82.7%69.3%
Benchmarks
BullshitBench v2
47%
Gray Swan IPI · k = 1
3%
Gray Swan IPI · k = 10
17.4%
Gray Swan IPI · k = 15
20.8%
ProgramBench
0.5%
Next.js Evals
81%
Expert-SWE (Internal)
73.1%
MCP Atlas
75.3%
Toolathlon
55.6%
BrowseComp
84.4%
CyberGym
81.8%
Humanity's Last Exam · no tools
41.4%
Humanity's Last Exam · with tools
52.2%
ARC-AGI-2
84.6%
FrontierMath · Tier 1–3
51.7%
FrontierMath · Tier 4
35.4%
GPQA Diamond
93.6%
OSWorld-Verified
78.7%
Finance Agent v2
51.8%
Harvey's Legal Agent Benchmark
3.75%
TaxEval v2
74.98%
MedScribe
86.87%
GDPval-AA
1769
GDPval-AA v2
1494
GDPval (win/tie rate)
84.9%
CharXiv Reasoning
84.1%
MMMU-Pro
81.2%
Blueprint-Bench 2
36.2%
MRCR v2 (8-needle) · 128k average
94.8%
threejseval
1137
Overview
CompanyOpenAISpaceXAI
Release dateApr 23 2026May 18 2026
AccessProprietaryProprietary

Other comparisons

GPT-5.5vsClaude Fable 5.1Composer 2.5vsClaude Fable 5.1GPT-5.5vsGemini 3.8 FlashComposer 2.5vsGemini 3.8 FlashGPT-5.5vsMuse Spark 1.3Composer 2.5vsMuse Spark 1.3GPT-5.5vsDeepSeek-V4.1-FlashComposer 2.5vsDeepSeek-V4.1-FlashGPT-5.5vsMistral Medium 3.5Composer 2.5vsMistral Medium 3.5GPT-5.5vsKimi K3Composer 2.5vsKimi K3

Frequently asked questions

GPT-5.5 leads Composer 2.5 on 4 of the 5 benchmarks they both report. Only GPT-5.5 has a verified first-party API price: $5.00 per million input tokens and $30.00 per million output tokens. No pay-as-you-go API rate is tracked for Composer 2.5. GPT-5.5 shipped 25 days before Composer 2.5, so benchmark comparisons should account for the intervening progress.

Published specifications for these two models are limited — see each model page for the latest details.

On SWE-Bench Pro, GPT-5.5 leads at 58.6% vs Composer 2.5 at 54%. On SWE-Bench Multilingual, Composer 2.5 leads at 79.8% vs GPT-5.5 at 77.8%. On DeepSWE 1.0, GPT-5.5 leads at 64.3% vs Composer 2.5 at 18%. On Terminal-Bench 2.1, GPT-5.5 leads at 78.2% vs Composer 2.5 at 73%. On Terminal-Bench 2.0, GPT-5.5 leads at 82.7% vs Composer 2.5 at 69.3%.