Claude Opus 5vsGPT-6 Sol

Claude Opus 5
GPT-6 Sol
Specifications
Context window
1M1.05M
API pricing
Input price
$5.00$2.00
Output price
$25.00$10.00
Cached input price
$0.50$0.20
Cheapest input
$5.00Amazon Bedrock
Cheapest output
$25.00Amazon Bedrock
Benchmarks
DeepSWE 1.1
68.8%68.8%
OSWorld 2.0
74%60.5%
AutomationBench
26.9%33.2%
Benchmarks
BullshitBench v2
73%
Gray Swan IPI · k = 1
0.2%
Gray Swan IPI · k = 10
1.6%
Gray Swan IPI · k = 15
2%
ProgramBench
4.5%
SWE-Bench Pro
79.2%
SWE-Bench Verified
96%
SWE-Bench Multilingual
89.5%
SWE-Bench Multimodal
59.4%
FrontierCode v1.1 (Main) · main split
48%
Next.js Evals
94%
Supabase Evals · with skills
92.8%
Supabase Evals · no skills
89.9%
Frontier-Bench v0.1
43.3%
Terminal-Bench 4.0
51.82%
Terminal-Bench-Science 0.1
29%
BrowseComp
90.8%
Humanity's Last Exam · no tools
56.3%
Humanity's Last Exam · with tools
63.6%
ARC-AGI-3
30.2%
ARC-AGI-2
90.4%
BioMysteryBench · hard
49.4%
BioMysteryBench · human solved
90.1%
Agent's Last Exam · pass@1
56.4%
Harvey's Legal Agent Benchmark (Held-out)
11.7%
HealthBench Professional
59.8%
GDPval-AA v2.1
1708
GDPval-AA v2
1861
AA-Briefcase
1685
Chartography · with tools
83.4%
threejseval
1776
Overview
CompanyAnthropicOpenAI
Release dateJul 24 2026Sep 22 2026
AccessProprietaryProprietary

Other comparisons

Claude Opus 5vsGemini 3.8 FlashGPT-6 SolvsGemini 3.8 FlashClaude Opus 5vsMuse Spark 1.3GPT-6 SolvsMuse Spark 1.3Claude Opus 5vsGrok 4.7GPT-6 SolvsGrok 4.7Claude Opus 5vsDeepSeek-V4.1-FlashGPT-6 SolvsDeepSeek-V4.1-FlashClaude Opus 5vsMistral Medium 3.5GPT-6 SolvsMistral Medium 3.5Claude Opus 5vsKimi K3GPT-6 SolvsKimi K3

Frequently asked questions

Claude Opus 5 and GPT-6 Sol are evenly matched across the 3 benchmarks they both report (DeepSWE 1.1, OSWorld 2.0, AutomationBench). GPT-6 Sol is cheaper on both input and output: $2.00 vs $5.00 per million input tokens, and $10.00 vs $25.00 per million output tokens. Figures are base-tier rates. Claude Opus 5 shipped 60 days before GPT-6 Sol, so benchmark comparisons should account for the intervening progress.

Context windows are 1M (Claude Opus 5) vs 1.05M (GPT-6 Sol).

On DeepSWE 1.1, both models score 68.8%. On OSWorld 2.0, Claude Opus 5 leads at 74% vs GPT-6 Sol at 60.5%. On AutomationBench, GPT-6 Sol leads at 33.2% vs Claude Opus 5 at 26.9%.