Claude Opus 4.8vsgpt-oss-120b

Claude Opus 4.8
gpt-oss-120b
Specifications
Parameters
117B
Context window
1M128k
API pricing
Input price
$5.00
Output price
$25.00
Cached input price
$0.50
Cheapest input
$5.00Amazon Bedrock$0.03AkashML
Cheapest output
$25.00Amazon Bedrock$0.17AkashML
Benchmarks
BullshitBench v2
95%11%
SWE-Bench Verified
88.6%62.4%
Humanity's Last Exam · no tools
49.8%14.9%
Humanity's Last Exam · with tools
57.9%19%
Benchmarks
Gray Swan IPI · k = 1
0.5%
Gray Swan IPI · k = 10
4.1%
Gray Swan IPI · k = 15
5.5%
SWE-Bench Pro
69.2%
SWE-Bench Multilingual
84.4%
DeepSWE 1.0
55.8%
Next.js Evals
81%
Frontier-Bench v0.1
21.1%
Terminal-Bench 4.0
23.64%
Terminal-Bench 2.1
74.6%
BU Bench
74%
BrowseComp
84.3%
GPQA Diamond
80.1%
MMLU
90%
OSWorld-Verified
83.4%
Finance Agent v2
53.9%
Harvey's Legal Agent Benchmark
9.58%
TaxEval v2
75.63%
MedScribe
85.75%
GDPval-AA
1890
GDPval-AA v2
1600
Overview
CompanyAnthropicOpenAI
Release dateMay 28 2026Aug 5 2025
AccessProprietaryOpen Weight

Other comparisons

Claude Opus 4.8vsGemini 3.7 Flashgpt-oss-120bvsGemini 3.7 FlashClaude Opus 4.8vsMuse Glimmergpt-oss-120bvsMuse GlimmerClaude Opus 4.8vsGrok 4.6gpt-oss-120bvsGrok 4.6Claude Opus 4.8vsDeepSeek-V4-Pro-0813gpt-oss-120bvsDeepSeek-V4-Pro-0813Claude Opus 4.8vsMistral Medium 3.5gpt-oss-120bvsMistral Medium 3.5Claude Opus 4.8vsKimi K3gpt-oss-120bvsKimi K3

Frequently asked questions

Claude Opus 4.8 leads gpt-oss-120b on 4 of the 4 benchmarks they both report (BullshitBench v2, SWE-Bench Verified, Humanity's Last Exam). Only Claude Opus 4.8 has a verified first-party API price: $5.00 per million input tokens and $25.00 per million output tokens. No pay-as-you-go API rate is tracked for gpt-oss-120b. gpt-oss-120b shipped 296 days before Claude Opus 4.8, so benchmark comparisons should account for the intervening progress.

Context windows are 1M (Claude Opus 4.8) vs 128k (gpt-oss-120b). Claude Opus 4.8 is proprietary, while gpt-oss-120b is open weight.

On BullshitBench v2, Claude Opus 4.8 leads at 95% vs gpt-oss-120b at 11%. On SWE-Bench Verified, Claude Opus 4.8 leads at 88.6% vs gpt-oss-120b at 62.4%. On Humanity's Last Exam · no tools, Claude Opus 4.8 leads at 49.8% vs gpt-oss-120b at 14.9%. On Humanity's Last Exam · with tools, Claude Opus 4.8 leads at 57.9% vs gpt-oss-120b at 19%.

Claude Opus 4.8 was released by Anthropic on May 28 2026.

gpt-oss-120b was released by OpenAI on Aug 5 2025.

Claude Opus 4.8 leads on SWE-Bench Verified — Claude Opus 4.8 88.6% vs gpt-oss-120b 62.4%.

Claude Opus 4.8 leads on Humanity's Last Exam · no tools — Claude Opus 4.8 49.8% vs gpt-oss-120b 14.9%.

Only Claude Opus 4.8 has a verified first-party API price: $5.00 per million input tokens and $25.00 per million output tokens. No pay-as-you-go API rate is tracked for gpt-oss-120b. Rates are pay-as-you-go API prices verified on August 18, 2026.

Claude Opus 4.8 has a 1M context window; gpt-oss-120b has 128k.

Claude Opus 4.8 is a proprietary model released by Anthropic. gpt-oss-120b is an open weight model released by OpenAI.