Claude Opus 4.8vsgpt-oss-20b

Claude Opus 4.8
gpt-oss-20b
Specifications
Parameters
21B
Context window
1M128k
API pricing
Input price
$5.00
Output price
$25.00
Cached input price
$0.50
Cheapest input
$5.00Amazon Bedrock$0.03CoreWeave
Cheapest output
$25.00Amazon Bedrock$0.13CoreWeave
Benchmarks
SWE-Bench Verified
88.6%60.7%
Humanity's Last Exam · no tools
49.8%10.9%
Humanity's Last Exam · with tools
57.9%17.3%
Benchmarks
BullshitBench v2
95%
Gray Swan IPI · k = 1
0.5%
Gray Swan IPI · k = 10
4.1%
Gray Swan IPI · k = 15
5.5%
SWE-Bench Pro
69.2%
SWE-Bench Multilingual
84.4%
DeepSWE 1.0
55.8%
Next.js Evals
81%
Frontier-Bench v0.1
21.1%
Terminal-Bench 4.0
23.64%
Terminal-Bench 2.1
74.6%
BU Bench
74%
BrowseComp
84.3%
GPQA Diamond
71.5%
MMLU
85.3%
OSWorld-Verified
83.4%
Finance Agent v2
53.9%
Harvey's Legal Agent Benchmark
9.58%
TaxEval v2
75.63%
MedScribe
85.75%
GDPval-AA
1890
GDPval-AA v2
1600
Overview
CompanyAnthropicOpenAI
Release dateMay 28 2026Aug 5 2025
AccessProprietaryOpen Weight

Other comparisons

Claude Opus 4.8vsGemini 3.7 Flashgpt-oss-20bvsGemini 3.7 FlashClaude Opus 4.8vsMuse Glimmergpt-oss-20bvsMuse GlimmerClaude Opus 4.8vsGrok 4.6gpt-oss-20bvsGrok 4.6Claude Opus 4.8vsDeepSeek-V4-Pro-0813gpt-oss-20bvsDeepSeek-V4-Pro-0813Claude Opus 4.8vsMistral Medium 3.5gpt-oss-20bvsMistral Medium 3.5Claude Opus 4.8vsKimi K3gpt-oss-20bvsKimi K3

Frequently asked questions

Claude Opus 4.8 leads gpt-oss-20b on 3 of the 3 benchmarks they both report (SWE-Bench Verified, Humanity's Last Exam). Only Claude Opus 4.8 has a verified first-party API price: $5.00 per million input tokens and $25.00 per million output tokens. No pay-as-you-go API rate is tracked for gpt-oss-20b. gpt-oss-20b shipped 296 days before Claude Opus 4.8, so benchmark comparisons should account for the intervening progress.

Context windows are 1M (Claude Opus 4.8) vs 128k (gpt-oss-20b). Claude Opus 4.8 is proprietary, while gpt-oss-20b is open weight.

On SWE-Bench Verified, Claude Opus 4.8 leads at 88.6% vs gpt-oss-20b at 60.7%. On Humanity's Last Exam · no tools, Claude Opus 4.8 leads at 49.8% vs gpt-oss-20b at 10.9%. On Humanity's Last Exam · with tools, Claude Opus 4.8 leads at 57.9% vs gpt-oss-20b at 17.3%.

Claude Opus 4.8 was released by Anthropic on May 28 2026.

gpt-oss-20b was released by OpenAI on Aug 5 2025.

Claude Opus 4.8 leads on SWE-Bench Verified — Claude Opus 4.8 88.6% vs gpt-oss-20b 60.7%.

Claude Opus 4.8 leads on Humanity's Last Exam · no tools — Claude Opus 4.8 49.8% vs gpt-oss-20b 10.9%.

Only Claude Opus 4.8 has a verified first-party API price: $5.00 per million input tokens and $25.00 per million output tokens. No pay-as-you-go API rate is tracked for gpt-oss-20b. Rates are pay-as-you-go API prices verified on August 18, 2026.

Claude Opus 4.8 has a 1M context window; gpt-oss-20b has 128k.

Claude Opus 4.8 is a proprietary model released by Anthropic. gpt-oss-20b is an open weight model released by OpenAI.