Claude Opus 4.8vsQwen3.5

Claude Opus 4.8
Qwen3.5
Specifications
Parameters
397B
Context window
1M
1M
Benchmarks
Nonsense detection
BullshitBench v2
95%
Prompt injection robustness
Gray Swan IPI · k = 1
0.5%
Prompt injection robustness
Gray Swan IPI · k = 10
4.1%
Prompt injection robustness
Gray Swan IPI · k = 15
5.5%
Agentic coding
SWE-Bench Pro
69.2%
Coding
SWE-Bench Verified
76.4%
Multilingual coding
SWE-Bench Multilingual
84.4%Best
69.3%
Agentic coding
CursorBench v3.2
62.3%
Agentic coding
CursorBench v3.1
63.8%
Agentic coding
DeepSWE 1.0
55.8%
Next.js coding
Next.js Evals
88%
Agentic computer work
Frontier-Bench v0.1
21.1%
Agentic terminal coding
Terminal-Bench 2.1
74.6%
Agentic terminal coding
Terminal-Bench 2.0
52.5%
Browser agent
BU Bench
74%
Web browsing
BrowseComp
84.3%Best
69%
Multidisciplinary reasoning
Humanity's Last Exam · no tools
49.8%Best
28.7%
Multidisciplinary reasoning
Humanity's Last Exam · with tools
57.9%
Science
GPQA Diamond
88.4%
Agentic computer use
OSWorld-Verified
83.4%Best
62.2%
Agentic financial analysis
Finance Agent v2
53.9%
Agentic legal work
Harvey's Legal Agent Benchmark
9.58%
Tax questions
TaxEval v2
75.63%
Medical admin work
MedScribe
85.75%
Knowledge work
GDPval-AA
1890
Knowledge work
GDPval-AA v2
1600
Chart reasoning
CharXiv Reasoning
80.8%
Multimodal reasoning
MMMU-Pro
79%
Multimodal
MMMU
85%
Community preference
Arena Elo (Text)
1482
Community preference (code)
Arena Elo (Code)
1568
Overview
CompanyAnthropicQwen
Release dateMay 28 2026Feb 16 2026
AccessProprietaryOpen Weight

Which is better: Claude Opus 4.8 or Qwen3.5?

Claude Opus 4.8 leads Qwen3.5 on 4 of the 4 benchmarks they both report (SWE-Bench Multilingual, BrowseComp, Humanity's Last Exam, OSWorld-Verified). Qwen3.5 shipped 101 days before Claude Opus 4.8, so benchmark comparisons should account for the intervening progress.

Context windows are 1M (Claude Opus 4.8) vs 1M (Qwen3.5). Claude Opus 4.8 is proprietary, while Qwen3.5 is open weight.

On SWE-Bench Multilingual, Claude Opus 4.8 leads at 84.4% vs Qwen3.5 at 69.3%. On BrowseComp, Claude Opus 4.8 leads at 84.3% vs Qwen3.5 at 69%. On Humanity's Last Exam · no tools, Claude Opus 4.8 leads at 49.8% vs Qwen3.5 at 28.7%. On OSWorld-Verified, Claude Opus 4.8 leads at 83.4% vs Qwen3.5 at 62.2%.

Frequently asked questions

Claude Opus 4.8 was released by Anthropic on May 28 2026.

Qwen3.5 was released by Qwen on Feb 16 2026.

Claude Opus 4.8 leads on SWE-Bench Multilingual — Claude Opus 4.8 84.4% vs Qwen3.5 69.3%.

Claude Opus 4.8 leads on Humanity's Last Exam · no tools — Claude Opus 4.8 49.8% vs Qwen3.5 28.7%.

Claude Opus 4.8 has a 1M context window; Qwen3.5 has 1M.

Claude Opus 4.8 is a proprietary model released by Anthropic. Qwen3.5 is an open weight model released by Qwen.

Other comparisons