Claude 3.5 SonnetvsKimi K2.5

Claude 3.5 Sonnet
Kimi K2.5
Specifications
Parameters
1T
Context window
256k
Benchmarks
Nonsense detection
BullshitBench v2
45%
52%Best
Coding
SWE-Bench Verified
33.4%
76.8%Best
Agentic coding
CursorBench v3.1
31.9%
Next.js coding
Next.js Evals
21%
Competitive coding
LiveCodeBench
85%
Science
GPQA Diamond
59.4%
87.6%Best
Community preference (code)
Arena Elo (Code)
1433
Overview
CompanyAnthropicMoonshot AI
Release dateJun 20 2024Jan 27 2026
AccessProprietaryOpen Weight

Which is better: Claude 3.5 Sonnet or Kimi K2.5?

Kimi K2.5 leads Claude 3.5 Sonnet on 3 of the 3 benchmarks they both report (BullshitBench v2, SWE-Bench Verified, GPQA Diamond). Claude 3.5 Sonnet shipped 586 days before Kimi K2.5, so benchmark comparisons should account for the intervening progress.

Claude 3.5 Sonnet is proprietary, while Kimi K2.5 is open weight.

On BullshitBench v2, Kimi K2.5 leads at 52% vs Claude 3.5 Sonnet at 45%. On SWE-Bench Verified, Kimi K2.5 leads at 76.8% vs Claude 3.5 Sonnet at 33.4%. On GPQA Diamond, Kimi K2.5 leads at 87.6% vs Claude 3.5 Sonnet at 59.4%.

Frequently asked questions

Claude 3.5 Sonnet was released by Anthropic on Jun 20 2024.

Kimi K2.5 was released by Moonshot AI on Jan 27 2026.

Kimi K2.5 leads on SWE-Bench Verified — Claude 3.5 Sonnet 33.4% vs Kimi K2.5 76.8%.

Kimi K2.5 leads on GPQA Diamond — Claude 3.5 Sonnet 59.4% vs Kimi K2.5 87.6%.

Claude 3.5 Sonnet is a proprietary model released by Anthropic. Kimi K2.5 is an open weight model released by Moonshot AI.

Other comparisons