Claude 3.7 SonnetvsKimi K2.6

Claude 3.7 Sonnet
Kimi K2.6
Specifications
Parameters
1T
Context window
256k
Benchmarks
Nonsense detection
BullshitBench v2
49%
65%Best
Coding
SWE-Bench Verified
62.3%
80.2%Best
Agentic coding
CursorBench v3.1
47.6%
Next.js coding
Next.js Evals
67%
Competitive coding
LiveCodeBench
89.6%
Science
GPQA Diamond
68%
90.5%Best
Community preference
Arena Elo (Text)
1461
Community preference (code)
Arena Elo (Code)
1513
Overview
CompanyAnthropicMoonshot AI
Release dateFeb 24 2025Apr 21 2026
AccessProprietaryOpen Weight

Which is better: Claude 3.7 Sonnet or Kimi K2.6?

Kimi K2.6 leads Claude 3.7 Sonnet on 3 of the 3 benchmarks they both report (BullshitBench v2, SWE-Bench Verified, GPQA Diamond). Claude 3.7 Sonnet shipped 421 days before Kimi K2.6, so benchmark comparisons should account for the intervening progress.

Claude 3.7 Sonnet is proprietary, while Kimi K2.6 is open weight.

On BullshitBench v2, Kimi K2.6 leads at 65% vs Claude 3.7 Sonnet at 49%. On SWE-Bench Verified, Kimi K2.6 leads at 80.2% vs Claude 3.7 Sonnet at 62.3%. On GPQA Diamond, Kimi K2.6 leads at 90.5% vs Claude 3.7 Sonnet at 68%.

Frequently asked questions

Claude 3.7 Sonnet was released by Anthropic on Feb 24 2025.

Kimi K2.6 was released by Moonshot AI on Apr 21 2026.

Kimi K2.6 leads on SWE-Bench Verified — Claude 3.7 Sonnet 62.3% vs Kimi K2.6 80.2%.

Kimi K2.6 leads on GPQA Diamond — Claude 3.7 Sonnet 68% vs Kimi K2.6 90.5%.

Claude 3.7 Sonnet is a proprietary model released by Anthropic. Kimi K2.6 is an open weight model released by Moonshot AI.

Other comparisons