Kimi K2.5vsGrok 4.5

Kimi K2.5
Grok 4.5
Specifications
Parameters
1T
Context window
256k
Benchmarks
Nonsense detection
BullshitBench v2
52%
54%Best
Prompt injection robustness
Gray Swan IPI · k = 1
13.4%
Prompt injection robustness
Gray Swan IPI · k = 10
54.2%
Prompt injection robustness
Gray Swan IPI · k = 15
60.8%
Agentic coding
SWE-Bench Pro
64.7%
Coding
SWE-Bench Verified
76.8%
Multilingual coding
SWE-Bench Multilingual
78%
Agentic coding
CursorBench v3.2
66.7%
Agentic coding
CursorBench v3.1
31.9%
Agentic coding
DeepSWE 1.1
54%
Agentic coding
DeepSWE 1.0
62%
Next.js coding
Next.js Evals
21%
83%Best
Competitive coding
LiveCodeBench
85%
Agentic computer work
Frontier-Bench v0.1
17.8%
Agentic terminal coding
Terminal-Bench 2.1
83.3%
Science
GPQA Diamond
87.6%
Agentic legal work
Harvey's Legal Agent Benchmark
12.92%
Medical admin work
MedScribe
86.88%
Community preference (code)
Arena Elo (Code)
1433
1549Best
Overview
CompanyMoonshot AISpaceXAI
Release dateJan 27 2026Jul 8 2026
AccessOpen WeightProprietary

Which is better: Kimi K2.5 or Grok 4.5?

Grok 4.5 leads Kimi K2.5 on 3 of the 3 benchmarks they both report (BullshitBench v2, Next.js Evals, Arena Elo (Code)). Kimi K2.5 shipped 162 days before Grok 4.5, so benchmark comparisons should account for the intervening progress.

Kimi K2.5 is open weight, while Grok 4.5 is proprietary.

On BullshitBench v2, Grok 4.5 leads at 54% vs Kimi K2.5 at 52%. On Next.js Evals, Grok 4.5 leads at 83% vs Kimi K2.5 at 21%. On Arena Elo (Code), Grok 4.5 leads at 1549 vs Kimi K2.5 at 1433.

Frequently asked questions

Kimi K2.5 was released by Moonshot AI on Jan 27 2026.

Grok 4.5 was released by SpaceXAI on Jul 8 2026.

Grok 4.5 leads on Next.js Evals — Kimi K2.5 21% vs Grok 4.5 83%.

Kimi K2.5 is an open weight model released by Moonshot AI. Grok 4.5 is a proprietary model released by SpaceXAI.

Other comparisons