Muse GlimmervsGrok 4.5

Muse Glimmer
Grok 4.5
Specifications
Parameters
30B
Benchmarks
Nonsense detection
BullshitBench v2
54%
Prompt injection robustness
Gray Swan IPI · k = 1
13.4%
Prompt injection robustness
Gray Swan IPI · k = 10
54.2%
Prompt injection robustness
Gray Swan IPI · k = 15
60.8%
Agentic coding
SWE-Bench Pro
51.2%
64.7%Best
Coding
SWE-Bench Verified
76%
Multilingual coding
SWE-Bench Multilingual
78%
Agentic coding
CursorBench v3.2
66.7%
Agentic coding
DeepSWE 1.1
54%
Agentic coding
DeepSWE 1.0
62%
Next.js coding
Next.js Evals
83%
Agentic computer work
Frontier-Bench v0.1
17.8%
Agentic terminal coding
Terminal-Bench 2.1
51.7%
83.3%Best
Multi-step tool use
MCP Atlas
75.5%
Multidisciplinary reasoning
Humanity's Last Exam · no tools
22%
Science
GPQA Diamond
83.5%
Agentic computer use
OSWorld-Verified
65.9%
Agentic legal work
Harvey's Legal Agent Benchmark
12.92%
Medical admin work
MedScribe
86.88%
Knowledge work
GDPval-AA v2
953
Chart reasoning
CharXiv Reasoning
78.8%
Multimodal reasoning
MMMU-Pro
74%
Community preference
Arena Elo (Text)
1468
Community preference (code)
Arena Elo (Code)
1549
Overview
CompanyMetaSpaceXAI
Release dateAug 10 2026Jul 8 2026
AccessOpen WeightProprietary

Which is better: Muse Glimmer or Grok 4.5?

Grok 4.5 leads Muse Glimmer on 2 of the 2 benchmarks they both report (SWE-Bench Pro, Terminal-Bench 2.1). Grok 4.5 shipped 33 days before Muse Glimmer, so benchmark comparisons should account for the intervening progress.

Muse Glimmer is open weight, while Grok 4.5 is proprietary.

On SWE-Bench Pro, Grok 4.5 leads at 64.7% vs Muse Glimmer at 51.2%. On Terminal-Bench 2.1, Grok 4.5 leads at 83.3% vs Muse Glimmer at 51.7%.

Frequently asked questions

Muse Glimmer was released by Meta on Aug 10 2026.

Grok 4.5 was released by SpaceXAI on Jul 8 2026.

Grok 4.5 leads on SWE-Bench Pro — Muse Glimmer 51.2% vs Grok 4.5 64.7%.

Muse Glimmer is an open weight model released by Meta. Grok 4.5 is a proprietary model released by SpaceXAI.

Other comparisons