# BullshitBench v2 — AI model rankings

Given a confidently-worded but nonsensical prompt, does the AI spot that it makes no sense and push back — instead of playing along and inventing an answer? The score is how often it clearly called out the nonsense. Higher is better.

67 tracked models have a published BullshitBench v2 score. Higher is better. Scores are as published at each model's release.

## Ranking

| Rank | Model | Developer | Score | Released |
| --- | --- | --- | --- | --- |
| 1 | Claude Opus 4.8 | Anthropic | 95% | May 28 2026 |
| 2 | Claude Sonnet 4.6 | Anthropic | 91% | Feb 17 2026 |
| 3 | Claude Opus 4.5 | Anthropic | 90% | Nov 24 2025 |
| 4 | Claude Opus 4.6 | Anthropic | 87% | Feb 5 2026 |
| 5 | Claude Opus 4.7 | Anthropic | 83% | Apr 16 2026 |
| 6 | Claude Sonnet 5 | Anthropic | 80% | Jun 30 2026 |
| 7 | Claude Sonnet 4.5 | Anthropic | 79% | Sep 29 2025 |
| 8 | Claude Haiku 4.5 | Anthropic | 77% | Oct 15 2025 |
| 9 | Kimi K3 | Moonshot AI | 73% | Jul 16 2026 |
| 9 | Claude Opus 5 | Anthropic | 73% | Jul 24 2026 |
| 11 | Qwen3.6-Plus | Qwen | 72% | Apr 2 2026 |
| 12 | Qwen3.7-Max | Qwen | 71% | May 20 2026 |
| 13 | Kimi K2.6 | Moonshot AI | 65% | Apr 21 2026 |
| 13 | Gemini 3.5 Flash-Lite | Google | 65% | Jul 21 2026 |
| 15 | Grok 4.20 Beta | SpaceXAI | 56% | Feb 17 2026 |
| 16 | Claude Fable 5 | Anthropic | 54% | Jun 9 2026 |
| 16 | Grok 4.5 | SpaceXAI | 54% | Jul 8 2026 |
| 18 | GPT-5.6 Terra | OpenAI | 53% | Jun 26 2026 |
| 19 | Kimi K2.5 | Moonshot AI | 52% | Jan 27 2026 |
| 20 | Claude 3.5 Haiku | Anthropic | 50% | Oct 22 2024 |
| 20 | Grok 4.3 Beta | SpaceXAI | 50% | Apr 17 2026 |
| 22 | Claude 3.7 Sonnet | Anthropic | 49% | Feb 24 2025 |
| 23 | GPT-5.4 | OpenAI | 48% | Mar 5 2026 |
| 24 | GPT-5.5 | OpenAI | 47% | Apr 23 2026 |
| 24 | GPT-5.6 Sol | OpenAI | 47% | Jun 26 2026 |
| 26 | Claude 3.5 Sonnet | Anthropic | 45% | Jun 20 2024 |
| 27 | Claude Opus 4.1 | Anthropic | 43% | Aug 5 2025 |
| 28 | GPT-5.6 Luna | OpenAI | 40% | Jun 26 2026 |
| 29 | GPT-5-Codex | OpenAI | 39% | Sep 15 2025 |
| 29 | Gemini 3.6 Flash | Google | 39% | Jul 21 2026 |
| 31 | GPT-5.2 | OpenAI | 38% | Dec 11 2025 |
| 31 | DeepSeek-V4-Flash-0731 | DeepSeek | 38% | Jul 31 2026 |
| 33 | Gemini 3.1 Pro | Google | 37% | Feb 19 2026 |
| 34 | GPT-5.5-Pro | OpenAI | 36% | Apr 23 2026 |
| 35 | Claude Opus 4 | Anthropic | 34% | May 22 2025 |
| 36 | GPT-5.4 mini | OpenAI | 32% | Mar 17 2026 |
| 37 | GLM-5.2 | Z.ai | 31% | Jun 16 2026 |
| 38 | Claude Sonnet 4 | Anthropic | 30% | May 22 2025 |
| 39 | LLaMA 4 Maverick | Meta | 28% | Apr 5 2025 |
| 39 | GLM-5 | Z.ai | 28% | Feb 12 2026 |
| 41 | o3 | OpenAI | 26% | Apr 16 2025 |
| 42 | GPT-5.1 | OpenAI | 25% | Nov 12 2025 |
| 43 | GPT-5.3-Codex | OpenAI | 24% | Feb 5 2026 |
| 44 | GLM-5.1 | Z.ai | 22% | Apr 7 2026 |
| 45 | GPT-5 | OpenAI | 21% | Aug 7 2025 |
| 46 | Gemini 2.5 Pro | Google | 20% | Mar 25 2025 |
| 46 | Qwen3-Coder | Qwen | 20% | Jul 22 2025 |
| 46 | Gemini 3.5 Flash | Google | 20% | May 19 2026 |
| 49 | LLaMA 4 Scout | Meta | 19% | Apr 5 2025 |
| 49 | Gemini 2.5 Flash | Google | 19% | Apr 17 2025 |
| 49 | Grok 4.1 Fast | SpaceXAI | 19% | Nov 19 2025 |
| 52 | DeepSeek-V4-Flash | DeepSeek | 18% | Apr 24 2026 |
| 53 | Gemini 2.0 Flash | Google | 15% | Jan 30 2025 |
| 54 | LLaMA 3.1 | Meta | 14% | Jul 23 2024 |
| 54 | GPT-4.1 | OpenAI | 14% | Apr 14 2025 |
| 54 | GPT-5.4 nano | OpenAI | 14% | Mar 17 2026 |
| 54 | DeepSeek-V4-Pro | DeepSeek | 14% | Apr 24 2026 |
| 58 | DeepSeek-V3.2 | DeepSeek | 13% | Dec 1 2025 |
| 59 | GPT-4o | OpenAI | 12% | May 13 2024 |
| 60 | gpt-oss-120b | OpenAI | 11% | Aug 5 2025 |
| 60 | Gemini 3.1 Flash-Lite | Google | 11% | Mar 3 2026 |
| 62 | Claude 3 Haiku | Anthropic | 10% | Mar 4 2024 |
| 62 | Kimi K2 | Moonshot AI | 10% | Jul 11 2025 |
| 64 | o4-mini | OpenAI | 8% | Apr 16 2025 |
| 64 | DeepSeek R1-0528 | DeepSeek | 8% | May 28 2025 |
| 64 | GLM-4.5 | Z.ai | 8% | Jul 28 2025 |
| 67 | GPT-4o mini | OpenAI | 2% | Jul 18 2024 |


---

Canonical page: https://aireleasetracker.com/benchmark/bullshitbench-v2
Full dataset: https://aireleasetracker.com/llms-full.txt · JSON: https://aireleasetracker.com/models.json
Source: AI Release Tracker (https://aireleasetracker.com). Benchmark scores are the figures published by the releasing lab at launch.
