Software engineering

Expert-SWE (Internal)

OpenAI's private set of expert-level software-engineering problems. Higher is better.

Rankings

Higher is better

Expert-SWE (Internal) — frequently asked questions

What is Expert-SWE (Internal)?
OpenAI's private set of expert-level software-engineering problems. Higher is better.
Which AI model scores highest on Expert-SWE (Internal)?
GPT-5.5 by OpenAI holds the best Expert-SWE (Internal) result among tracked models, at 73.1% (released Apr 23 2026). Higher scores are better on this benchmark.
What are the top 2 models on Expert-SWE (Internal)?
1. GPT-5.5 (OpenAI) — 73.1%; 2. GPT-5.4 (OpenAI) — 68.5%.
How many models have a published Expert-SWE (Internal) score?
2 tracked models have a published Expert-SWE (Internal) score. Scores are the figures reported by each lab at that model's release, so this page is a record of results over time rather than a re-run leaderboard.
← All benchmarks