Software engineering
Expert-SWE (Internal)
OpenAI's private set of expert-level software-engineering problems. Higher is better.
Rankings
Higher is betterExpert-SWE (Internal) — frequently asked questions
- What is Expert-SWE (Internal)?
- OpenAI's private set of expert-level software-engineering problems. Higher is better.
- Which AI model scores highest on Expert-SWE (Internal)?
- GPT-5.5 by OpenAI holds the best Expert-SWE (Internal) result among tracked models, at 73.1% (released Apr 23 2026). Higher scores are better on this benchmark.
- What are the top 2 models on Expert-SWE (Internal)?
- 1. GPT-5.5 (OpenAI) — 73.1%; 2. GPT-5.4 (OpenAI) — 68.5%.
- How many models have a published Expert-SWE (Internal) score?
- 2 tracked models have a published Expert-SWE (Internal) score. Scores are the figures reported by each lab at that model's release, so this page is a record of results over time rather than a re-run leaderboard.