Terminal-Bench 4.0 Leaderboard 2026: AI Models & Agents Ranked by Real CLI Work
Terminal-Bench 4.0 public board remains led by GPT-6 Astra (58.2%); Grok 4.7 is listed at 37.6% ±3.5 ($3.7k, 5.5B tokens). Separate, unranked runs: Anthropic Opus 5.5 66.4%, Cognition SWE-2 27.3%, and Artificial Analysis Codex runs GPT-6 Sol 44% / Luna 13%. Harness caveats included. Updated Sep 25, 2026.
· 4.3K views
· Abdeladim Fadheli