Codesota · Benchmark · Terminal-Bench 2.0Home/Leaderboards/Terminal-Bench 2.0
Unknown

Terminal-Bench 2.0.

Stanford x Laude benchmark for AI agents operating in terminal environments. Terminal-Bench 2.0 evaluates terminal mastery across software engineering, machine learning, security, data science, system administration, file operations, and related operational workflows. Official site lists 89 high-quality tasks and a 124-entry live leaderboard.

Paper ↗Leaderboard ↓Lineage
§ 01 · Leaderboard

Results by metric.

Found a wrong score or missing run?
Use row edits to send a sourced correction into moderation.
Add / edit result ↗Report issue ↗

accuracy

Accuracy is the reported evaluation metric for Terminal-Bench 2.0. Codesota tracks published model scores on this metric so readers can compare state-of-the-art results across sources and model families.

Higher is better

Trust tiers for accuracyverifiedpapervendorcommunityunverified

Muted rows were not state of the art when published — an earlier or same-year result already scored better.

RankModelTrustScoreYearLinksFix
01Codex / GPT-5.5
Rank 1 on terminal-bench@2.0. Agent: Codex. Model: GPT-5.5. Date: 2026-04-23. Official leaderboard reports 82.0% +/- 2.2.
verified822026Source ↗Looks wrong?
02ForgeCode / GPT-5.4
Rank 2 on terminal-bench@2.0. Agent org: ForgeCode. Model org: OpenAI. Date: 2026-03-12. Official leaderboard reports 81.8% +/- 2.0.
verified81.82026Source ↗Looks wrong?
03TongAgents / Gemini 3.1 Pro
Rank 3 on terminal-bench@2.0. Agent org: BIGAI. Model org: Google. Date: 2026-03-13. Official leaderboard reports 80.2% +/- 2.6.
verified80.22026Source ↗Looks wrong?
04ForgeCode / Claude Opus 4.6
Rank 4 on terminal-bench@2.0. Agent org: ForgeCode. Model org: Anthropic. Date: 2026-03-12. Official leaderboard reports 79.8% +/- 1.6.
verified79.82026Source ↗Looks wrong?
05SageAgent / GPT-5.3-Codex
Rank 5 on terminal-bench@2.0. Agent org: OpenSage. Model org: OpenAI. Date: 2026-03-13. Official leaderboard reports 78.4% +/- 2.2.
verified78.42026Source ↗Looks wrong?
06ForgeCode / Gemini 3.1 Pro
Rank 6 on terminal-bench@2.0. Agent org: ForgeCode. Model org: Google. Date: 2026-03-02. Official leaderboard reports 78.4% +/- 1.8.
verified78.42026Source ↗Looks wrong?
07Droid / GPT-5.3-Codex
Rank 7 on terminal-bench@2.0. Agent org: Factory. Model org: OpenAI. Date: 2026-02-24. Official leaderboard reports 77.3% +/- 2.2.
verified77.32026Source ↗Looks wrong?
08Capy / Claude Opus 4.6
Rank 8 on terminal-bench@2.0. Agent org: Capy. Model org: Anthropic. Date: 2026-03-12. Official leaderboard reports 75.3% +/- 2.4.
verified75.32026Source ↗Looks wrong?
09Simple Codex / GPT-5.3-Codex
Rank 9 on terminal-bench@2.0. Agent org: OpenAI. Model org: OpenAI. Date: 2026-02-06. Official leaderboard reports 75.1% +/- 2.4.
verified75.12026Source ↗Looks wrong?
10Terminus-KIRA / Gemini 3.1 Pro
Rank 10 on terminal-bench@2.0. Agent org: KRAFTON AI. Model org: Google. Date: 2026-02-23. Official leaderboard reports 74.8% +/- 2.6.
verified74.82026Source ↗Looks wrong?
11Terminus-KIRA / Claude Opus 4.6
Rank 11 on terminal-bench@2.0. Agent org: KRAFTON AI. Model org: Anthropic. Date: 2026-02-22. Official leaderboard reports 74.7% +/- 2.6.
verified74.72026Source ↗Looks wrong?
12Mux / GPT-5.3-Codex
Rank 12 on terminal-bench@2.0. Agent org: Coder. Model org: OpenAI. Date: 2026-03-06. Official leaderboard reports 74.6% +/- 2.5.
verified74.62026Source ↗Looks wrong?
13MAYA-V2 / Claude 4.6 Opus
Rank 13 on terminal-bench@2.0. Agent org: ADYA. Model org: Anthropic. Date: 2026-03-12. Official leaderboard reports 72.1% +/- 2.2.
verified72.12026Source ↗Looks wrong?
14TongAgents / Claude Opus 4.6
Rank 14 on terminal-bench@2.0. Agent org: Bigai. Model org: Anthropic. Date: 2026-02-22. Official leaderboard reports 71.9% +/- 2.7.
verified71.92026Source ↗Looks wrong?
15Junie CLI / Multiple
Rank 15 on terminal-bench@2.0. Agent org: JetBrains. Model org: Multiple. Date: 2026-03-07. Official leaderboard reports 71.0% +/- 2.9.
verified712026Source ↗Looks wrong?
16CodeBrain-1 / GPT-5.3-Codex
Rank 16 on terminal-bench@2.0. Agent org: Feeling AI. Model org: OpenAI. Date: 2026-02-10. Official leaderboard reports 70.3% +/- 2.6.
verified70.32026Source ↗Looks wrong?
17Droid / Claude Opus 4.6
Rank 17 on terminal-bench@2.0. Agent org: Factory. Model org: Anthropic. Date: 2026-02-05. Official leaderboard reports 69.9% +/- 2.5.
verified69.92026Source ↗Looks wrong?
18Ante / Gemini 3 Pro
Rank 18 on terminal-bench@2.0. Agent org: Antigma Labs. Model org: Google. Date: 2026-01-06. Official leaderboard reports 69.4% +/- 2.1.
verified69.42026Source ↗Looks wrong?
19IndusAGI Coding Agent / GPT-5.3-Codex
Rank 19 on terminal-bench@2.0. Agent org: Varun Israni (SoloVpx). Model org: OpenAI. Date: 2026-03-18. Official leaderboard reports 69.1% +/- 2.3.
verified69.12026Source ↗Looks wrong?
20Crux / Claude Opus 4.6
Rank 20 on terminal-bench@2.0. Agent org: Roam. Model org: Anthropic. Date: 2026-02-23. Official leaderboard reports 66.9% +/- N/A.
verified66.92026Source ↗Looks wrong?
Lineage

Terminal-Bench 2.0 in context.

See full agentic ai benchmarks lineage →
This benchmark (1)
active2026-04
Terminal-Bench 2.0
None yet — this is the current frontier.
§ 04 · Submit a result

Add to the leaderboard.

Submit a Result

Sign in to submit benchmark results for Terminal-Bench 2.0.

Sign in
← Back to Leaderboards