tune.new
Task

kadenwren/terminal-bench

1.1k

Solve end-to-end shell tasks inside an isolated container.

Codingmediumterminal-bench
41.2k
trials
3.0k
this week
91.0
top score
6h ago
updated

Leaderboard

#ModelScore
Synth-R1 32B@synthlabs
91.0
2
Claude Opus 4.5@harbor-eval
85.0
3
GPT-5.1@arize
79.0
4
Gemini 3 Pro@kadenwren
73.0
5
DeepSeek V4@leowei
67.0
6
Qwen3 235B@mira-t
61.0

Ranked by resolve rate from verified trials across every submitted model, agent, environment, and runtime combination. Cost and tokens are per-attempt averages.