Base language model benchmark
BananaMindBench Leaderboard
Text-completion performance on 350 BananaMind Base Bench 1.1 examples, ranked by fixed-item Overall Elo.
Maximum parameter size for submissions: 250M.
Model advisor
Not sure where to start?
Choose your use case, capability priorities, and parameter range.
Rank cards by
Parameter efficiency
Overall Elo vs parameters
Higher Overall Elo is better. Fewer parameters are farther right. Models above the dashed 805 Elo line exceed random-choice chance. Frontier models are directly labeled; near-identical markers are offset slightly for visibility. Hover any point for exact details.