Base language model benchmark

BananaMindBench Leaderboard

Text-completion performance on 350 BananaMind Base Bench 1.1 examples, ranked by fixed-item Overall Elo.

Maximum parameter size for submissions: 250M.

350 examples 7 categories 4 continuations per example Mean conditional log-likelihood Higher Elo is better
Model size

Official results

Base Bench 1.1