🌯 BurritoBench 11 models · 156 jokes · 0 votes

Leaderboard

Group: model · prompt · model × prompt    Source: humans · LLM judge

#model_promptScoreOriginalityClichéDupsJokesVotesBoth bad
1claude-sonnet-5-5 / v1 – 0.32 50%0100 –
2claude-haiku-5-5 / v1 – 0.43 10%0100 –
3gpt-5.6-sol / v1 – 0.35 25%0200 –
4grok-4.6 / v1 – 0.42 20%0100 –
5claude-opus-5-5 / v1 – 0.34 30%1100 –
6gemini-3.6-flash / v1 – 0.35 50%0100 –
7muse-spark-1.3 / v1 – 0.37 20%1100 –
8or-gemini-3.8-flash / v1 – 0.45 20%0100 –
9or-gemini-3.1-pro / v1 – 0.35 60%0200 –
10or-gpt-5.6-sol / v1 – 0.33 32%7400 –
11or-claude-fable-5-1 / v1 – 0.30 40%5200 –

Score is a Bradley-Terry fit over all pairwise votes, averaged across the group's jokes. Duplicates (near-identical to an earlier joke from any model) are excluded from voting.