Leaderboard
Group: model · prompt · model × prompt Source: humans · LLM judge
| # | prompt_id | Score | Originality | Cliché | Dups | Jokes | Votes | Both bad |
|---|---|---|---|---|---|---|---|---|
| 1 | v1 | – | 0.35 | 34% | 14 | 170 | 0 | – |
Score is a Bradley-Terry fit over all pairwise votes, averaged across the group's jokes. Duplicates (near-identical to an earlier joke from any model) are excluded from voting.