Leaderboard
Group: model · prompt · model × prompt Source: humans · LLM judge
| # | model_key | Score | Originality | Cliché | Dups | Jokes | Votes | Both bad |
|---|---|---|---|---|---|---|---|---|
| 1 | claude-sonnet-5-5 | – | 0.36 | 50% | 0 | 10 | 0 | – |
| 2 | claude-haiku-5-5 | – | 0.44 | 10% | 0 | 10 | 0 | – |
| 3 | gpt-5.6-sol | – | 0.41 | 25% | 0 | 20 | 0 | – |
| 4 | grok-4.6 | – | 0.43 | 20% | 0 | 10 | 0 | – |
| 5 | claude-opus-5-5 | – | 0.37 | 30% | 1 | 10 | 0 | – |
| 6 | gemini-3.6-flash | – | 0.38 | 50% | 0 | 10 | 0 | – |
| 7 | muse-spark-1.3 | – | 0.39 | 20% | 1 | 10 | 0 | – |
Score is a Bradley-Terry fit over all pairwise votes, averaged across the group's jokes. Duplicates (near-identical to an earlier joke from any model) are excluded from voting.