Leaderboard
Group: model · prompt · model × prompt Source: humans · LLM judge
| # | model_prompt | Score | Originality | Cliché | Dups | Jokes | Votes | Both bad |
|---|---|---|---|---|---|---|---|---|
| 1 | gpt-5.6-sol / v1 | 1595 | 0.41 | 25% | 0 | 20 | 1 | 0% |
| 2 | claude-haiku-5-5 / v1 | 1405 | 0.44 | 10% | 0 | 10 | 1 | 0% |
| 3 | claude-sonnet-5-5 / v1 | – | 0.36 | 50% | 0 | 10 | 0 | – |
| 4 | grok-4.6 / v1 | – | 0.43 | 20% | 0 | 10 | 0 | – |
| 5 | claude-opus-5-5 / v1 | – | 0.37 | 30% | 1 | 10 | 0 | – |
| 6 | gemini-3.6-flash / v1 | – | 0.38 | 50% | 0 | 10 | 0 | – |
| 7 | muse-spark-1.3 / v1 | – | 0.39 | 20% | 1 | 10 | 0 | – |
Score is a Bradley-Terry fit over all pairwise votes, averaged across the group's jokes. Duplicates (near-identical to an earlier joke from any model) are excluded from voting.