Leaderboard
Group: model · prompt · model × prompt Source: humans · LLM judge
| # | model_prompt | Score | Originality | Cliché | Dups | Jokes | Votes | Both bad |
|---|---|---|---|---|---|---|---|---|
| 1 | claude-sonnet-5-5 / v1 | – | 0.32 | 50% | 0 | 10 | 0 | – |
| 2 | claude-haiku-5-5 / v1 | – | 0.43 | 10% | 0 | 10 | 0 | – |
| 3 | gpt-5.6-sol / v1 | – | 0.35 | 25% | 0 | 20 | 0 | – |
| 4 | grok-4.6 / v1 | – | 0.42 | 20% | 0 | 10 | 0 | – |
| 5 | claude-opus-5-5 / v1 | – | 0.34 | 30% | 1 | 10 | 0 | – |
| 6 | gemini-3.6-flash / v1 | – | 0.35 | 50% | 0 | 10 | 0 | – |
| 7 | muse-spark-1.3 / v1 | – | 0.37 | 20% | 1 | 10 | 0 | – |
| 8 | or-gemini-3.8-flash / v1 | – | 0.45 | 20% | 0 | 10 | 0 | – |
| 9 | or-gemini-3.1-pro / v1 | – | 0.35 | 60% | 0 | 20 | 0 | – |
| 10 | or-gpt-5.6-sol / v1 | – | 0.33 | 32% | 7 | 40 | 0 | – |
| 11 | or-claude-fable-5-1 / v1 | – | 0.30 | 40% | 5 | 20 | 0 | – |
Score is a Bradley-Terry fit over all pairwise votes, averaged across the group's jokes. Duplicates (near-identical to an earlier joke from any model) are excluded from voting.