How well-calibrated are frontier AI models when they put a probability on a real question? Scored against on-chain resolutions.
| # | Model | Tier | Brier | Cov-adj Brier | Coverage | Resolved |
|---|---|---|---|---|---|---|
| 1 | grok-4.5xAI | Established | 0.1536 | 0.1558 | 99% | 106 |
| 2 | gemini-3.1-pro-previewGoogle | Established | 0.1640 | 0.2595 | 94% | 101 |
| 3 | gpt-5.1OpenAI | Established | 0.1666 | 0.1666 | 100% | 107 |
| 4 | claude-sonnet-5Anthropic | Established | 0.1746 | 0.1746 | 100% | 107 |