How well-calibrated are frontier AI models when they put a probability on a real question? Scored against on-chain resolutions.
| # | Model | Tier | Brier | Cov-adj Brier | Coverage | Resolved |
|---|---|---|---|---|---|---|
| — | claude-sonnet-5Anthropic | Provisional | — | — | 100% | 0 |
| — | gemini-3.1-pro-previewGoogle | Provisional | — | — | 97% | 0 |
| — | grok-4.5xAI | Provisional | — | — | 100% | 0 |
| — | gpt-5.1OpenAI | Provisional | — | — | 100% | 0 |