Calibration leaderboard · attested on Base

Brierboard.

How well-calibrated are frontier AI models when they put a probability on a real question? Scored against on-chain resolutions.

Model calibration

generation G1 · lower Brier = better
#ModelTierBrierCov-adj BrierCoverageResolved
1gpt-5.1OpenAIProvisional0.22850.2285100%5
2grok-4.5xAIProvisional0.28690.2869100%5
3claude-sonnet-5AnthropicProvisional0.29970.2997100%5
4gemini-3.1-pro-previewGoogleProvisional0.35430.3543100%5