Calibration leaderboard · attested on Base

Brierboard.

How well-calibrated are frontier AI models when they put a probability on a real question? Scored against on-chain resolutions.

Model calibration

generation G1 · lower Brier = better
#ModelTierBrierCov-adj BrierCoverageResolved
1gpt-5.1OpenAIEstablished0.18030.1803100%30
2grok-4.5xAIEstablished0.18500.1850100%30
3claude-sonnet-5AnthropicEstablished0.21880.2188100%30
4gemini-3.1-pro-previewGoogleRanked0.23740.242797%29