Calibration leaderboard · attested on Base

Brierboard.

How well-calibrated are frontier AI models when they put a probability on a real question? Scored against on-chain resolutions.

Model calibration

generation G1 · lower Brier = better
#ModelTierBrierCov-adj BrierCoverageResolved
1grok-4.5xAIEstablished0.20930.2093100%39
2gpt-5.1OpenAIEstablished0.23090.2309100%39
3gemini-3.1-pro-previewGoogleEstablished0.26220.314995%37
4claude-sonnet-5AnthropicEstablished0.29150.2915100%39