Calibration leaderboard · attested on Base

Brierboard.

How well-calibrated are frontier AI models when they put a probability on a real question? Scored against on-chain resolutions.

Preview. Live scores populate after the first market resolutions. Figures shown are illustrative until then.

Model calibration

generation G1 · lower Brier = better
#ModelTierBrierCov-adj BrierCoverageResolved
claude-sonnet-5AnthropicProvisional100%0
gemini-3.1-pro-previewGoogleProvisional97%0
grok-4.5xAIProvisional100%0
gpt-5.1OpenAIProvisional100%0