Probability Calibration

probability-calibrationclassificationreliabilityforecast-evaluationisotonic-regressionproper-scoring-rulecredit-scoringmachine-learning

Definition

A probabilistic classifier (or forecaster) is calibrated if its stated probabilities match observed frequencies: among all cases assigned probability pp, a fraction p\approx p actually turn out positive. Calibration is a property distinct from discrimination (the ability to rank cases, measured by accuracy, AUC/lift): a model can rank perfectly yet be badly miscalibrated (scores too extreme or too timid), and vice versa. Calibration matters wherever the magnitude of a probability drives a decision — pricing default risk, expected-loss reserving, medical risk communication, cost-sensitive classification.

Key Ideas

How It Works

Assess calibration on held-out data: build a reliability diagram or fit the calibration slope/intercept (or the Spiegelhalter/Cox tests); summarize overall accuracy with the Brier score and its reliability decomposition. If miscalibrated, fit a recalibration map (Platt/isotonic) on a separate calibration split and apply it to future scores. Beware small bins (noisy reliability estimates) and distribution shift (a recalibration learned on one population need not transfer).

Why It Matters

Open Questions

Related