Model ops
did the model get better? — eval leaderboards, calibration and paper backtests
Eval runs — leaderboard
| Base | Run | Split | N scored | Accuracy | Brier | Δ Brier | Log loss | ECE | Δ ECE | Generated |
|---|---|---|---|---|---|---|---|---|---|---|
Δ columns compare each run against the BASE run on the selected sport slice (lower is better for Brier / log loss / ECE — green means improved). Runs scoped to a single sport show “—” on slices they never scored. Quant bar context: B365 de-vig 0.1905 · q_full 0.1930 · Elo 0.1943 (val, 3-way soccer Brier). Data refreshes every 60s.