Calibración
| Tramo | Predicho | Observado | n | Diferencia | Lectura |
|---|---|---|---|---|---|
| 35-40% | 37.7% | 0.0% | 1 | -37.7 pp | Muestra corta |
| 40-45% | 44.0% | 0.0% | 1 | -44.0 pp | Muestra corta |
| 45-50% | 48.1% | 0.0% | 2 | -48.1 pp | Muestra corta |
| 60-65% | 61.4% | 100.0% | 1 | +38.6 pp | Muestra corta |
| 65-70% | 68.2% | 100.0% | 1 | +31.8 pp | Muestra corta |
| 75-80% | 78.9% | 100.0% | 1 | +21.1 pp | Muestra corta |
| 80-85% | 81.7% | 100.0% | 1 | +18.3 pp | Muestra corta |
Los tramos con menos de 30 observaciones van apagados y sin lectura: con esa muestra la diferencia es ruido. Observar por encima de lo predicho no es una buena noticia, es infraconfianza; el objetivo es que la diferencia sea cero en los dos sentidos. ECE = suma ponderada por n de la diferencia absoluta entre predicho y observado.
Métricas globales
Uniforme 0.2222 · mercado 0.1934. Es la variante que publicamos; la multiclase es tres veces mayor para el MISMO modelo, así que declararla no es un detalle.
Uniforme 1.0986 (ln 3). Métrica primaria interna: castiga con dureza la confianza equivocada.
Uniforme 0.2222. Es la métrica con la que se compara la literatura académica.
Mercado 1.21-1.72%. Por encima del 5% las probabilidades no sirven para compararse con un precio, y lo diríamos aquí.
n = 8 predicciones liquidadas. No publicamos porcentaje por debajo de 200: el intervalo sería tan ancho que la cifra no diría nada.
Sobre el ROI: no se publica con menos de 500 liquidaciones y nunca sin intervalo. A un precio medio de 2,5 y un rendimiento real del +5%, el intervalo al 95% con n = 100 es de unos ±24 puntos: un "+18%" sobre 120 observaciones es ruido presentado como resultado. Tampoco se publica rendimiento acumulado sobre banca, que es la clase de cifra que dispara la alarma de estafa incluso siendo aritméticamente cierta.
Por competición
| Competición | n | Acierto | IC 95% | Brier | Estado |
|---|---|---|---|---|---|
| Liga Profesional Argentina | 3 | — | — | — | Muestra insuficiente (n = 3) |
| LaLiga | 3 | — | — | — | Muestra insuficiente (n = 3) |
| Major League Soccer | 1 | — | — | — | Muestra insuficiente (n = 1) |
| Brasileirao Serie A | 1 | — | — | — | Muestra insuficiente (n = 1) |
Por versión de modelo
| Versión | n | Acierto | IC 95% | Activa desde |
|---|---|---|---|---|
| quant-1.0.0 | 8 | — | muestra insuficiente | 2026-08-25 |
Las dos tablas de calibración, y cuál es esta
Existen dos y confundirlas es fácil, así que se dice cuál se está viendo. Esta página muestra la calibración de la probabilidad publicada — la del escenario que se publica en cada partido, que es la que valida la promesa "si digo 70%, ocurre el 70%".
La otra es la calibración por clase de los tres resultados, que es la que necesita el recalibrado isotónico interno. Con menos de 200 muestras el recalibrado no se aplica en absoluto: se usa la identidad y se dice que el modelo está "sin recalibrar todavía", porque inventar una corrección con 40 observaciones es peor que no corregir.
La metodología define qué cuenta como acierto y cuál es el denominador exacto. El verificador recalcula todo esto en tu navegador desde el archivo descargado.