Saltar al contenido

Calibración

Cuando decimos 60%, ¿ocurre el 60%? Esta es la tabla que responde, y la que el marketing no puede tocar.
Probabilidad publicada frente a frecuencia observada
ECE 35.96%mercado 1.21%n = 8
Calibración: para cada tramo de probabilidad publicada, la frecuencia con la que ocurrió, el tamaño de muestra y la diferencia en puntos porcentuales.
TramoPredichoObservadonDiferenciaLectura
35-40%37.7%0.0%1-37.7 ppMuestra corta
40-45%44.0%0.0%1-44.0 ppMuestra corta
45-50%48.1%0.0%2-48.1 ppMuestra corta
60-65%61.4%100.0%1+38.6 ppMuestra corta
65-70%68.2%100.0%1+31.8 ppMuestra corta
75-80%78.9%100.0%1+21.1 ppMuestra corta
80-85%81.7%100.0%1+18.3 ppMuestra corta

Los tramos con menos de 30 observaciones van apagados y sin lectura: con esa muestra la diferencia es ruido. Observar por encima de lo predicho no es una buena noticia, es infraconfianza; el objetivo es que la diferencia sea cero en los dos sentidos. ECE = suma ponderada por n de la diferencia absoluta entre predicho y observado.

Métricas globales

Cada una con la línea base de un pronóstico uniforme y, cuando existe, con la referencia medida del mercado.
Brier (media por resultado)
0.1581

Uniforme 0.2222 · mercado 0.1934. Es la variante que publicamos; la multiclase es tres veces mayor para el MISMO modelo, así que declararla no es un detalle.

Log loss
0.8299

Uniforme 1.0986 (ln 3). Métrica primaria interna: castiga con dureza la confianza equivocada.

RPS
0.1825

Uniforme 0.2222. Es la métrica con la que se compara la literatura académica.

ECE
35.96%

Mercado 1.21-1.72%. Por encima del 5% las probabilidades no sirven para compararse con un precio, y lo diríamos aquí.

Acierto 1X2 · histórico completo
—Muestra insuficiente

n = 8 predicciones liquidadas. No publicamos porcentaje por debajo de 200: el intervalo sería tan ancho que la cifra no diría nada.

Sobre el ROI: no se publica con menos de 500 liquidaciones y nunca sin intervalo. A un precio medio de 2,5 y un rendimiento real del +5%, el intervalo al 95% con n = 100 es de unos ±24 puntos: un "+18%" sobre 120 observaciones es ruido presentado como resultado. Tampoco se publica rendimiento acumulado sobre banca, que es la clase de cifra que dispara la alarma de estafa incluso siendo aritméticamente cierta.

Por competición

Solo se publica cifra con n mayor o igual a 200 en esa competición. Por debajo se dice "muestra insuficiente" con su n, que es la información honesta.
Acierto por competición con muestra, intervalo de confianza y Brier.
CompeticiónnAciertoIC 95%BrierEstado
Liga Profesional Argentina3———Muestra insuficiente (n = 3)
LaLiga3———Muestra insuficiente (n = 3)
Major League Soccer1———Muestra insuficiente (n = 1)
Brasileirao Serie A1———Muestra insuficiente (n = 1)

Por versión de modelo

Segmentado y nunca recalculado hacia atrás. Si una versión nueva acierta más, se ve como una fila nueva con su propia n, no reescribiendo la historia.
VersiónnAciertoIC 95%Activa desde
quant-1.0.08—muestra insuficiente2026-08-25

Las dos tablas de calibración, y cuál es esta

Existen dos y confundirlas es fácil, así que se dice cuál se está viendo. Esta página muestra la calibración de la probabilidad publicada — la del escenario que se publica en cada partido, que es la que valida la promesa "si digo 70%, ocurre el 70%".

La otra es la calibración por clase de los tres resultados, que es la que necesita el recalibrado isotónico interno. Con menos de 200 muestras el recalibrado no se aplica en absoluto: se usa la identidad y se dice que el modelo está "sin recalibrar todavía", porque inventar una corrección con 40 observaciones es peor que no corregir.

La metodología define qué cuenta como acierto y cuál es el denominador exacto. El verificador recalcula todo esto en tu navegador desde el archivo descargado.