Modelos de árbol — umbrales e interacciones
La regresión responde a una sola pregunta: cuánto se mueve la respuesta por cada unidad de entrada. Dos patrones muy habituales en planta se le escapan: un efecto que solo empieza por encima de un umbral (todo bien hasta 700 °C, ruinoso por encima) y un efecto que solo aparece cuando dos entradas son altas a la vez.
Un árbol busca puntos de corte, así que encuentra ambos. Un solo árbol es legible pero memoriza sus datos; un bosque aleatorio promedia cientos de árboles y generaliza mucho mejor, a cambio de no poder dibujarse.
Aquí la importancia se mide por permutación sobre filas que el modelo nunca vio: se baraja una variable y se observa cuánto cae la puntuación. Así se evita el sesgo de la importancia por impureza, que favorece a las columnas con muchos valores distintos. Aun así, importancia no es causalidad: dos copias de la misma medida se reparten el mérito y pueden parecer ambas irrelevantes.
Un árbol busca puntos de corte, así que encuentra ambos. Un solo árbol es legible pero memoriza sus datos; un bosque aleatorio promedia cientos de árboles y generaliza mucho mejor, a cambio de no poder dibujarse.
Aquí la importancia se mide por permutación sobre filas que el modelo nunca vio: se baraja una variable y se observa cuánto cae la puntuación. Así se evita el sesgo de la importancia por impureza, que favorece a las columnas con muchos valores distintos. Aun así, importancia no es causalidad: dos copias de la misma medida se reparten el mérito y pueden parecer ambas irrelevantes.
Pruébalo en la app
Pruebe: pestaña Modelos de árbol → Cargar ejemplo → Ajustar modelo. Compare la puntuación fuera de muestra con la de entrenamiento y luego cambie el modelo a «árbol único» para leer los cortes.