Sandbox de causalidad
Genera datos sintéticos a partir de distintas estructuras causales y observa cómo cambian la correlación y la pendiente.
por qué los grafos causales superan a las tablas de correlación 🖖
<p>Una correlación indica que dos variables se mueven juntas — no por qué. El mismo número puede surgir de tres estructuras fundamentalmente distintas:</p><ul><li>Causa directa (X → Y): eliminar X cambia Y.</li><li>Factor de confusión (Z → X, Z → Y): Z causa ambos; X e Y están correlacionadas, pero ninguna causa a la otra. Controlar por Z elimina la correlación.</li><li>Colisionador (X → Z ← Y): X e Y son independientes, pero si seleccionas o condicionas sobre Z, creas un vínculo espurio entre ellas.</li></ul><p>El grafo acíclico dirigido (DAG) del gráfico codifica qué variables son causas y cuáles efectos. Sin él no puedes distinguir estos casos a partir de un único coeficiente de correlación — por eso la inferencia causal siempre empieza con un modelo estructural, no con una matriz de correlaciones.</p>
correlación es ver, causalidad es hacer 🖖
La idea más profunda de este laboratorio es la diferencia entre observar una variable y modificarla. Los factores de confusión y los colisionadores nos engañan porque solo vemos datos que algún proceso oculto ya moldeó. Un experimento aleatorizado rompe esto: asignar X con el lanzamiento de una moneda corta toda flecha que apunta hacia X, así que cualquier correlación con Y que sobreviva tiene que ser causal. Por eso un ensayo controlado resuelve una pregunta que ningún volumen de datos observacionales puede resolver.
la paradoja de las admisiones de Berkeley 🖖
El escenario de Simpson no es un juguete. En 1973, las admisiones de posgrado de UC Berkeley mostraron cerca del 44% de hombres admitidos frente al 35% de mujeres, sugiriendo un sesgo. Sin embargo, departamento por departamento, las mujeres eran admitidas a tasas algo más altas: simplemente habían solicitado en mucho mayor número a los departamentos más competitivos. Agregar entre departamentos invirtió la tendencia interna de cada grupo, exactamente la reversión que traza la línea discontinua de esta herramienta.
Problemas de ejemplo
- Causal - Un vínculo causal directo X->Y produce una fuerte correlación por la razón correcta
- Confusión - Una variable oculta Z influye tanto en X como en Y, generando correlación sin causalidad directa
- Colisionador - Condicionar sobre una variable colisionadora induce una asociación espuria entre X e Y
- Simpson - La tendencia agregada se invierte al estratificar los datos por subgrupo