¿Te interesa saber cómo diferentes variables interactúan e influyen unas en otras? El análisis de correlación es la clave para desentrañar estas relaciones en tus datos. Tanto si eres un data scientist, un investigador o un profesional de los negocios, comprender el análisis de correlación te permitirá tomar decisiones informadas, gestionar riesgos y extraer insights valiosos de tus datos.
La estadística, como ciencia de los datos, aborda su recolección, estructuración, análisis e interpretación, en particular cuando la variabilidad y la incertidumbre son inherentes. En análisis de datos, uno de los primeros pasos para entender el comportamiento de un fenómeno es estudiar cómo se relacionan dos variables numéricas. Para ello, usamos el análisis de correlación, una técnica clave para detectar patrones y preparar el terreno para modelos predictivos más complejos. Las correlaciones son útiles porque pueden indicar una relación predictiva que puede explotarse en la práctica. Podremos tomar decisiones con una mayor probabilidad de acierto basado en datos.
¿Qué es el Análisis de Correlación?
El análisis de correlación es una técnica estadística utilizada para medir y evaluar la fuerza y la dirección de la relación entre dos o más variables. La correlación es una medida estadística que cuantifica la relación (lineal o monótona) entre dos variables numéricas. ¿Qué tanto cambia una variable cuando cambia la otra? La correlación nos permite medir el signo y magnitud de la tendencia entre dos variables. Esencialmente, la correlación es la medida de cómo dos o más variables están relacionadas entre sí.
El concepto de correlación implica contar con un par de observaciones (X y Y), es decir, el valor que toma Y para determinado valor de X; la correlación permite examinar la tendencia de dos variables a ir juntas, por ejemplo, sabemos que al incrementar la edad también aumentan las cifras de presión arterial, por lo tanto, si queremos responder una pregunta de investigación como ¿cuál es la relación entre edad y presión arterial?, la prueba estadística pertinente es una prueba de correlación. Esta prueba permite cuantificar la magnitud de la correlación entre dos variables y ayuda a predecir valores.
Métodos para Medir la Correlación
Existen varios métodos para medir la correlación, cada uno de ellos adecuado para distintos tipos de datos y situaciones. Tenemos varias formas para poder calcular estas correlaciones en nuestros proyectos, a continuación, veremos cuales son las más conocidas y utilizadas para el cálculo de correlaciones.
Lea también: Aplicación de la Causación en Contabilidad
Covarianza
La covarianza nos muestra qué relación puede haber entre dos variables. Si sale positivo es porque la relación que tenemos entre el valor mayor de la variable 1 y el mayor de la variable 2 tienen relación y comprobamos que tienen un comportamiento similar. Por el contrario, si los valores altos tienen relación con los valores mínimos este nos dará un valor negativo. Si tuviéramos un 0 como valor, esto significa que no tenemos relación entre las variables. La covarianza mide cómo varían conjuntamente dos variables e indica la dirección de su relación (positiva o negativa).
Coeficiente de Correlación de Pearson (r)
El coeficiente de correlación de Pearson, a menudo denominado "r" de Pearson, es el método más utilizado para medir las relaciones lineales entre variables continuas. Es una medida estadística ampliamente utilizada para cuantificar la fuerza y la dirección de una relación lineal entre dos variables continuas. El coeficiente de correlación de Pearson es una relación de dependencia lineal entre dos variables. La diferencia entre la correlación de Pearson y la covarianza es que es independiente de la escala de medida de las variables. Esta correlación la usamos para definir el grado de relación entre dos variables siempre y cuando sean cuantitativas y continuas.
Interpretación del Coeficiente de Pearson
- Correlación positiva (r > 0): Cuando "r" es positiva, indica una relación lineal positiva. Una "r" positiva sugiere que a medida que una variable aumenta, la otra tiende a aumentar.
- Correlación negativa (r < 0): Una "r" negativa indica que cuando una variable aumenta, la otra tiende a disminuir.
- Sin correlación (r ≈ 0): Si "r" se aproxima a 0, la relación lineal entre las variables es escasa o nula.
- Correlación fuerte: Cuando la |r| es cercana a 1 (ya sea positiva o negativa), sugiere una fuerte relación lineal. Si el valor resultado de aplicar la fórmula es 1, lo que nos indica es que la relación entre las dos variables es perfecta.
- Correlación débil: Cuando la |r| está más cerca de 0, implica una relación lineal más débil.
Supuestos y Limitaciones de Pearson
- Linealidad: La correlación de Pearson supone que existe una relación lineal entre las variables.
- Distribución normal: Supone que ambas variables se distribuyen normalmente.
- Valores atípicos: Los valores atípicos pueden tener un impacto significativo en el coeficiente de correlación de Pearson.
Comprender estos supuestos y limitaciones es vital a la hora de interpretar los resultados del análisis de correlación de Pearson.
Correlación de Rango de Spearman (ρ)
La correlación de rango de Spearman, también conocida como "ρ" (rho) de Spearman, es un método no paramétrico utilizado para medir la fuerza y la dirección de la asociación entre dos variables. Este coeficiente de correlación de Spearman es la medida de asociación entre dos variables; además, no necesitamos que sean lineales los datos. Digamos que lo que hace es que, cuando una variable aumenta o disminuye y la segunda también, nos indica que la correlación entre ambas es alta. A diferencia de la correlación de Pearson, también se pueden usar datos ordinales. Con esto es menos sensible a valores extremos o atípicos que nos encontramos muchas veces en nuestros datos.
Para calcularla se requiere que se ordenen los valores de cada sujeto para cada variable X, Y, además de que se asigne un rango. Si existe una correlación fuerte, los rangos deben ser consistentes: bajos rangos de X se correlacionarán con bajos rangos de Y.
Lea también: Marco legal y ejemplos sobre la causación de impuestos
Correlación Tau de Kendall (τ)
La correlación Tau de Kendall, a menudo denominada "τ" (tau), es otro método no paramétrico para evaluar la asociación entre dos variables. El cálculo de la correlación Tau de Kendall implica el recuento de pares de puntos de datos concordantes y discordantes. Una τ positiva (τ > 0) indica una asociación positiva entre variables, mientras que una τ negativa (τ < 0) indica una asociación negativa.
¿Cuándo es más óptimo usar cada método?
La covarianza mide cómo varían conjuntamente dos variables e indica la dirección de su relación (positiva o negativa). No es adecuada para comparar la intensidad de la asociación porque su magnitud depende de las unidades de medida. Para cuantificar la fuerza de una relación lineal entre variables cuantitativas usamos la correlación de Pearson, recomendable cuando la relación es aproximadamente lineal, no hay valores atípicos relevantes y, idealmente, las variables siguen una distribución normal. Si existen valores atípicos, la relación es monótona pero no lineal, o trabajamos con datos ordinales o sin normalidad, es preferible la correlación de Spearman.
El coeficiente de correlación se representa con una "r" y puede tomar valores que van entre −1 y + 1. Un resultado de 0 significa que no hay correlación, es decir, el comportamiento de una variable no se relaciona con el comportamiento de la otra variable. Una correlación perfecta implica un valor de −1 o + 1, lo cual indicaría que al conocer el valor de una variable sería posible determinarse el valor de la otra variable.
Preparación e Interpretación de Datos en el Análisis de Correlación
Antes de sumergirte en el análisis de correlación, debes asegurarte de que tus datos están bien preparados para obtener resultados significativos. Una preparación adecuada de los datos es crucial para obtener resultados precisos y fiables.
Pasos para la preparación de datos:
- Identifica las variables relevantes: Determina qué variables quieres analizar para la correlación.
- Tratamiento de datos faltantes: Define una estrategia adecuada para tratar los valores faltantes.
Una preparación eficaz de los datos sienta las bases para un análisis de correlación sólido. Siguiendo estos pasos, te asegurarás de que tus datos estén limpios, completos y listos para la obtención de insights significativos. Una vez calculados los coeficientes de correlación, el siguiente paso es interpretar los resultados.
Lea también: normativa fiscal sobre el reconocimiento de ingresos
Visualización de la Correlación
Los gráficos de dispersión son representaciones gráficas de puntos de datos en un plano cartesiano, con una variable en el eje x y otra en el eje y. Para examinar visualmente una correlación, se utiliza un diagrama de dispersión, el cual nos permite conocer el comportamiento de ambas variables. Cada uno de los puntos representa la intersección de un par de observaciones (X, Y). Los mapas de calor de correlación son representaciones visuales de los coeficientes de correlación entre múltiples variables.
La magnitud de la correlación nos indica la fuerza de la relación, y toma valores entre -1 a 1. Cuanto más cercano sea el valor a los extremos del intervalo (1 o -1) más fuerte será la tendencia de las variables, o será menor la dispersión que existe en los puntos alrededor de dicha tendencia. En este tipo de correlación es posible inferir un valor de Y si conocemos el valor de X, dado que se modifican constantemente.
Significancia Estadística y p-value
Es fundamental determinar si la correlación observada es estadísticamente significativa. Entre los métodos habituales para evaluar la significancia estadística se incluyen las pruebas de hipótesis (por ejemplo, las pruebas t) o el cálculo de los valores p. Comprender la significancia estadística permite extraer conclusiones con seguridad a partir del análisis de correlaciones y tomar decisiones informadas basadas en los resultados. Además, tenemos otro valor que es el p_value que nos dice si la correlación que tenemos es estadísticamente significativa.
El p_value es un dato que nos va a indicar entre 0 y 1 qué tan probable es observar ciertos resultados bajo una condición específica. Además, este dato nos dirá si son iguales o más inusuales que el resultado que hemos obtenido en el experimento. Con esto podemos entender que si el p_value es 0, no hay relación entre el primer valor y el segundo. En definitiva, el p_value no es una probabilidad como tal, de que una hipótesis sea o no cierta, sino más bien de cuán probable es obtener el resultado tan inusual como el que vemos en un caso.
Coeficiente de Determinación (r²)
Cuando exploramos una correlación lineal entre variables cuantitativas, parte de la variación de la variable Y puede ser debida a X. Sin embargo, en alguna proporción esta variabilidad se deberá a otros factores o como efecto del azar. El coeficiente de determinación se obtiene elevando al cuadrado el valor del coeficiente de correlación (r2). El coeficiente de determinación podrá tomar valores entre 0 y 1. Valores cercanos a 1 implican que una gran proporción de la variabilidad de Y es explicada por X.
La Distinción Crucial: Correlación NO Implica Causalidad
Aunque el análisis de correlación es una herramienta poderosa para descubrir relaciones en los datos, es esencial ser consciente de los errores y escollos comunes que pueden llevar a conclusiones incorrectas. Suponer que la correlación implica causalidad es un error común en el análisis de datos. La correlación entre dos variables no implica, por sí misma, ninguna relación de causalidad (Véase cum hoc ergo propter hoc). Observar que dos variables se mueven conjuntamente no significa necesariamente que una variable sea la causa de la otra.
Las correlaciones entre variables nos indican que existe un patrón en los datos: que las variables que observamos tienden a moverse de manera conjunta. Es posible encontrar una correlación fiable y estadísticamente significativa entre dos variables que en realidad no tienen ninguna relación causal. ¡De hecho, estas correlaciones son comunes!
Ejemplos de Correlaciones Engañosas
- Helados y Ahogamientos: Supongamos que se encuentra una fuerte correlación positiva entre las ventas de helados y el número de ahogamientos durante los meses de verano. Concluir que comer helado provoca ahogamientos sería un error. La solución es que siempre hay que tener cuidado al interpretar la correlación.
- Variables de Confusión: Ignorar o no tener en cuenta las variables de confusión puede llevar a resultados de correlación engañosos. Considera la correlación entre tener secreción nasal y tener ojos llorosos. Sabemos que ninguna causa la otra. En cambio, tener un resfriado causa ambas. Algo más 'C' está al acecho en el fondo y está provocando que 'A' y 'B' se asocien significativamente.
- Ejercicio y Cáncer de Piel: Imagina que estás mirando datos de salud. Se observa una correlación positiva estadísticamente significativa entre el ejercicio y los casos de cáncer de piel - es decir, las personas que hacen más ejercicio tienden a ser las que padecen cáncer de piel a tasas más altas. La correlación parece significativa y fiable, y podemos observarla en múltiples poblaciones de pacientes. Sin hacer más indagaciones, ¡se podría llegar a la conclusión de que el ejercicio causa cáncer! Sin embargo, esta correlación podría existir porque la gente que vive en lugares con mucha luz solar durante todo el año tiene más oportunidades para actividades al aire libre que las personas que viven en lugares que no la reciben. Esta situación se refleja en los datos como un incremento del ejercicio. Al mismo tiempo, mayor exposición diaria a la luz solar significa que hay más casos de cáncer de piel.
Es fundamental para el conocimiento de datos poder distinguir entre aquello que ofrece, o no, una evidencia causal. Si sabemos que A causa B, podemos predecir con confianza que A se correlaciona con B porque la causalidad implica lógicamente correlación. Pero no podemos tener tanta confianza en lo contrario: la correlación no suele proporcionar pruebas sólidas de causalidad. Por lo tanto, las pruebas de correlación son de utilidad para identificar la tendencia de dos variables a ir juntas, lo que no necesariamente significa que cuando dos variables correlacionan entre ellas sea por una relación de causa y efecto.
Cómo Inferir Causalidad: El Camino de la Investigación Científica
Desafortunadamente, se presentan problemas adicionales con el proceso de justificación de reclamos causales. ¿Cómo se puede saber si A se correlaciona accidentalmente con B, o A causa B, o B causa A, o alguna C está causando ambas? Aquí es donde entra en juego la investigación científica. Hay que pensar en todas las explicaciones razonables y luego descartar todo hasta que quede la verdad. Se descarta una explicación cuando se recopilan datos inconsistentes con ella. Todo este proceso de búsqueda de la explicación correcta se llama el método científico para justificar una afirmación causal.
Cuando alguien sugiere una posible explicación -es decir, propone una hipótesis- se debe probar si se quiere saber si aceptar la explicación como correcta. La prueba debe mirar alguna predicción que pueda inferirse de la explicación, alguna predicción que de otra manera no se esperaría. Si los hallazgos reales no concuerdan con esa predicción, entonces se refuta la explicación. El proceso de adivinar una posible explicación y luego tratar de refutarla probando es la dinámica que hace que la ciencia tenga éxito. El camino hacia el conocimiento científico es el camino de conjetura seguido de duras pruebas. No hay otro camino.
En el mundo real, la determinación de causalidad nunca es perfecta. Entender la causalidad es un tema complicado. Nunca tenemos acceso a todos los datos que podríamos necesitar para representar todas las posibles relaciones entre variables. Sin embargo, hay una variedad de técnicas experimentales, estadísticas y de diseño de investigación para encontrar evidencia de relaciones causales.
¿Qué es un Modelo Causal y la Inferencia Causal?
Los modelos causales son herramientas para representar y explicar cómo unas variables (causas) influyen en otras (efectos) dentro de un sistema. A diferencia de la correlación, que solo mide asociación, los modelos causales permiten estimar el efecto de intervenir en una variable sobre las demás. Estos modelos causales se representan por DAGs (diagramas de causalidad) que son nodos donde veríamos las variables y las flechas para indicar relaciones de causa y efecto. Otra forma de representarlos es a través de ecuaciones estructurales (SEM) que nos permite especificar ecuaciones que relacionan las variables causales con sus efectos, incluyendo errores o perturbaciones que explican variaciones no observadas.
La inferencia causal es el conjunto de métodos que usamos para saber el efecto de una acción sobre un resultado en concreto. Básicamente respondería a la pregunta de ¿qué pasaría si hacemos este cambio en la variable?
Métodos para la Inferencia Causal
Experimentos Aleatorizados (RCTs)
Un ensayo controlado aleatorizado (RCT, por sus siglas en inglés) consiste en asignar al azar a los participantes a un grupo de tratamiento o a un grupo de control para identificar el efecto causal. La aleatorización garantiza que, salvo por recibir la intervención, ambos grupos sean comparables en promedio; así, cualquier diferencia en los resultados puede atribuirse al tratamiento.
Por ejemplo, si quisiéramos probar la relación entre ejercicio y cáncer de piel de forma causal, podríamos seleccionar una muestra grande de personas distribuidas en todo el mundo y asignarles al azar que hagan ejercicio en interiores a diferentes niveles cada semana durante décadas. Al final de ese tiempo, registraríamos las tasas de cáncer de piel para cada grupo de personas que hacen ejercicio. ¡Al final, tendríamos un conjunto de datos diseñado experimentalmente para probar la relación entre ejercicio y cáncer de piel! Como el ejercicio ha sido manipulado directamente en el experimento mediante asignación aleatoria, no estará sistemáticamente relacionado con ninguna otra variable que podría ser diferente entre estos dos grupos (asumiendo que todos los demás aspectos del estudio son válidos).
Diseños Cuasi-experimentales
No siempre es realista ni siquiera posible llevar a cabo un experimento controlado. Cuando no tenemos la opción de realizar experimentos aleatorios, se utilizan técnicas como el matching, la regresión de discontinuidad o las diferencias de diferencias (DiD) para imitar las condiciones de un experimento y controlar posibles variables.
- Matching o Emparejamiento: Consiste en la asignación de cada sujeto del grupo de tratamiento con uno del grupo de control que tenga características similares. Así intentamos que las diferencias observadas se produzcan por el tratamiento aplicado y no por diferencias preexistentes.
- Regresión de Discontinuidad: Aprovechamos un punto de corte natural en los datos. Por ejemplo, en marketing, podrían compararse los clientes que ofrecen una mayor puntuación a cierto valor, otorgándole a éstos un beneficio. A partir de ahí, se compararían los clientes que están solo por encima y justo por debajo del nivel. La idea es que estos dos grupos sean muy similares excepto por el hecho de haber recibido o no el beneficio.
- Diferencias en Diferencias (DiD): Analizan la evolución de dos grupos en dos periodos, antes y después de aplicar la intervención.
Modelos Basados en Datos Observacionales
Este sería el más conocido, ya que lo vemos también en herramientas como pueden ser Google Analytics 4 o Google Ads. Usando los métodos estadísticos y de algoritmos de machine learning, se pueden estimar los efectos a partir de datos que no provienen de experimentos controlados normalmente sino de datos históricos de los proyectos. Estos incluyen el uso de variables instrumentales o técnicas de control sintético.
En la práctica, conviene usar la correlación para generar y priorizar hipótesis y la inferencia causal para atribuir impactos y optimizar acciones.
Aplicaciones del Análisis de Correlación e Inferencia Causal
El análisis de correlación tiene una amplia gama de aplicaciones en diversos campos. Comprender las relaciones entre variables puede aportar valiosos insights para la toma de decisiones y la investigación.
- Análisis de la bolsa: El análisis de correlaciones puede ayudar a los inversores y gestores de carteras a evaluar las relaciones entre distintos valores y activos.
- Eficacia de los fármacos: Los investigadores utilizan el análisis de correlación para evaluar la relación entre la dosis del fármaco y la respuesta del paciente.
- Salud: Por ejemplo, en salud, podríamos examinar un amplio conjunto de datos sobre las tasas de enfermedades, la dieta y otros hábitos de salud. Supongamos que buscamos que un mayor ejercicio se correlaciona con tasas más bajas de enfermedades cardíacas (una correlación negativa). Esta correlación es grande y la buscamos de manera fiable. En el caso de estos datos de salud, la correlación puede sugerir una relación causal subyacente, pero sin un trabajo adicional, no la establece. Imagine que después de encontrar esta correlación, como siguiente paso realizamos un estudio biológico que investiga cómo la actividad física afecta al corazón y al sistema circulatorio. Quizás encontremos un mecanismo fisiológico mediante el cual el aumento de la actividad física disminuye la tensión arterial: el ejercicio incrementa la producción de óxido nítrico, lo que provoca que los vasos sanguíneos se dilaten. Una tensión arterial más baja reduce el riesgo de enfermedad cardiovascular, entre otros riesgos para la salud. En este ejemplo, observe que nuestra evidencia causal no fue proporcionada por la prueba de correlación en sí misma, que simplemente cuantificó la relación entre variables a partir de datos observacionales (tasas de enfermedad cardíaca y ejercicio reportado).
Estos son sólo algunos ejemplos de cómo se aplica el análisis de correlación en diversos campos.
Herramientas para el Análisis de Correlación
Python y R son lenguajes de programación ampliamente utilizados para el análisis de datos y ofrecen varias bibliotecas que facilitan el análisis de correlación.
- Python: Es un lenguaje de programación ampliamente utilizado para el análisis de datos y ofrece varias bibliotecas que facilitan el análisis de correlación, incluyendo NumPy y pandas.
- R: Es un potente lenguaje y entorno de programación estadística que destaca en el análisis y visualización de datos. Para el análisis de correlación, se pueden utilizar bibliotecas como corrplot y psych.
tags: #inferir #causacion #de #correlacion #explicacion
