En estadística avanzada, uno de los objetivos básicos es la estimación de un parámetro relevante de una población de interés. Por ejemplo, una empresa que disponga de un departamento de atención al cliente, querrá conocer el tiempo medio que uno de sus operadores telefónicos dedica a cada cliente para de esta manera organizar turnos de trabajo y número de empleados por franja horaria.
Aparece aquí el concepto de Error Cuadrático Medio (ECM) o Mean Squared Error (MSE) en inglés, uno de los criterios más utilizados a la hora de medir la calidad de un estimador de un parámetro. Este concepto se estudia de manera teórica en cursos de estadística y matemáticas, lo cual dificulta en gran medida su comprensión y alcance.
Este artículo tratará acerca del tema estadístico de error cuadrático medio y describirá la relación de este método con la regresión lineal, la regresión más básica en el contexto del aprendizaje automático (machine learning). El ejemplo consiste de puntos en el eje cartesiano. Definiremos una función matemática que nos dará la línea recta que pasa en medio de todos los puntos del eje cartesiano. De esta manera, aprenderemos la conexión entre estos dos métodos y cómo los resultados de su conexión aparecen juntos.
¿Qué es el Error Cuadrático Medio (ECM)?
El error cuadrático (MSE) mide el promedio de los errores elevados al cuadrado. El hecho que el MSE es casi siempre estrictamente positivo (y no cero) es debido a la aleatoriedad o a que el estimador carece de información con la que pueda producir una mejor estimación.
Diferencia con la Raíz del Error Cuadrático Medio (RECM) y Desviación Estándar
La Raíz del Error Cuadrático Medio, también conocida como Error Estándar, se define para i=1, 2, 3, …n. En un número finito de mediciones, la Raíz del Error Cuadrático Medio se expresa comúnmente mediante la siguiente fórmula: √[∑di^2/n]=Re, donde: n es el número de mediciones; di es la desviación de un conjunto de valores medidos con respecto al Valor Verdadero.
Lea también: Deducción IVA: Guía Paso a Paso
La Raíz del Error Cuadrático Medio (RECM) es la raíz cuadrada de la relación entre la suma de los cuadrados de las desviaciones de los valores predichos respecto a los valores verdaderos y el número de observaciones n. En la medición práctica, el número de observaciones n siempre es limitado, y el valor verdadero solo puede ser reemplazado por el valor más confiable (óptimo).
El Error Estándar es muy sensible a los errores extremadamente grandes o pequeños en un conjunto de mediciones, por lo que puede reflejar bien la precisión de la medición. Esta es precisamente la razón por la cual el Error Estándar es ampliamente adoptado en la medición ingenieril. Si la distribución estadística de los errores es una Distribución normal, entonces la Probabilidad de que el error aleatorio se encuentre dentro de ±σ es del 68%.
Por lo tanto, la Desviación Estándar se utiliza para medir el grado de dispersión de un conjunto de datos en sí mismo, mientras que la Raíz del Error Cuadrático Medio se utiliza para medir la desviación entre los valores observados y los valores verdaderos. Sus objetos de estudio y propósitos son diferentes, pero sus procesos de cálculo son similares.
La desviación estándar es la raíz cuadrada aritmética de la varianza. La desviación estándar puede reflejar el grado de dispersión de un conjunto de datos. Para conjuntos con la misma media aritmética, la desviación estándar no necesariamente es la misma. La desviación estándar también se conoce como desviación típica o desviación estándar experimental. Del mismo modo, la varianza y la desviación estándar (la raíz cuadrada de la varianza, debido a la falta de uniformidad en las unidades) también representan el grado de dispersión de los datos. La Raíz del Error Cuadrático Medio calcula la desviación entre los valores observados y sus valores verdaderos, o entre los valores observados y sus valores simulados, no la desviación entre los valores observados y su media.
Error Cuadrático Medio en Regresión Lineal
Supongamos que tenemos siete puntos, nuestro objetivo es encontrar la línea que minimiza la suma de las distancias elevadas al cuadrado de estos puntos. Tratemos de comprender esto. Tomemos un ejemplo y tracemos una línea en medio de siete puntos aleatorios.
Lea también: Guía para la deducción del ISR
Representación Gráfica de los Errores
Los puntos púrpuras son los siete puntos aleatorios en la gráfica. Cada punto posee una coordenada X y una coordenada Y.
La línea azul es nuestra línea de predicción. Es una línea que pasa a través de todos los puntos y que se ajusta a ellos de la mejor manera posible, de este modo esta línea contiene todos los puntos.
La línea roja entre cada punto púrpura y la línea de predicción son los errores. Cada error es la distancia desde el punto hasta su punto estimado.
Puede que ahora recuerdes esta ecuación en tus días de escuela, y=Mx+B, donde M es la pendiente de la recta, y B es su intercepto. Queremos encontrar la pendiente M y el intercepto B que minimiza el error cuadrático.
Deducción Matemática de las Ecuaciones de la Recta de Regresión
Fórmula General para el Error Cuadrático Medio (MSE) en Regresión
Definamos la ecuación matemática que nos proporcionará el error cuadrático medio para todos nuestros puntos.
Lea también: Consideraciones sobre la Deducción de IVA en México
Analicemos el significado de esta ecuación:
- Sigma representa la suma de la secuencia de números desde i=1 hasta n. Imaginemos esto cómo un arreglo de puntos, donde en el proceso se pasa a través de todos los puntos, desde el primero (i=1) hasta el último (i=n).
- Por cada punto, tomamos la coordenada y del punto, y la coordenada y’. Sustraemos la coordenada y, de nuestra coordenada y’ (es decir los valores estimados) y calculamos el cuadrado del resultado.
- La tercera parte es tomar la suma de todos los valores (y-y’)², es decir, la diferencia entre los valores reales y estimados elevados al cuadrado. Finalmente procedemos a dividir esas diferencias al cuadrado por n y así obtenemos la media.
Nuestro objetivo es minimizar esta media. Lo que nos proveerá con la mejor línea que pasa a través de los puntos.
Del Concepto a las Ecuaciones Matemáticas
Esta parte es para las personas que quieren comprender cómo obtenemos las ecuaciones matemáticas. Cómo vimos anteriormente, tenemos la ecuación y=mx+b.
Tomemos cada punto en la gráfica, y luego haremos nuestro propio cálculo (y-y’)².
Recordemos la definición algebraica, de (y-y’)². A partir de aquí, obtenemos el desglose de la ecuación del error cuadrático medio (MSE).
Reescribimos la ecuación y simplificamos. Comenzamos operando los paréntesis en la ecuación. Nótese la distinción anaranjada y morado de las ecuaciones. Ahora, apliquemos otra manipulación. Juntaremos cada parte de la ecuación. Tomaremos todas la y, así como todas las (-2ymx) etc. En otras palabras, agrupación de términos.
En este punto, podemos tomar la media de todos los valores elevados al cuadrado de y, xy, x, x².
Definamos para cada uno, un nuevo carácter que representará la media de todos los valores al cuadrado. Veamos un ejemplo, tomemos todos los valores y, y luego dividamos por n (n representa el número de elementos), entonces obtendremos la media, y la llamaremos Y promedio.
Si multiplicamos ambos lados de la ecuación por n, obtendremos: Esto nos llevará a la siguiente ecuación:
Tenemos una ecuación de tres dimensiones. Queremos encontrar los valores M y B (recordar la ecuación de la recta) que minimizan la función. Debido a que es un problema de minimización, entramos al mundo del cálculo diferencial, la forma de minimizar una ecuación consiste en igualar a cero y luego derivar. Sin embargo, en este caso tenemos que tomar una derivada parcial. Tomamos la derivada parcial con respecto a M y la derivada parcial con respecto a B de nuestro MSE.
Ya que estamos buscando un punto mínimo, tomaremos las derivadas parciales, igualándolas a cero.
Minimización de MSE con respecto a M y B Derivadas Parciales
Tomemos las dos ecuaciones que acabamos de obtener, separando la variable b de ambas, y luego sustrayendo la primera ecuación de la segunda. Diferente escritura de las ecuaciones luego de la derivación por partes. Pasamos a sustraer la primera ecuación de la segunda. Así unimos ambas ecuaciones. Nos deshacemos de los denominadores en la ecuación.
Ecuación final para encontrar M.
Y aquí estamos, esta es la ecuación para encontrar M, tomamos esta para escribir la ecuación B.
Ecuación final para encontrar B.
Ecuaciones para la pendiente y el intercepto y. Estas serán las ecuaciones matemáticas que nos ayudarán a encontrar la pendiente y el intercepto. Ecuaciones Pendiente Intercepto.
Hablemos un poco más acerca de estas ecuaciones:
- Suma de x dividido por n
- Suma de x² dividido por n
- Suma de xy dividido por n
- Suma de y dividido por n
Ejemplos Prácticos
Ejemplo #1
Tomemos 3 puntos, (1,2), (2,1), (4,3). Encontremos M y B para la ecuación y=mx+b.
Suma de los valores x y su división por n
Suma de los valores y y su división por n
Suma de los valores xy y su división por n
Suma de los valores x2 y su división por n
Luego de haber calculado las partes relevantes de nuestras ecuaciones pendientes e intercepto, sustituyamos algunos valores en las ecuaciones veamos cómo obtenemos una pendiente y un intercepto y.
Cálculo de la pendiente Cálculo del intercepto
Tomemos estos resultados y definámoslos cómo una sola ecuación y=mx+b.
Ahora dibujemos la línea y veamos cómo esta pasa a través de los puntos a la vez que minimiza sus distancias elevadas al cuadrado.
Ejemplo #2
Tomemos 4 puntos, (-2,-3), (-1,-1), (1,2), (4,3). Vamos a encontrar M y B para la ecuación y = mx + b.
Suma de los valores x y división por n
Suma de los valores y y división por n
Suma de los valores x2 y división por n
Lo mismo que antes, sustituyamos estos valores en las ecuaciones para encontrar M y B.
Cálculo de la pendiente
Cálculo del intercepto
Definiendo estos resultados cómo una sola ecuación.
Ahora graficamos la línea y vemos cómo esta pasa a través de los puntos a la vez que minimiza sus distancias elevadas al cuadrado.
