Curso Gratuito en Ciencia de Datos y Aprendizaje Automático con Python




Expectativa condicional y error cuadrático medio


En esta sección, trabajamos con un ejemplo detallado utilizando métodos de optimización y expectativa condicional. Supongamos que tenemos dos justos de seis lados dados ( X e Y ) y que se quiere medir la suma de las dos variables como Z = X + Y . Además, supongamos que dado Z , queremos la mejor estimación de X en el sentido del cuadrado medio. Por tanto, queremos minimizar lo siguiente:


J (α) = ( x - α z ) 2 P ( x , z )


donde P es la función de masa de probabilidad para este problema. La idea es que cuando hemos resuelto este problema, vamos a tener una función de Z que va a ser la estimación mínima de MSE X . Podemos sustituir Z en J y obtener:


J (α) = ( x - α ( x + y )) 2 P ( x , y )


Trabajemos los pasos en Sympy a continuación:


code

Con toda esa configuración, ahora podemos usar el cálculo básico para minimizar la función objetivo J ,


code

Consejo de programación Sympy tiene un módulo de estadísticas que puede hacer un trabajo básico con expresiones que involucran densidades de probabilidad y expectativas. El código anterior usa su función E para calcular la expectativa.


Esto dice que z / 2 es la estimación MSE de X dado Z, lo que significa geométricamente (interpretando el MSE como una distancia al cuadrado ponderada por la función de masa de probabilidad) que z / 2 está tan cerca de x como vamos a obtener para una z dada .


Figura

Echemos un vistazo al mismo problema usando el operador de esperanza condicional E ( · | z ) y aplicarlo a nuestra definición de Z . Luego


E ( z | z ) = E ( x + y | z ) = E ( x | z ) + E ( y | z ) = z


utilizando la linealidad de la expectativa. Ahora, dado que por la simetría del problema (es decir, dos mueren idénticos), tenemos


E ( x | z ) = E ( y | z )


podemos conectar esto y resolver


2 E ( x | z ) = z


que una vez más da,


E ( x | z ) = z


que es igual a la estimación que acabamos de encontrar minimizando el MSE. Exploremos esto más a fondo con la figura 2.5 . La Figura 2.5 muestra los valores de Z en amarillo con los valores correspondientes para X e Y en los ejes. Supongamos que z = 2, entonces la X más cercana a esto es X = 1, que es lo que da E ( x | z ) = z / 2 = 1. ¿Qué sucede cuando Z = 7? En este caso, este valor se distribuye diagonalmente a lo largo de la Xeje entonces si X = 1, entonces Z está a 6 unidades de distancia, si X = 2, entonces Z está a 5 unidades de distancia y así sucesivamente.


Ahora, volviendo a la pregunta original, si tuviéramos Z = 7 y quisiéramos acercarnos lo más posible a esto usando X , ¿por qué no elegir X = 6 que está a solo una unidad de Z ? El problema de hacer eso es que X = 6 solo ocurre 1/6 de las veces, por lo que es probable que no lo hagamos bien el otro 5/6 de las veces. Entonces, 1/6 de las veces estamos a una unidad de distancia, pero 5/6 de las veces estamos a más de una unidad de distancia. Esto significa que la puntuación de MSE va a ser peor. Dado que cada valor de X de 1 a 6 es igualmente probable, para ir a lo seguro, elegimos 7/2 como estimación, que es lo que sugiere la expectativa condicional.


Podemos verificar esta afirmación con ejemplos usando Sympy a continuación:


code

Consejo de programación La llamada a la función stats.sample (x, S.Eq (z, 7)) muestra la variable x sujeta a una condición en la variable z . En otras palabras, genera muestras aleatorias de x dado, dado que la suma de los resultados de ese dado y el dado y suman z == 7 .


Ejecute el código anterior repetidamente hasta que esté convencido de que E ( x | z ) da el MSE más bajo cada vez. Para impulsar este razonamiento, consideremos el caso en el que el dado está tan sesgado que el resultado de 6 es diez veces más probable que cualquiera de los otros resultados. Es decir,


P ( 6 ) = 2 / 3


mientras que P ( 1 ) = P ( 2 ) = . . . = P ( 5 ) = 1 / 15. Podemos explorar esto usando Sympy de la siguiente manera:


code

Como antes, construimos la suma de los dos dados y graficamos la función de masa de probabilidad correspondiente en la figura 2.6 . En comparación con la figura 2.5 , la masa de probabilidad se ha alejado de los números más pequeños.


Veamos lo que la expectativa condicional dice acerca de cómo podemos estimar X de Z .


code

Ahora que tenemos E ( x | z = 7 ) = 5, podemos generar muestras como antes y ver si esto da el MSE mínimo.


Figura Code

Usando un ejemplo simple, hemos enfatizado la conexión entre los problemas de error cuadrático medio mínimo y la expectativa condicional. Con suerte, las dos últimas cifras ayudaron a exponer el papel de la densidad de probabilidad. A continuación, continuaremos revelando el verdadero poder de la expectativa condicional a medida que continuamos desarrollando la intuición geométrica correspondiente.