Curso Gratuito en Ciencia de Datos y Aprendizaje Automático con Python
Expectativa condicional y error cuadrático medio
En esta sección, trabajamos con un ejemplo detallado utilizando métodos de optimización y expectativa condicional. Supongamos que tenemos dos justos de seis lados dados ( X e Y ) y que se quiere medir la suma de las dos variables como Z = X + Y . Además, supongamos que dado Z , queremos la mejor estimación de X en el sentido del cuadrado medio. Por tanto, queremos minimizar lo siguiente:
J (α) = ( x - α z ) 2 P ( x , z )
donde P es la función de masa de probabilidad para este problema. La idea es que cuando hemos resuelto este problema, vamos a tener una función de Z que va a ser la estimación mínima de MSE X . Podemos sustituir Z en J y obtener:
J (α) = ( x - α ( x + y )) 2 P ( x , y )
Trabajemos los pasos en Sympy a continuación:
code
Con toda esa configuración, ahora podemos usar el cálculo básico para minimizar la función objetivo J ,
code
Consejo de programación Sympy tiene un módulo de estadísticas que puede hacer un trabajo básico con expresiones que involucran densidades de probabilidad y expectativas. El código anterior usa su función E para calcular la expectativa.
Esto dice que z / 2 es la estimación MSE de X dado Z, lo que significa geométricamente (interpretando el MSE como una distancia al cuadrado ponderada por la función de masa de probabilidad) que z / 2 está tan cerca de x como vamos a obtener para una z dada .
Figura
Echemos un vistazo al mismo problema usando el operador de esperanza condicional E ( · | z ) y aplicarlo a nuestra definición de Z . Luego
E ( z | z ) = E ( x + y | z ) = E ( x | z ) + E ( y | z ) = z
utilizando la linealidad de la expectativa. Ahora, dado que por la simetría del problema (es decir, dos mueren idénticos), tenemos
E ( x | z ) = E ( y | z )
podemos conectar esto y resolver
2 E ( x | z ) = z
que una vez más da,
E ( x | z ) = z
que es igual a la estimación que acabamos de encontrar minimizando el MSE. Exploremos esto más a fondo con la figura 2.5 . La Figura 2.5 muestra los valores de Z en amarillo con los valores correspondientes para X e Y en los ejes. Supongamos que z = 2, entonces la X más cercana a esto es X = 1, que es lo que da E ( x | z ) = z / 2 = 1. ¿Qué sucede cuando Z = 7? En este caso, este valor se distribuye diagonalmente a lo largo de la Xeje entonces si X = 1, entonces Z está a 6 unidades de distancia, si X = 2, entonces Z está a 5 unidades de distancia y así sucesivamente.
Ahora, volviendo a la pregunta original, si tuviéramos Z = 7 y quisiéramos acercarnos lo más posible a esto usando X , ¿por qué no elegir X = 6 que está a solo una unidad de Z ? El problema de hacer eso es que X = 6 solo ocurre 1/6 de las veces, por lo que es probable que no lo hagamos bien el otro 5/6 de las veces. Entonces, 1/6 de las veces estamos a una unidad de distancia, pero 5/6 de las veces estamos a más de una unidad de distancia. Esto significa que la puntuación de MSE va a ser peor. Dado que cada valor de X de 1 a 6 es igualmente probable, para ir a lo seguro, elegimos 7/2 como estimación, que es lo que sugiere la expectativa condicional.
Podemos verificar esta afirmación con ejemplos usando Sympy a continuación:
code
Consejo de programación La llamada a la función stats.sample (x, S.Eq (z, 7)) muestra la variable x sujeta a una condición en la variable z . En otras palabras, genera muestras aleatorias de x dado, dado que la suma de los resultados de ese dado y el dado y suman z == 7 .
Ejecute el código anterior repetidamente hasta que esté convencido de que E ( x | z ) da el MSE más bajo cada vez. Para impulsar este razonamiento, consideremos el caso en el que el dado está tan sesgado que el resultado de 6 es diez veces más probable que cualquiera de los otros resultados. Es decir,
P ( 6 ) = 2 / 3
mientras que P ( 1 ) = P ( 2 ) = . . . = P ( 5 ) = 1 / 15. Podemos explorar esto usando Sympy de la siguiente manera:
code
Como antes, construimos la suma de los dos dados y graficamos la función de masa de probabilidad correspondiente en la figura 2.6 . En comparación con la figura 2.5 , la masa de probabilidad se ha alejado de los números más pequeños.
Veamos lo que la expectativa condicional dice acerca de cómo podemos estimar X de Z .
code
Ahora que tenemos E ( x | z = 7 ) = 5, podemos generar muestras como antes y ver si esto da el MSE mínimo.
Figura Code
Usando un ejemplo simple, hemos enfatizado la conexión entre los problemas de error cuadrático medio mínimo y la expectativa condicional. Con suerte, las dos últimas cifras ayudaron a exponer el papel de la densidad de probabilidad. A continuación, continuaremos revelando el verdadero poder de la expectativa condicional a medida que continuamos desarrollando la intuición geométrica correspondiente.

0 Comments
Publicar un comentario