Curso Gratuito en Ciencia de Datos y Aprendizaje Automático con Python
Expectativa condicional como proyección
Ahora que entendemos los métodos de proyección geométricamente, podemos aplicarlos a la probabilidad condicional. Este es el concepto clave que vincula la probabilidad con la geometría, la optimización y el álgebra lineal.
Producto interno para variables aleatorias . De nuestro trabajo anterior sobre la proyección de vectores en R n , tenemos una buena comprensión geométrica de cómo la proyección se relaciona con el error cuadrático medio mínimo (MMSE). Con un paso abstracto, podemos llevar todas nuestras interpretaciones geométricas al espacio de variables aleatorias. Por ejemplo, anteriormente notamos que en el punto de proyección, teníamos la siguiente condición ortogonal (es decir, vectores perpendiculares),
( y - v opt ) T v = 0
que al observar el producto interno de forma ligeramente más abstracta como x , y x T y , podemos expresar como
y - v opt , v
y definiendo el producto interno de las variables aleatorias X e Y como
X , Y E ( XY )
tenemos la misma relación:
X - h opt ( Y ), Y 0
lo cual no es válido para los vectores en R n , sino para las variables aleatorias X e Y y las funciones de esas variables aleatorias. Exactamente por qué esto es cierto es técnico, pero resulta que uno puede construir toda la teoría de la probabilidad de esta manera [ 3 ], utilizando la expectativa como un producto interno.
Ver el apéndice para una prueba usando la desigualdad de Cauchy-Schwarz .
Además, al abstraer el concepto de producto interno, hemos conectado problemas de optimización de error mínimo medio cuadrado (MMSE), geometría y variables aleatorias. Eso es mucho kilometraje para sacar una abstracción y nos permite cambiar entre estas interpretaciones para abordar problemas reales. Pronto haremos esto con algunos ejemplos, pero primero recopilaremos el resultado más importante que fluye naturalmente de esta abstracción.
Expectativa condicional como proyección . La expectativa condicional es la solución del error cuadrático medio mínimo (MMSE) del siguiente problema 1 :
min ( x - h ( y )) 2 f X , Y ( x , y ) d xd y
con la minimización h opt ( Y ) como
h opt ( Y ) = E ( X | Y )
que es otra forma de decir que entre todas las funciones posibles h ( Y ) , la que minimiza el MSE es E ( X | Y ) . De nuestra discusión anterior sobre la proyección, hemos observado que estas soluciones MMSE pueden ser considerados como proyecciones sobre un subespacio que caracteriza a Y . Por ejemplo, anteriormente notamos que en el punto de proyección, tenemos términos perpendiculares,
X - h opt ( Y ), Y 0
pero como sabemos que la solución MMSE
h opt ( Y ) = E ( X | Y )
tenemos por sustitución directa,
E ( X - E ( X | Y ), Y ) = 0
Ese último paso parece bastante inofensivo, pero vincula a MMSE con la expectativa condicional a la abstracción interna del proyecto y, al hacerlo, revela la expectativa condicional de ser un operador de proyección para variables aleatorias. Antes de seguir desarrollando esto, aprovechemos algunos dividendos rápidos. De la ecuación anterior, por linealidad de la expectativa, obtenemos,
E ( XY ) = E ( Y E ( X | Y ))
que es la llamada propiedad de torre de la expectativa. Tenga en cuenta que podríamos haber encontrado esto usando la definición formal de expectativa condicional,
E ( X | Y ) =
y la integración directa de fuerza bruta ,
E ( Y E ( X | Y )) = R
que no es muy intuitivo geométricamente. Esta falta de intuición geométrica dificulta la aplicación de estos conceptos y el seguimiento de estas relaciones.
Podemos seguir buscando esta analogía y obtener la longitud del término de error a partir de la propiedad de ortogonalidad de la solución MMSE como,
X - h opt ( Y ), X - h opt ( Y ) X , X h opt ( Y ), h opt ( Y )
y luego sustituyendo toda la notación obtenemos
E ( X - E ( X | Y )) 2 = E ( X ) 2 - E ( E ( X | Y )) 2
que sería difícil de calcular mediante integración directa.
Para establecer formalmente que E ( X | Y ) es de hecho un operador de proyección , necesitamos mostrar idempotencia. Recuerde que la idempotencia significa que una vez que proyectamos algo en un subespacio, las proyecciones adicionales no hacen nada. En el espacio de variables aleatorias, E ( X | · ) es la proyección idempotente como podemos mostrar al señalar que
h opt = E ( X | Y )
es puramente una función de Y , de modo que
E ( h opt ( Y ) | Y ) = h opt ( Y )
debido a que Y es fijo, esto verifica la idempotencia. Por tanto, la expectativa condicional es el operador de proyección correspondiente para las variables aleatorias. Podemos continuar trasladando nuestras interpretaciones geométricas de proyecciones para vectores ( v ) en variables aleatorias ( X ). Con este importante resultado, consideremos algunos ejemplos de expectativas condicionales obtenidas mediante el uso de la fuerza bruta para encontrar la función óptima de MMSE h opt , así como utilizando nuestra nueva perspectiva sobre la expectativa condicional.
Ejemplo . Supongamos que tenemos una variable aleatoria, X , entonces, ¿qué constante está más cerca de X en el sentido del error cuadrático medio (MSE)? En otras palabras, que c ∈ R minimiza el siguiente error cuadrático medio:
MSE = E ( X - c ) 2
podemos resolver esto de muchas maneras. Primero, usando la optimización basada en cálculo ,
E ( X - c ) 2 = E ( c 2 - 2 c X + X 2 ) = c 2 - 2 c E ( X ) + E ( X 2 )
y luego tomar la primera derivada con respecto ac y resolver:
c opt = E ( X )
Recuerde que X puede potencialmente tomar muchos valores, pero esto dice que el número más cercano a X en el sentido de MSE es E ( X ) . Esto es intuitivamente agradable. Llegando a este mismo problema usando nuestro producto interno, de Eq. 2.3.0.2 sabemos que en el punto de proyección
E (( X - c opt ) 1 ) = 0
donde el 1 representa el espacio de constantes sobre el que estamos proyectando. Por linealidad de la expectativa, da
c opt = E ( X )
Usando el enfoque de proyección, porque E ( X | Y ) es el operador de proyección, con Y = Ω (todo el espacio de probabilidad subyacente), tenemos, usando la definición de expectativa condicional:
E ( X | Y = Ω) = E ( X )
Esto se debe al hecho sutil de que una variable aleatoria en todo el espacio Ω solo puede ser una constante. Por lo tanto, trabajamos el mismo problema de tres maneras (optimización, productos internos ortogonales, proyección).
Ejemplo . Consideremos el siguiente ejemplo con densidad de probabilidad f X , Y = x + y donde ( x , y ) ∈ [ 0 , 1 ] 2 y calcule la expectativa condicional directamente de la de fi nición:
E ( XY )
Eso fue bastante fácil porque la función de densidad era muy simple. Ahora, hagámoslo de la manera difícil yendo directamente a la solución de MMSE h ( Y ) . Luego,
MSE
Ahora tenemos que encontrar una función h que minimice esto. Resolver una función, en lugar de resolver un número, es generalmente muy, muy difícil, pero debido a que estamos integrando en un intervalo finito, podemos usar el método de Euler-Lagrange del cálculo variacional para tomar la derivada del integrando con respecto a a la función h ( y ) y ajústela a cero. Usando los métodos de Euler-Lagrange , obtenemos el siguiente resultado,
2 yh ( y ) - y + h ( y ) -
Resolver esto da
h optar ( y ) =
que es lo que obtuvimos antes. Finalmente, podemos resolver esto usando nuestro producto interno en la Ec. 2.3.0.1 como
E (( X - h ( Y )) Y ) = 0
Escribir esto da,
y ( - 3 ( 2 y + 1 ) h ( y ) + 3 y + 2 ) dy = 0
y el integrando debe ser cero,
2 y + 3 y 2 - 3 yh ( y ) - 6 y 2 h ( y ) = 0
y resolver esto para h ( y ) da la misma solución:
3 y + 2 6 y +3
Así, hacerlo mediante la integración de fuerza bruta de la definición, optimización o producto interno nos da la misma respuesta; pero, en general, ningún método es necesariamente más fácil porque ambos implican una integración, optimización o resolución de ecuaciones funcionales potencialmente difíciles o imposibles. El punto es que ahora que tenemos una caja de herramientas profunda, podemos elegir qué herramientas queremos aplicar para diferentes problemas.
Antes de dejar este ejemplo, usemos Sympy para verificar la longitud de la función de error que encontramos anteriormente para este ejemplo:
E ( X - E ( X | Y )) 2 = E ( X ) 2 - E ( E ( X | Y )) 2
que se basa en el teorema de Pitágoras. Primero, necesitamos calcular las densidades marginales,
code
Luego, necesitamos escribir la expectativa condicional,
code
A continuación, podemos calcular el lado izquierdo, E ( X - E ( X | Y )) 2 , como sigue,
code
De manera similar, podemos calcular el lado derecho, E ( X ) 2 - E ( E ( X | Y )) 2 , como sigue,
code
Finalmente, podemos verificar que los lados izquierdo y derecho coinciden,
code
En esta sección, hemos reunido todas las ideas de optimización de proyecciones y mínimos cuadrados de las secciones anteriores para conectar las nociones geométricas de proyección de vectores en R n con variables aleatorias. Esto resultó en la notable comprensión de que la expectativa condicional es de hecho un operador de proyección para variables aleatorias.
Saber esto permite abordar problemas difíciles de múltiples formas, dependiendo de cuál sea más intuitiva o manejable en una situación particular. De hecho, encontrar el problema correcto para resolver es la parte más difícil, por lo que tener muchas formas de ver los mismos conceptos es crucial.
Para un desarrollo mucho más detallado, el libro de Mikosch [ 4 ] tiene algunas secciones excelentes que cubren gran parte de este material con una interpretación geométrica similar. Kobayashi y col. [ 5 ] también lo hace. Nelson [ 3 ] también tiene una presentación similar basada en números hiperrealistas .
Apéndice
Queremos demostrar que la expectativa condicional es el mínimo minimizador de error cuadrático medio de lo siguiente:
J = min | X - h ( Y ) | 2 f X , Y ( x , y ) d xd y
Podemos expandir esto de la siguiente manera,
J = min R 2 | X | 2 f X , Y ( x , y ) d xd y + R 2 | h ( Y ) | 2 f X , Y ( x , y ) d xd y h
Para minimizar esto, tenemos que maximizar lo siguiente:
A = max X h ( Y ) f X , Y ( x , y ) d xd y
Rompiendo la integral usando la definición de expectativa condicional
max X f X | Y ( x | y ) dxh ( Y ) f Y ( y ) dy
A partir de las propiedades de la desigualdad de Cauchy-Schwarz , sabemos que el máximo ocurre cuando h opt ( Y ) = E ( X | Y ) , por lo que hemos encontrado la función h ( Y ) óptima como:
h opt ( Y ) = E ( X | Y )
lo que muestra que la función óptima es la expectativa condicional.

0 Comments
Publicar un comentario