Curso Gratuito en Ciencia de Datos y Aprendizaje Automático con Python




Introducción a la Probabilidad en Python


Este capítulo toma una visión geométrica de la teoría de la probabilidad y la relaciona con conceptos familiares en álgebra lineal y geometría. Este enfoque conecta su intuición geométrica natural con las abstracciones clave en probabilidad que pueden ayudar a guiar su razonamiento. Esto es particularmente importante en probabilidad porque es fácil ser engañado. Necesitamos un poco de rigor y algo de intuición que nos oriente.


En la escuela primaria, te presentaron los números naturales (es decir, 1, 2 , 3 , .. ) y aprendiste a manipularlos mediante operaciones como la suma, la resta y la multiplicación. Más tarde, le presentaron los números positivos y negativos y nuevamente le enseñaron cómo manipularlos. En última instancia, se le presentó el cálculo de la línea real y aprendió a diferenciar, tomar límites, etc. Esta progresión proporcionó más abstracciones, pero también amplió el campo de problemas que podría abordar con éxito. Lo mismo ocurre con la probabilidad. Una forma de pensar en la probabilidad es como un nuevo concepto numérico que le permite abordar problemas que tienen un tipo especial de incertidumbre incorporado. Por tanto, la idea clave es que hay algún número, digamos x, con un compañero de viaje, digamos, f ( x ) , y este compañero representa las incertidumbres sobre el valor de x como si mirara el número x a través de una ventana escarchada. El grado de opacidad de la ventana está representado por f ( x ) . Si queremos manipular x , entonces tenemos que averiguar qué hacer con f ( x ) . Por ejemplo, si queremos y = 2 x , entonces tenemos que entender cómo f ( x ) genera f ( y ).


¿Dónde está la parte aleatoria ? Para conceptualizar esto, necesitamos otra analogía más: piense en una colmena con el enjambre a su alrededor representando f ( x ) , y la propia colmena, que apenas se puede ver a través del enjambre, como x . ¡La pieza al azar es que no sabes qué abeja en particular te va a picar! Una vez que esto sucede, la incertidumbre se evapora. Hasta que eso suceda, todo lo que tenemos es un concepto de enjambre (es decir, densidad de abejas) que representa una potencialidad de cuál abeja finalmente picará.


En resumen, Una forma de pensar sobre la probabilidad es como una forma de llevar a cabo el razonamiento matemático (por ejemplo, sumar, restar, tomar límites) con una noción de potencialidad que es así transformada por estas operaciones.


Comprensión de la densidad de probabilidad


Para comprender el corazón de la probabilidad moderna, que se basa en la teoría de integración de Lebesgue, necesitamos ampliar el concepto de integración desde el cálculo básico. Para empezar, consideremos la siguiente función por partes


1 si 0 < x ≤ 1 f ( x ) = 2 si 1 < x ≤ 2 0 de lo contrario


como se muestra en la Fig. 2.1 . En cálculo, aprendió la integración de Riemann, que puede aplicar aquí como


2 f ( x ) dx = 1 + 2 = 3 0


que tiene la interpretación habitual como el área de los dos rectángulos que forman f ( x ) . Hasta aquí todo bien. Con la integración de Lesbesgue, la idea es muy similar excepto que nos enfocamos en el eje y en lugar de movernos a lo largo del eje x. La pregunta se da f ( x ) = 1, ¿qué


Figura

Cuál es el conjunto de valores de x para el que esto es cierto? Para nuestro ejemplo, esto es cierto siempre que x ∈ ( 0 , 1 ] . Así que ahora tenemos una correspondencia entre los valores de la función (es decir, 1 y 2 ) y los conjuntos de valores de x para los que esto es cierto, a saber, { ( 0 , 1 ]} y { ( 1 , 2 ]} , respectivamente. Para calcular la integral, simplemente tomamos los valores de la función (es decir, 1,2 ) y alguna forma de medir el tamaño del intervalo correspondiente (es decir, μ ) como se muestra a continuación:


2f d μ = 1 μ ( { ( 0 , 1 ]} ) + 2 μ ( { ( 1 , 2 ]}


Hemos suprimido parte de la notación anterior para enfatizar la generalidad. Tenga en cuenta que obtenemos el mismo valor de la integral que en el caso de Riemann cuando μ (( 0 , 1 ] ) = μ (( 1 , 2 ] ) = 1. Al introducir la función μ como una forma de medir los intervalos anteriores, Hemos introducido otro grado de libertad en nuestra integración. Esto acomoda muchas funciones extrañas que no son manejables usando la teoría de Riemann usual, pero lo referimos a una introducción adecuada a la integración de Lesbesgue para un estudio más profundo [ 1 ]. paso en la discusión anterior es la intro- ducción de la μfunción, que volveremos a encontrar como la llamada función de densidad de probabilidad.


Variables aleatorias


La mayoría de las introducciones a la probabilidad saltan directamente a variables aleatorias y luego explican cómo calcular integrales complicadas. El problema con este enfoque es que omite algunas de las sutilezas importantes que consideraremos ahora. Desafortunadamente, el término variable aleatoria no es muy descriptivo. Un término mejor es función medible . Para entender por qué este es un término mejor, tenemos que sumergirnos en las construcciones formales de probabilidad mediante un ejemplo simple.


Considere lanzar un dado justo de seis caras . Solo hay seis resultados posibles, Ω = { 1 , 2 , 3 , 4 , 5 , 6 }


Como sabemos, si el dado es justo, entonces la probabilidad de cada resultado es 1/6. Para decir esto formalmente, la medida de cada conjunto (es decir, { 1 } , { 2 } ,..., { 6 } ) es μ ( { 1 } ) = μ ( { 2 } ). . . = μ ( { 6 } ) = 1 / 6. En este caso, la función μ que discutimos anteriormente es la función de masa de probabilidad habitual , denotada por P. La función medible mapea un conjunto en un número en la línea real. Por ejemplo, { 1 } → 1 es una de esas funciones.


Ahora, aquí es donde las cosas se ponen interesantes. Suponga que se le pide que construya una moneda justa a partir del dado justo. En otras palabras, queremos lanzar el dado y luego registrar los resultados como si acabáramos de lanzar una moneda justa. ¿Cómo podemos hacer esto? Una forma sería la de definir una función medible que dice que si el troquel surge 3 o menos, entonces declaramos cabezas y declare lo contrario colas . Esto tiene una fuerte intuición detrás, pero articulémoslo en términos de teoría formal. Esta estrategia crea dos diferentes que no se solapan conjuntos { 1 , 2 , 3 } y { 4 , 5 , 6 } . Cada conjunto tiene la misma medida de probabilidad ,


P ( { 1 , 2 , 3 } ) = 1 / 2 P ( { 4 , 5 , 6 } ) = 1 / 2


Y el problema está resuelto. Cada vez que sale el dado { 1 , 2 , 3 } , registramos caras y, de lo contrario, registramos colas.


¿Es esta la única forma de construir un experimento de moneda justa a partir de un dado justo? Alternativamente, podemos definir los conjuntos como { 1 } , { 2 } , { 3 , 4 , 5 , 6 } . Si de fi nimos la medida correspondiente para cada conjunto como el siguiente


P ( { 1 } ) = 1 / 2 P ( { 2 } ) = 1 / 2 P ( { 3 , 4 , 5 , 6 } ) = 0


entonces, tenemos otra solución al problema de la moneda justa. Para implementar esto, todo lo que hacemos es ignorar cada vez que el dado muestre 3, 4, 5, 6 y lanzar de nuevo. Esto es un desperdicio, pero resuelve el problema. No obstante, esperamos que pueda ver cómo las piezas entrelazadas de la teoría proporcionan un marco para llevar la noción de incertidumbre / potencialidad de un problema al siguiente (por ejemplo, del dado justo a la moneda justa).


Consideremos un problema un poco más interesante en el que lanzamos dos dados. Suponemos que cada lanzamiento es independiente , lo que significa que el resultado de uno no influye en el otro. ¿Cuáles son los conjuntos en este caso? Todos son pares de posibles resultados de dos lanzamientos, como se muestra a continuación,


Ω = { ( 1 , 1 ), ( 1 , 2 ),. . . , ( 5 , 6 ), ( 6 , 6 ) }


¿Cuáles son las medidas de cada uno de estos conjuntos? En virtud del reclamo de independencia, la medida de cada uno es el producto de las medidas respectivas de cada elemento. Por ejemplo,


P (( 1 , 2 )) = P ( { 1 } ) P ( { 2 } ) = 1 6 2


Con todo lo establecido, podemos plantearnos la siguiente pregunta: ¿cuál es la probabilidad de que la suma de los dados sea igual a siete? Como antes, lo primero que debe hacer es caracterizar la función medible para esto como X : ( a , b ) → ( a + b ) . A continuación, asociamos todos los pares ( a , b ) con su suma. Podemos crear un diccionario de Python para esto como se muestra,


code

El siguiente paso es recopilar todos los pares ( a , b ) que suman cada uno de los valores posibles de dos a doce.


code

Consejo de programación El defaultdict objeto desde el built-in colecciones módulo crea Naries dictio- con valores por defecto cuando se encuentra con una nueva clave. De lo contrario, habríamos tenido que crear valores predeterminados manualmente para un diccionario normal. Por ejemplo, dinv [7] contiene la siguiente lista de pares que suman siete,


code

El siguiente paso es calcular la probabilidad medida para cada uno de estos elementos. Usando el supuesto de independencia, esto significa que tenemos que calcular la suma de los productos de las probabilidades de los artículos individuales en dinv . Como sabemos que cada resultado es igualmente probable, la probabilidad de cada término en la suma es igual a 1/36. Por lo tanto, todo lo que tenemos que hacer es contar el número de elementos en la lista correspondiente para cada clave en dinv y dividir por 36 . Por ejemplo, dinv [11] contiene [(5, 6), (6, 5)] . La probabilidad de 5 + 6 = 6 + 5 = 11 es la probabilidad de este conjunto que se compone de la suma de las probabilidades de los elementos individuales (5,6), (6,5) . En este caso, tenemosP ( 11 ) = P ( { ( 5 , 6 ) } ) + P ( { ( 6 , 5 ) } ) = 1 / 36 + 1 / 36 = 2 / 36. La repetición de este procedimiento para todos los elementos, se deriva la función de masa de probabilidad como se muestra a continuación,


code

Consejo de programación En el código anterior, observe que 36. está escrito con la marca decimal final. Este es un buen hábito porque la operación de división predeterminada cambió entre Python 2.xy Python 3.x. En Python 2.x, la división es una división de enteros por defecto, y es una división de punto flotante en Python 3.x.


El ejemplo anterior expone los elementos de la teoría de la probabilidad que están en juego para este simple problema mientras suprime deliberadamente algunos de los detalles técnicos sangrientos. Con este marco, podemos hacer otras preguntas como ¿cuál es la probabilidad de que la mitad del producto de tres dados exceda su suma? Podemos resolver esto usando el mismo método que a continuación. Primero, creemos el primer mapeo,


code

Las claves de este diccionario son los triples y los valores son los valores lógicos de si la mitad del producto de tres dados excede o no su suma. Ahora, hacemos el mapeo inverso para recopilar las listas correspondientes,


code

Tenga en cuenta que dinv contiene solo dos claves, Verdadero y Falso . Una vez más, debido a que los dados son independientes, la probabilidad de cualquier triple es de 1 / 6 3 . Finalmente, recopilamos esto para cada resultado como se muestra a continuación,


code

Por tanto, la probabilidad de que la mitad del producto de tres dados supere su suma es 136 / 6,0 ** 3) = 0,63 . El conjunto que es inducida por la variable aleatoria tiene sólo dos elementos en ella, verdaderos y falsos , con P ( verdaderos ) = 136 / 216 y P ( Falso ) = 1 - 136 / 216.


code

Como ejemplo final para ejercitar otra capa de generalidad, consideremos el primer problema con los dos dados donde queremos la probabilidad de un siete, pero esta vez uno de los dados ya no es justo. La distribución por el dado injusto es la siguiente:


P ( { 1 } ) = P ( { 2 } ) = P ( { 3 } ) = 1 9 P ( { 4 } ) = P ( { 5 } ) = P ( { 6 } ) = 2 9


De nuestro trabajo anterior, sabemos que los elementos correspondientes a la suma de siete son los siguientes:


{ ( 1 , 6 ), ( 2 , 5 ), ( 3 , 4 ), ( 4 , 3 ), ( 5 , 2 ), ( 6 , 1 ) }


Debido a que todavía tenemos el supuesto de independencia, todo lo que necesitamos cambiar es el cálculo de probabilidad de cada uno de los elementos. Por ejemplo, dado que el primer muerto es el injusto, tenemos


P (( 1 , 6 )) = P ( 1 ) P ( 6 ) = 1 × 1 9 6


e igualmente para ( 2 , 5 ) tenemos lo siguiente:


P (( 2 , 5 )) = P ( 2 ) P ( 5 ) = 1 × 1 9 6


Etcétera. La suma de todos estos da lo siguiente:


P X ( 7 ) = 1 × 1 + 1 × 1 + 1 × 1 + 2 × 1 + 2 × 1 + 2 × 1 = 1 9 6 9 6 9 6 9 6 9 6 9 6 6


Intentemos calcular esto usando Pandas en lugar de diccionarios de Python. Primero, construimos un objeto DataFrame con un índice de tuplas que consta de todos los pares de posibles resultados de dados.


code

Ahora, podemos completar las columnas que configuramos arriba, donde el resultado del primer dado es la columna d1 y el resultado del segundo dado es d2 ,


code

A continuación, calculamos la suma de los dados en la columna sm ,


code

Con eso establecido, el DataFrame ahora se ve así:


code

A continuación, completamos las probabilidades para cada cara del dado injusto ( d1 ) y del dado justo ( d2 ),


code

Finalmente, podemos calcular las probabilidades conjuntas para la suma de las caras mostradas como sigue:


code

Con todo lo establecido, podemos calcular la densidad de todos los resultados de los dados utilizando groupby como se muestra a continuación,


code

Estos ejemplos han mostrado cómo la teoría de la probabilidad descompone conjuntos y mediciones de esos conjuntos y cómo estos pueden combinarse para desarrollar las funciones de masa de probabilidad para nuevas variables aleatorias.


Variables aleatorias continuas


Las mismas ideas funcionan con variables continuas, pero administrar los conjuntos se vuelve más complicado porque la línea real, a diferencia de los conjuntos discretos, tiene muchas propiedades limitantes ya incorporadas que deben manejarse con cuidado. No obstante, comencemos con un ejemplo que debería ilustrar las ideas análogas. Suponga que una variable aleatoria X se distribuye uniformemente en el intervalo unitario. ¿Cuál es la probabilidad de que la variable tome valores menores que 1/2?


Para construir intuición en el caso discreto, volvamos a nuestro experimento de lanzamiento de dados con los dados justos. La suma de los valores de los dados es una función medible,


Y : { 1 , 2 ,. . . , 6 } 2 → { 2 , 3 ,. . . , 12 }


Es decir, Y es un mapeo del producto cartesiano de conjuntos a un conjunto discreto de resultados. Para calcular las probabilidades del conjunto de resultados, necesitamos derivar la medida de probabilidad para Y , P Y , a partir de las medidas de probabilidad correspondientes para cada dado. Nuestra discusión anterior pasó por la mecánica de eso. Esto significa que


P Y : { 2 , 3 ,. . . , 12 } → [ 0 , 1 ]


Tenga en cuenta que hay una separación entre la definición de la función y donde los elementos objetivo de la función se miden en probabilidad. Más sin rodeos,


Y : A → B


con,


P Y : B → [ 0 , 1 ]


Por lo tanto, para calcular P Y , que se deriva de otras variables aleatorias, tenemos que expresar las clases de equivalencia en B en términos de sus conjuntos progenitores A.


La situación de las variables continuas sigue el mismo patrón, pero con muchos tecnicismos más profundos que vamos a saltarnos. Para el caso continuo, la variable aleatoria es ahora,


X : R → R


con la medida de probabilidad correspondiente,


P X : R → [ 0 , 1 ]


Pero, ¿dónde están los conjuntos correspondientes aquí? Técnicamente, estos son los conjuntos de Borel , pero podemos pensar en ellos como intervalos. Volviendo a nuestra pregunta, ¿cuál es la probabilidad de que una variable aleatoria distribuida uniformemente en el intervalo unitario tome valores menores que 1/2? Parafraseando esta pregunta de acuerdo con el marco, tenemos lo siguiente:


X : [ 0 , 1 ] → [ 0 , 1 ]


con correspondiente,


P X : [ 0 , 1 ] → [ 0 , 1 ]


Para responder a la pregunta, por la de fi nición de la variable aleatoria uniforme en el intervalo unitario, calculamos la siguiente integral,


P X ( [ 0 , 1 / 2 ] ) = P X ( 0 < X < 1 / 2 ) = 0 dx = 1 / 2


donde el dx de la integral anterior recorre los intervalos del tipo B. La medida de cualquier intervalo dx (es decir, un conjunto de tipo A ) es igual a dx , por de fi nición de la variable aleatoria uniforme. Para obtener todas las partes móviles en una integral rica en notación, también podemos escribir esto como,


P X ( 0 < X < 1 / 2 ) = 0 d P X ( dx ) = 1 / 2


Ahora, consideremos un ejemplo un poco más complicado e interesante. Como antes, suponga que tenemos una variable aleatoria uniforme, X e introduzcamos otra variable aleatoria definida,


Y = 2 X


Ahora bien, ¿cuál es la probabilidad de que 0 < Y < 2 1 ? Para expresar esto en nuestro marco, escribimos,


Y : [ 0 , 1 ] → [ 0 , 2 ]


con correspondiente,


P Y : [ 0 , 2 ] → [ 0 , 1 ]


Para responder a la pregunta, necesitamos medir el conjunto [0,1 / 2], con la medida de probabilidad para Y , P Y ( [ 0 , 1 / 2 ] ) . ¿Cómo podemos hacer esto? Debido a que Y se deriva de la variable aleatoria X , como con el experimento de lanzamiento de dados justos , tenemos que crear un conjunto de equivalencias en el espacio objetivo (es decir, conjuntos de tipo B ) que se reflejen en el espacio de entrada (es decir, A de tipo conjuntos). Es decir, ¿a qué equivale el intervalo [0,1 / 2] en términos de la variable aleatoria X ? Porque, funcionalmente,Y = 2 X , entonces el intervalo de tipo B [0,1 / 2] corresponde al intervalo de tipo A [0,1 / 4]. A partir de la medida de probabilidad de X , calculamos esto con la integral,


P Y ( [ 0 , 1 / 2 ] ) = P X ( [ 0 , 1 / 4 ] ) = 0 dx = 1 / 4


Ahora, aumentemos la apuesta y consideremos la siguiente variable aleatoria,


Y = X 2


donde ahora X está todavía uniformemente distribuido, pero ahora en el intervalo [- 1 / 2 , 1 / 2 ] . Podemos expresar esto en nuestro marco como,


Y : [- 1 / 2 , 1 / 2 ] → [ 0 , 1 / 4 ]


con correspondiente,


P Y : [ 0 , 1 / 4 ] → [ 0 , 1 ]


¿Cuál es el P Y ( Y < 1 / 8 ) ? En otras palabras, ¿cuál es la medida del conjunto B Y = [ 0 , 1 / 8 ] ? Como antes, debido a que X se deriva de nuestra variable aleatoria distribuida uniformemente, tenemos que reflejar el conjunto de B Y en conjuntos de tipo A. Lo que hay que reconocer es que debido a que X 2 es simétrico con respecto a cero, todo B Y los conjuntos se re fl ejan en dos conjuntos. Y Y = X ∪ X Esto significa que para cualquier conjunto B , tenemos la correspondencia B A + A - . Entonces, tenemos,


B Y = 0 < Y < = 0 < X < √-√< X < 0


Desde esta perspectiva, tenemos la siguiente solución,


P Y ( B Y ) = P ( A + X ) / 2 + P ( A - X ) / 2


donde el 2 1 proviene de normalizar el P Y a uno. También,


+ X = 0 < X <√8


A - X = -1√< X < 0


Por lo tanto,


X=X=


porque P ( A + ) P ( A - ) 1 / √ 8. Veamos si esto sale usando el habitual Método de transformación de variables a partir de cálculo. Usando este método, la densidad f Y ( y ) = f X ( √) / ( 2 √)=1. Entonces, obtenemos,


0y8


que es lo que obtuvimos usando el método de conjuntos. Tenga en cuenta que preferiría el método de cálculo en la práctica, pero es importante comprender la mecánica más profunda, porque a veces el método de cálculo habitual falla, como muestra el siguiente problema.


Transformación de variables más allá del cálculo


Suponga que X e Y están distribuidos uniformemente en el intervalo unitario y de fi nemos Z como


Z = X Y - X


¿Cuál es f Z ( z ) ? Si intenta esto usando el método de cálculo habitual, fallará (¡pruébelo!). El problema es uno de los prerrequisitos técnicos para que el método de cálculo no esté en vigor.


La observación clave es que Z ∈ / ( - 1 , 0 ] . Si esto fuera posible, X e Y tendrían signos diferentes, lo que no puede suceder, dado que X e Y están distribuidos uniformemente sobre ( 0 , 1 ] . Ahora, consideremos cuando Z > 0. En este caso, Y > X porque Z no puede ser positivo de otra manera. Para la función de densidad, estamos interesados ​​en el conjunto { 0 < Z < z } . Queremos calcular


P ( Z < z ) = B 1 d X dY


con,


B 1 = { 0 < Z < z }


Ahora, tenemos que traducir ese intervalo en un intervalo correspondiente a X e Y . Para 0 < Z , tenemos Y > X . Para Z < z , tenemos Y > X ( 1 / z + 1 ) . Poner esto junto da


A 1 = { max ( X , X ( 1 / z + 1 )) < Y < 1 }


Integrando esto sobre Y de la siguiente manera,


máx. ( X , X ( 1 / z1 )) < Y < 1 dY z - Xdonde z >X0 -


e integrar esto una vez más sobre X da


X : [ 0 , 1 ] → [ 0 , 1 ]


Tenga en cuenta que este es el cálculo de la probabilidad en sí, no la función de densidad de probabilidad. Para conseguirlo, todo lo que tenemos que hacer es diferenciar la última expresión para obtener


X : [ 0 , 1 ] → [ 0 , 1 ]


Ahora necesitamos calcular esta densidad usando el mismo proceso para cuando z < - 1. Queremos el intervalo Z < z para cuando z < - 1. Para un z fijo , esto es equivalente a X ( 1 + 1 / z ) < Y . Como z es negativo, esto también significa que Y < X . Bajo estos términos, tenemos la siguiente integral,


X : [ 0 , 1 ] → [ 0 , 1 ]


e integrar esto una vez más sobre X da lo siguiente


X : [ 0 , 1 ] → [ 0 , 1 ]


Para obtener la densidad para z < - 1, diferenciamos esto con respecto a z para obtener lo siguiente,


X : [ 0 , 1 ] → [ 0 , 1 ]


Poniendo todo esto junto, obtenemos,


X : [ 0 , 1 ] → [ 0 , 1 ]


Lo dejaremos como ejercicio para mostrar que esto se integra en uno.


Variables aleatorias independientes


La independencia es una suposición estándar. Matemáticamente, la condición necesaria y suficiente para la independencia entre dos variables aleatorias X e Y es la siguiente:


P ( X , Y ) = P ( X ) P ( Y )


Dos variables aleatorias X e Y no están correlacionadas si,


X : [ 0 , 1 ] → [ 0 , 1 ]


donde X = E ( X ) Tenga en cuenta que las variables aleatorias no correlacionadas a veces se denominan variables aleatorias ortogonales . Sin embargo, la falta de correlación es una propiedad más débil que la independencia. Por ejemplo, considere las variables aleatorias discretas X e Y distribuidas uniformemente sobre el conjunto { 1 , 2 , 3 } donde


X : [ 0 , 1 ] → [ 0 , 1 ]


y también,


X : [ 0 , 1 ] → [ 0 , 1 ]


Por lo tanto, E ( X ) = 0 y E ( XY ) = 0, por lo que X e Y no están correlacionados. Sin embargo, tenemos


X : [ 0 , 1 ] → [ 0 , 1 ]


Entonces, estas dos variables aleatorias no son independientes. Por tanto, la falta de correlación no implica independencia, en general, pero existe el caso importante de las variables aleatorias gaussianas para las que sí. Para ver esto, considere la función de densidad de probabilidad para dos variables aleatorias gaussianas X e Y de media cero y varianza unitaria ,


X : [ 0 , 1 ] → [ 0 , 1 ]


donde ρ : = E ( XY ) es el coeficiente de correlación. En el caso no correlacionado donde ρ = 0, la función de densidad de probabilidad se factoriza en lo siguiente,


X : [ 0 , 1 ] → [ 0 , 1 ]


lo que significa que X e Y son independientes. La independencia y la independencia condicional están estrechamente relacionadas, como en lo siguiente:


P ( X , Y | Z ) = P ( X | Z ) P ( Y | Z )


que dice que X y Y e independiente condicionadas a Z . El condicionamiento de variables aleatorias independientes puede romper su independencia. Por ejemplo, considere dos variables aleatorias independientes distribuidas por Bernoulli , X 1 , X 2 ∈ { 0 , 1 } . Nosotros de fi nimos Z = X 1 + X 2 . Tenga en cuenta que Z ∈ { 0 , 1 , 2 } . En el caso donde Z = 1, tenemos,


P ( X 1 | Z = 1 )> 0 P ( X 2 | Z = 1 )> 0


Aunque X 1 , X 2 son independientes, después de condicionar en Z , tenemos lo siguiente,


P ( X 1 = 1 , X 2 = 1 | Z = 1 ) = 0 = P ( X 1 = 1 | Z = 1 ) P ( X 2 = 1 | Z = 1 )


Por tanto, el condicionamiento de Z rompe la independencia de X 1 , X 2 . Esto también funciona en la dirección opuesta : el condicionamiento puede hacer que las variables aleatorias dependientes sean independientes. mella. Defina Z n = i n X i con X i variables aleatorias independientes de valores enteros . Las variables Z n son dependientes porque apilan el mismo conjunto telescópico de variables X i . Considera lo siguiente,


X : [ 0 , 1 ] → [ 0 , 1 ]


donde la factorización proviene de la independencia de las X i variables. Usando la definición de probabilidad condicional,


X : [ 0 , 1 ] → [ 0 , 1 ]


Podemos continuar expandiendo Eq. 2.1.5.1 ,


X : [ 0 , 1 ] → [ 0 , 1 ]


donde P ( X 3 = j - k ) P ( Z 2 = k ) = P ( Z 3 = j , Z 2 ) . Por lo tanto, vemos que la dependencia entre variables aleatorias se puede romper mediante el condicionamiento para crear variables aleatorias condicionadas independientes. Como acabamos de presenciar, comprender cómo el condicionamiento influye en la independencia es importante y es el tema principal de estudio en Modelos Gráficos Probabilísticos, un campo con muchos algoritmos y conceptos para extraer estas nociones de independencia condicional de los modelos gráficos basados ​​en gráficos. representaciones de variables aleatorias.


Ejemplo clásico de varilla rota


Hagamos un último ejemplo para ejercitar la fluidez en nuestros métodos considerando el siguiente problema clásico: dada una varilla de longitud unitaria, rota de forma independiente y aleatoria en dos lugares, ¿cuál es la probabilidad de que puedas ensamblar las tres piezas restantes en un triángulo? La primera tarea consiste en encontrar una representación de un triángulo como una restricción fácil de aplicar . Lo que queremos es algo como lo siguiente:


P (el triángulo existe ) = 0 0 { triángulo existe } d X dY


donde X e Y son independientes y se distribuyen uniformemente en el intervalo unitario. Fórmula de Heron para el área del triángulo,


área = ( s - a ) ( s - b ) ( s - c ) s


donde s = ( a + b + c ) / 2 es lo que necesitamos. La idea es que esto produce un área válida solo cuando cada uno de los términos debajo de la raíz cuadrada es mayor o igual a cero. Por tanto, supongamos que tenemos


a = X


suponiendo que Y > X . Por lo tanto, el criterio para un triángulo válido se reduce a


{ ( s > a ) ∧ ( s > b ) ∧ ( s > c ) ∧ ( X < Y ) }


Después de un poco de manipulación, esto se consolida en:


X : [ 0 , 1 ] → [ 0 , 1 ]


que integramos por d X primero para obtener


P (el triángulo existe ) =


P (el triángulo existe ) =


y luego por dY para obtener finalmente,


P (el triángulo existe )


cuando Y > X . Por simetría, se obtiene el mismo resultado para X > Y . Por tanto, el resultado final es el siguiente:


P (el triángulo existe )


Podemos verificar rápidamente usando este resultado usando Python para el caso Y > X usando el siguiente código:


code

Consejo de programación Los símbolos & lógicos encadenados anteriores le dicen a Numpy que la operación lógica debe considerarse por elementos.