6 / 11

Distribuzioni congiunte, varianza e covarianza

Distribuzioni congiunte di variabili aleatorie discrete, distribuzioni marginali, indipendenza, varianza e covarianza con proprietà e applicazioni a estrazioni con e senza rimpiazzo.

Esempio: distribuzione congiunta di due variabili di Bernoulli

Consideriamo due variabili aleatorie XX e YY, entrambe funzioni indicatrici definite sugli esiti del lancio di un dado:

X=1A={1se esce un numero dispari, ovvero se ωA={1,3,5}0se esce un numero pari, ovvero se ωAC={2,4,6}X = \mathbb{1}_A = \begin{cases} 1 & \text{se esce un numero dispari, ovvero se } \omega \in A = \{1,3,5\} \\ 0 & \text{se esce un numero pari, ovvero se } \omega \in A^C = \{2,4,6\} \end{cases} Y=1B={1se esce uno dei primi tre numeri, ovvero se ωB={1,2,3}0altrimenti, ovvero se ωBC={4,5,6}Y = \mathbb{1}_B = \begin{cases} 1 & \text{se esce uno dei primi tre numeri, ovvero se } \omega \in B = \{1,2,3\} \\ 0 & \text{altrimenti, ovvero se } \omega \in B^C = \{4,5,6\} \end{cases}

Le distribuzioni marginali di XX e YY hanno entrambe la stessa distribuzione Bernoulli(1/2)\text{Bernoulli}(1/2):

PX(X=1)=P(ωA)=36=12PX(X=0)=P(ωA)=36=12P_X(X=1) = P(\omega \in A) = \frac{3}{6} = \frac{1}{2} \qquad P_X(X=0) = P(\omega \notin A) = \frac{3}{6} = \frac{1}{2} PY(Y=1)=P(ωB)=36=12PY(Y=0)=P(ωB)=36=12P_Y(Y=1) = P(\omega \in B) = \frac{3}{6} = \frac{1}{2} \qquad P_Y(Y=0) = P(\omega \notin B) = \frac{3}{6} = \frac{1}{2}

Nonostante le marginali siano identiche nei due casi seguenti, la distribuzione congiunta P(X,Y)P(X,Y) cambia radicalmente a seconda di come vengono associati XX e YY agli esiti.


1° caso: Lancio un solo dado e associo XX e YY allo stesso esito

Lo spazio campionario è Ω={1,2,3,4,5,6}\Omega = \{1,2,3,4,5,6\}, con ogni elemento equiprobabile con probabilità 16\frac{1}{6}.

Ricordiamo la definizione di probabilità congiunta:

P(X=x,Y=y):=P({ωΩ:X(ω)=x e Y(ω)=y})P(X=x, Y=y) := P(\{\omega \in \Omega: X(\omega)=x \text{ e } Y(\omega)=y\})

Essendo IX=IY={0,1}I_X = I_Y = \{0, 1\}, la distribuzione congiunta si rappresenta come una matrice 2×22 \times 2. Calcoliamo le quattro probabilità esplicitando, per ogni coppia (x,y)(x,y), quali elementi di Ω\Omega soddisfano entrambe le condizioni:

  • P(0,0)P(0,0): ωA\omega \notin A e ωB\omega \notin B, ovvero ωACBC={4,6}\omega \in A^C \cap B^C = \{4,6\}
P(0,0)={4,6}6=26P(0,0) = \frac{|\{4,6\}|}{6} = \frac{2}{6}
  • P(1,0)P(1,0): ωA\omega \in A e ωB\omega \notin B, ovvero ωABC={5}\omega \in A \cap B^C = \{5\}
P(1,0)={5}6=16P(1,0) = \frac{|\{5\}|}{6} = \frac{1}{6}
  • P(0,1)P(0,1): ωA\omega \notin A e ωB\omega \in B, ovvero ωACB={2}\omega \in A^C \cap B = \{2\}
P(0,1)={2}6=16P(0,1) = \frac{|\{2\}|}{6} = \frac{1}{6}
  • P(1,1)P(1,1): ωA\omega \in A e ωB\omega \in B, ovvero ωAB={1,3}\omega \in A \cap B = \{1,3\}
P(1,1)={1,3}6=26P(1,1) = \frac{|\{1,3\}|}{6} = \frac{2}{6}

La matrice della distribuzione congiunta è:

Y\XY \backslash X0011PYP_Y
002/62/61/61/63/63/6
111/61/62/62/63/63/6
PXP_X3/63/63/63/611

Le probabilità marginali si recuperano sommando per riga (per PYP_Y) o per colonna (per PXP_X), confermando i valori 1/21/2 calcolati prima.

XX e YY sono indipendenti in questo caso? No. Affinché siano indipendenti occorrerebbe P(x,y)=PX(x)PY(y)P(x,y) = P_X(x) \cdot P_Y(y) per ogni coppia. Ma:

P(0,0)=261212=14P(0,0) = \frac{2}{6} \neq \frac{1}{2} \cdot \frac{1}{2} = \frac{1}{4}

Quindi XX e YY non sono indipendenti: conoscere l'esito di XX fornisce informazioni su YY (entrambe dipendono dallo stesso lancio).


2° caso: Lancio 2 dadi distinti e associo XX al 1° dado e YY al 2° dado

Lo spazio campionario è il prodotto cartesiano:

Ω=Ω1×Ω1={(ω1,ω2):ω1,ω2{1,2,3,4,5,6}},Ω=36\Omega = \Omega_1 \times \Omega_1 = \{(\omega_1, \omega_2) : \omega_1, \omega_2 \in \{1,2,3,4,5,6\}\}, \quad |\Omega| = 36

Ogni coppia (ω1,ω2)(\omega_1, \omega_2) ha probabilità 136\frac{1}{36}. Poiché i due lanci sono fisicamente indipendenti, vale:

P(ω1,ω2)=P(ω1)P(ω2)P(\omega_1, \omega_2) = P(\omega_1) \cdot P(\omega_2)

Questo ci permette di fattorizzare le probabilità congiunte. Infatti XX dipende solo da ω1\omega_1 e YY solo da ω2\omega_2, quindi per ogni coppia (x,y)(x, y):

P(X=x,Y=y)=P(X=x)P(Y=y)=PX(x)PY(y)P(X=x, Y=y) = P(X=x) \cdot P(Y=y) = P_X(x) \cdot P_Y(y)

Calcoliamo esplicitamente:

  • P(0,0)=PX(0)PY(0)=1212=14P(0,0) = P_X(0) \cdot P_Y(0) = \frac{1}{2} \cdot \frac{1}{2} = \frac{1}{4}
  • P(1,0)=PX(1)PY(0)=1212=14P(1,0) = P_X(1) \cdot P_Y(0) = \frac{1}{2} \cdot \frac{1}{2} = \frac{1}{4}
  • P(0,1)=PX(0)PY(1)=1212=14P(0,1) = P_X(0) \cdot P_Y(1) = \frac{1}{2} \cdot \frac{1}{2} = \frac{1}{4}
  • P(1,1)=PX(1)PY(1)=1212=14P(1,1) = P_X(1) \cdot P_Y(1) = \frac{1}{2} \cdot \frac{1}{2} = \frac{1}{4}

La matrice della distribuzione congiunta è uniforme:

Y\XY \backslash X0011PYP_Y
001/41/41/41/41/21/2
111/41/41/41/41/21/2
PXP_X1/21/21/21/211

XX e YY sono indipendenti in questo caso? Sì. Si verifica che P(x,y)=PX(x)PY(y)P(x,y) = P_X(x) \cdot P_Y(y) per ogni coppia, per costruzione stessa del problema.

Possiamo verificare il recupero delle marginali sfruttando l'indipendenza:

PY(0)=xIXP(x,0)=xIXPX(x)PY(0)=PY(0)xIXPX(x)=1=12P_Y(0) = \sum_{x \in I_X} P(x,0) = \sum_{x \in I_X} P_X(x) \cdot P_Y(0) = P_Y(0) \underbrace{\sum_{x \in I_X} P_X(x)}_{=1} = \frac{1}{2} \checkmark

Le due situazioni producono le stesse marginali PXP_X e PYP_Y, ma distribuzioni congiunte completamente diverse. Le marginali non determinano la congiunta: è necessario conoscere la struttura di dipendenza tra le variabili.


Esempio: estrazione con e senza rimpiazzo

Date 6 palline numerate (\longrightarrow distinguibili):

1,2,3,4,5,61, 2, 3, 4, 5, 6

Ne estraggo 2 con rimpiazzo (\longrightarrow indipendenti)

Calcolare la distribuzione congiunta P(X,Y)P(X, Y) (indicando il rispettivo spazio di probabilità) di XX e YY dove XX è il risultato della prima estrazione e YY quello della seconda (nell'ordine).

Soluzione (con rimpiazzo)

Dato che le estrazioni sono con rimpiazzo, lo spazio campionario è Ω=Ω~×Ω~\Omega = \tilde{\Omega} \times \tilde{\Omega} dove:

Ω~={1,2,3,4,5,6}\tilde{\Omega} = \{1, 2, 3, 4, 5, 6\} ω=(ω1,ω2)con ωiΩ~\omega = (\omega_1, \omega_2) \quad \text{con } \omega_i \in \tilde{\Omega}

Le variabili aleatorie restituiscono i valori estratti:

X(ω)=ω1Y(ω)=ω2X(\omega) = \omega_1 \qquad Y(\omega) = \omega_2

La distribuzione congiunta è:

p(X,Y)=P(i,j)=P({ω:X(ω)=i,Y(ω)=j})=P({(ω1,ω2):ω1=i,ω2=j})p(X, Y) = P(i, j) = P(\{\omega: X(\omega) = i, Y(\omega) = j\}) = P(\{(\omega_1, \omega_2): \omega_1 = i, \omega_2 = j\})

Essendo le estrazioni indipendenti:

P(ω1=iω2=j)=P(ω1=i)P(ω2=j)P(\omega_1 = i \cap \omega_2 = j) = P(\omega_1 = i)P(\omega_2 = j) P(X=i,Y=j)=PX(X=i)PY(Y=j)=1616=136\longrightarrow P(X=i, Y=j) = P_X(X=i)P_Y(Y=j) = \frac{1}{6} \cdot \frac{1}{6} = \frac{1}{36}

Lo spazio campionario Ω~×Ω~\tilde{\Omega} \times \tilde{\Omega} conta 6×6=366 \times 6 = 36 combinazioni possibili (rappresentabili su un piano cartesiano discreto 6×66 \times 6). Poiché tutti gli eventi sono equiprobabili:

P(i,j)=P({ω=(i,j)})=136P(i, j) = P(\{\omega = (i, j)\}) = \frac{1}{36}

Soluzione (senza rimpiazzo)

Evidentemente in questo caso la probabilità congiunta non è pari al prodotto delle probabilità marginali:

p(X=i,Y=j)pX(X=i)pY(Y=j)p(X=i, Y=j) \neq p_X(X=i)p_Y(Y=j)

Basta considerare per esempio il caso in cui uscirà due volte lo stesso numero: potendo pescare una pallina solo una volta per ciascun numero senza reinserirla, è un evento impossibile:

P(X=i,Y=i)=0PX(X=i)PY(Y=i)P(X=i, Y=i) = 0 \neq P_X(X=i)P_Y(Y=i)

Lo spazio campionario è ora formato dalle coppie ordinate Ω={(ω1,ω2)}\Omega = \{(\omega_1, \omega_2)\} dove:

  • ω1Ω~\omega_1 \in \tilde{\Omega} (6 possibilità)
  • ω2Ω~{ω1}\omega_2 \in \tilde{\Omega} \setminus \{\omega_1\} (5 possibilità)

Il numero totale di eventi è 6×5=306 \times 5 = 30. In effetti, l'insieme di tutti quanti gli eventi dell'estrazione originaria, meno quelli con 2 numeri uguali (che sono 6, sulla diagonale), risulta essere 366=3036 - 6 = 30.

Poiché tutte le coppie ordinate così costruite sono ancora equiprobabili, si ottiene:

P(i,j)=130(per ij)P(i, j) = \frac{1}{30} \quad \text{(per } i \neq j \text{)}

La distribuzione congiunta si può rappresentare in forma tabellare, dove solo gli elementi sulle righe con valori diversi assumono esito di probabilità, e con zeri presenti lungo la diagonale:

X\YX \backslash Y112233445566
11001/301/301/301/301/301/301/301/301/301/30
221/301/30001/301/301/301/301/301/301/301/30
331/301/301/301/30001/301/301/301/301/301/30
441/301/301/301/301/301/30001/301/301/301/30
551/301/301/301/301/301/301/301/30001/301/30
661/301/301/301/301/301/301/301/301/301/3000

Esempio: probabilità di una differenza limitata

Calcolare la probabilità che estraendo 2 palline numerate da 6, senza rimpiazzo, queste differiscano 2 o meno di 2.

Soluzione

Essendo l'estrazione senza rimpiazzo, abbiamo garantito che P(XY)=1\longrightarrow P(X \neq Y) = 1.

L'evento da calcolare è P(X,Y:XY<3)P(X, Y: |X-Y| < 3).

Ci sono 2 casi simmetrici (che rappresentano eventi disgiunti):

  1. X>YX > Y: XY2X2Y<XX - Y \leq 2 \longrightarrow X - 2 \leq Y < X
  2. X<YX < Y: YX2X<YX+2Y - X \leq 2 \longrightarrow X < Y \leq X + 2

Pertanto, la probabilità totale è la somma delle probabilità dei due casi:

P(X,Y:XY<3)=P(X,Y:X2Y<X)+P(X,Y:X<YX+2)P(X, Y: |X-Y| < 3) = P(X, Y: X-2 \leq Y < X) + P(X, Y: X < Y \leq X+2)

Esplicitiamo le sommatorie sommando le probabilità congiunte per le coppie valide (ricordando che P(i,j)=130P(i, j) = \frac{1}{30} ovunque):

=[i=26P(i,i1)+i=36P(i,i2)]+[i=15P(i,i+1)+i=14P(i,i+2)]= \left[ \sum_{i=2}^6 P(i, i-1) + \sum_{i=3}^6 P(i, i-2) \right] + \left[ \sum_{i=1}^5 P(i, i+1) + \sum_{i=1}^4 P(i, i+2) \right]

Sostituiamo i valori:

=[i=26130+i=36130]+[i=15130+i=14130]= \left[ \sum_{i=2}^6 \frac{1}{30} + \sum_{i=3}^6 \frac{1}{30} \right] + \left[ \sum_{i=1}^5 \frac{1}{30} + \sum_{i=1}^4 \frac{1}{30} \right]

Le prime due sommatorie hanno rispettivamente 5 e 4 termini. Le seconde due hanno pure 5 e 4 termini, per la simmetria:

=25+430=1830=35= 2 \cdot \frac{5 + 4}{30} = \frac{18}{30} = \frac{3}{5}

Esempio: probabilità di una sequenza di n variabili aleatorie

Calcolare la probabilità di una sequenza lunga nn di nn variabili aleatorie, ottenuta lanciando nn volte un dado con:

X=(X1,X2,,Xn)Xi{0,1}\underline{X} = (X_1, X_2, \dots, X_n) \quad X_i \in \{0, 1\}

Dove le variabili sono così definite per il jj-esimo lancio:

Xj={1se al j-esimo lancio esce 10se al j-esimo lancio esce ω1X_j = \begin{cases} 1 & \text{se al } j \text{-esimo lancio esce } 1 \\ 0 & \text{se al } j \text{-esimo lancio esce } \omega \neq 1 \end{cases}

Soluzione

La distribuzione di probabilità per la singola variabile XjX_j è:

PX(Xj)={16se Xj=156se Xj=0P_X(X_j) = \begin{cases} \frac{1}{6} & \text{se } X_j = 1 \\ \frac{5}{6} & \text{se } X_j = 0 \end{cases}

Poiché i lanci sono indipendenti, la probabilità congiunta dell'intera sequenza è pari al prodotto delle probabilità marginali:

PX(x=(x1,x2,,xn))=PX((X1=x1)(X2=x2)(Xn=xn))=i=1nPXi(Xi=xi)P_{\underline{X}}(\underline{x} = (x_1, x_2, \dots, x_n)) = P_{\underline{X}}((X_1 = x_1) \cap (X_2 = x_2) \cap \dots \cap (X_n = x_n)) = \prod_{i=1}^n P_{X_i}(X_i = x_i)

Dove ciascuna probabilità è determinata dall'uscita del dado:

PXi(Xi=xi)={1/6se all’i-esimo lancio esce ω=15/6se all’i-esimo lancio esce ω{2,3,4,5,6}P_{X_i}(X_i = x_i) = \begin{cases} 1/6 & \text{se all'} i \text{-esimo lancio esce } \omega = 1 \\ 5/6 & \text{se all'} i \text{-esimo lancio esce } \omega \in \{2, 3, 4, 5, 6\} \end{cases}

Indicando con k=i=1nxik = \sum_{i=1}^n x_i il numero di lanci in cui è uscito 1, la probabilità congiunta si semplifica in:

PX(x)=(16)k(56)nkP_{\underline{X}}(\underline{x}) = \left(\frac{1}{6}\right)^k \cdot \left(\frac{5}{6}\right)^{n-k}

Varianza di una variabile aleatoria

La media E[X]\mathbb{E}[X] indica il "centro" della distribuzione di XX, ma non dice nulla su quanto i valori di XX siano dispersi attorno a quel centro. Due variabili aleatorie con la stessa media possono essere molto diverse: una che assume sempre valori vicini alla media, e una che oscilla fortemente.

Se XX è una variabile aleatoria simmetrica (cioè assume valori simmetrici rispetto allo zero, cioè che xI(Ω)x \in I(\Omega) implica xI(Ω)-x \in I(\Omega)) e ha distribuzione simmetrica, cioè che per ogni xiI(Ω)x_i \in I(\Omega) vale P(X=xi)=P(X=xi)P(X = x_i) = P(X = -x_i), allora la media di XX è zero:

E[X]=xiI(Ω)xiP(X=xi)=0\mathbb{E}[X] = \sum_{x_i \in I(\Omega)} x_i P(X = x_i) = 0

Però questo non ci dice nulla su quanto XX si discosta da zero, cioè quanto è "variabile" XX.

Perché non usare E[XE[X]]\mathbb{E}[X - \mathbb{E}[X]]? Questo valore è sempre zero per costruzione (gli scostamenti positivi e negativi si cancellano). Bisogna quindi usare una misura che non permetta la cancellazione, elevando al quadrato:

σX2=var(X)=E[(XE[X])2]\sigma^2_X = \text{var}(X) = \mathbb{E}\left[(X - \mathbb{E}[X])^2\right]

Intuitivamente, la varianza misura quanto in media i valori di XX si allontanano dalla media. Una varianza piccola indica che i valori sono concentrati attorno alla media; una varianza grande indica che sono molto dispersi.

Esempio

Sia X{1,1}X \in \{-1, 1\} con probabilità PX(1)=PX(1)=1/2P_X(1) = P_X(-1) = 1/2. Calcoliamo il valore atteso:

E(X)=x{1,1}x12=1212=0\mathbb{E}(X) = \sum_{x \in \{-1,1\}} x \cdot \frac{1}{2} = \frac{1}{2} - \frac{1}{2} = 0

Calcoliamo la varianza:

var(X)=x{1,1}(x0)2P(x)=x{1,1}112=12+12=1\text{var}(X) = \sum_{x \in \{-1,1\}} (x - 0)^2 P(x) = \sum_{x \in \{-1,1\}} 1 \cdot \frac{1}{2} = \frac{1}{2} + \frac{1}{2} = 1

Uguagliabile anche come:

E(X2)=var(X)=1E(X2)E2(X)=1\mathbb{E}(X^2) = \text{var}(X) = 1 \quad \longrightarrow \quad \mathbb{E}(X^2) - \mathbb{E}^2(X) = 1

Nota: Il valore atteso è 00 anche se X0X \neq 0 sempre. La varianza è 11, che indica che il valore atteso che la variabile si discosti dal suo valore medio è 11.

Esempi: Confronto tra 2 v.a. X1X_1 e X2X_2

Consideriamo due variabili aleatorie con lo stesso valore atteso ma diversa dispersione.

Se X1{100,100}X_1 \in \{-100, 100\} con probabilità (1/2,1/2)(1/2, 1/2):

E(X1)=12(100)+12(100)=0\mathbb{E}(X_1) = \frac{1}{2}(-100) + \frac{1}{2}(100) = 0 var(X1)=E((X10)2)=E(X2)=(100)2=10000\text{var}(X_1) = \mathbb{E}((X_1 - 0)^2) = \mathbb{E}(X^2) = (100)^2 = 10000

Se consideriamo invece X2{1,0,1}X_2 \in \{-1, 0, 1\} con probabilità P(1)=P(1)=1/8P(-1) = P(1) = 1/8 e P(0)=3/4P(0) = 3/4:

E(X2)=118+034+118=0\mathbb{E}(X_2) = -1 \cdot \frac{1}{8} + 0 \cdot \frac{3}{4} + 1 \cdot \frac{1}{8} = 0 var(X2)=E((X20)2)=E(X22)=(1)218+0234+1218=28=14\text{var}(X_2) = \mathbb{E}((X_2 - 0)^2) = \mathbb{E}(X_2^2) = (-1)^2 \cdot \frac{1}{8} + 0^2 \cdot \frac{3}{4} + 1^2 \cdot \frac{1}{8} = \frac{2}{8} = \frac{1}{4}

Notiamo che entrambe hanno media nulla, ma:

var(X2)var(X1)\text{var}(X_2) \ll \text{var}(X_1)

(Questo ovviamente accade perché X2X_2 è più concentrata al centro).

Proprietà della varianza

  • La varianza è sempre non negativa: σX20\sigma^2_X \geq 0 (è una media di quadrati).
  • Formula alternativa (spesso più comoda nei calcoli):
var(X)=E[X2](E[X])2\text{var}(X) = \mathbb{E}[X^2] - (\mathbb{E}[X])^2

Questa si ricava espandendo il quadrato: E[(Xμ)2]=E[X22μX+μ2]=E[X2]2μ2+μ2=E[X2]μ2\mathbb{E}[(X-\mu)^2] = \mathbb{E}[X^2 - 2\mu X + \mu^2] = \mathbb{E}[X^2] - 2\mu^2 + \mu^2 = \mathbb{E}[X^2] - \mu^2.

  • Come conseguenza: E[X2](E[X])2\mathbb{E}[X^2] \geq (\mathbb{E}[X])^2
  • Scalamento: var(aX)=a2var(X)\text{var}(aX) = a^2 \text{var}(X) per ogni aRa \in \mathbb{R} — NON è lineare, è quadratica nel fattore di scala.
  • Traslazione: var(X+a)=var(X)\text{var}(X + a) = \text{var}(X) per ogni aRa \in \mathbb{R} — traslare non cambia la dispersione.

Covarianza di due variabili aleatorie

La covarianza misura il grado e il verso della dipendenza lineare tra due variabili aleatorie XX e YY: indica se tendono a variare insieme o in direzioni opposte.

cov(X,Y)=E[(XE[X])(YE[Y])]\text{cov}(X, Y) = \mathbb{E}\left[(X - \mathbb{E}[X])(Y - \mathbb{E}[Y])\right]

L'idea intuitiva è la seguente: si considera il prodotto degli scostamenti di XX e YY dalle rispettive medie.

  • Se XX è sopra la sua media e YY è sopra la sua (\uparrow\uparrow), il prodotto è positivo.
  • Se XX è sopra la sua media e YY è sotto la sua (\uparrow\downarrow), il prodotto è negativo.

La media di questi prodotti (la covarianza) sarà quindi:

  • cov(X,Y)>0\text{cov}(X,Y) > 0: XX e YY tendono a muoversi nella stessa direzione (al crescere di XX cresce anche YY).
  • cov(X,Y)<0\text{cov}(X,Y) < 0: XX e YY tendono a muoversi in direzioni opposte (al crescere di XX decresce YY).
  • cov(X,Y)=0\text{cov}(X,Y) = 0: XX e YY sono incorrelate (non c'è dipendenza lineare tra loro).

Proprietà della covarianza

  • Simmetria: cov(X,Y)=cov(Y,X)\text{cov}(X, Y) = \text{cov}(Y, X)
  • Bilinearità: cov(aX+b,cY+d)=accov(X,Y)\text{cov}(aX + b, cY + d) = ac \cdot \text{cov}(X, Y)
  • Indipendenza implica covarianza nulla: se XYX \perp Y allora E[XY]=E[X]E[Y]\mathbb{E}[XY] = \mathbb{E}[X]\mathbb{E}[Y], quindi cov(X,Y)=0\text{cov}(X,Y) = 0. Il viceversa non vale in generale: covarianza nulla non implica indipendenza (rileva solo dipendenza lineare).

Varianza della somma

Dalla definizione di covarianza si ricava:

var(X+Y)=var(X)+var(Y)+2cov(X,Y)\text{var}(X + Y) = \text{var}(X) + \text{var}(Y) + 2 \cdot \text{cov}(X, Y)

Se XX e YY sono indipendenti (o anche solo incorrelate), cov(X,Y)=0\text{cov}(X, Y) = 0 e quindi:

var(X+Y)=var(X)+var(Y)\text{var}(X + Y) = \text{var}(X) + \text{var}(Y)

Momento p-esimo

DEF: Il momento p-esimo E[Xp]\mathbb{E}[X^p] di una variabile aleatoria XX è il valore atteso della variabile XpX^p, ovvero:

E[Xp]=xXxpPX(x)\mathbb{E}[X^p] = \sum_{x \in \mathcal{X}} x^p \, P_X(x)

dove pNp \in \mathbb{N} con p1p \geq 1.

Intuizione: I momenti descrivono la "forma" della distribuzione di XX. Ogni ordine pp cattura un aspetto diverso:

Ordine ppMomentoSignificato
p=1p=1E[X]\mathbb{E}[X]Media — valore centrale atteso
p=2p=2E[X2]\mathbb{E}[X^2]Usato per calcolare la varianza: var(X)=E[X2](E[X])2\text{var}(X) = \mathbb{E}[X^2] - (\mathbb{E}[X])^2
p=3p=3E[X3]\mathbb{E}[X^3]Legato alla asimmetria (skewness) della distribuzione
p=4p=4E[X4]\mathbb{E}[X^4]Legato alla curtosi, ovvero quanto è "appuntita" la distribuzione

Momento p-esimo centrato: Si definisce anche il momento centrato rispetto alla media:

E[(XE[X])p]\mathbb{E}[(X - \mathbb{E}[X])^p]

Il caso p=2p=2 dà la varianza, che è il momento secondo centrato.

Funzione di una variabile aleatoria discreta

Data una variabile aleatoria discreta XX con dominio D(X)RD(X) \subset \mathbb{R}, e una funzione g:D(X)Rg: D(X) \to \mathbb{R}, anche g(X)g(X) è una variabile aleatoria discreta. La sua distribuzione di probabilità è:

Pg(g=e)=x:g(x)=ePX(x)P_g(g = e) = \sum_{x:\, g(x) = e} P_X(x)

Ovvero, per trovare la probabilità che g(X)g(X) assuma il valore ee, si sommano le probabilità di tutti i valori xx della variabile originale che vengono mappati in ee dalla funzione gg.

Valore atteso di g(X)g(X) — Teorema del trasferimento

Invece di dover calcolare prima la nuova distribuzione PgP_g per poi computare il valore atteso, è possibile calcolare E[g(X)]\mathbb{E}[g(X)] direttamente usando la distribuzione di XX:

E[g(X)]=igiPg(gi)=jg(xj)PX(xj)\mathbb{E}[g(X)] = \sum_i g_i \, P_g(g_i) = \sum_j g(x_j) \, P_X(x_j)

Si può quindi calcolare il valore atteso applicando gg ai valori originali xjx_j e pesandoli con la probabilità originale PX(xj)P_X(x_j), senza passare esplicitamente per la distribuzione di g(X)g(X).