Случайные величины, распределения, моменты

Статистический анализ данных

Дмитрий В. Наумов (ОИЯИ)

Случайность и случайные величины

Почему «случайно»?

  • В классической физике флуктуации возникают из-за неполного знания начальных условий и большого числа степеней свободы.
  • В квантовой физике вероятностная природа заложена в саму теорию.
  • Эксперимент наблюдает не «идеальное ожидание», а конкретную реализацию со статистическими флуктуациями.
  • Поэтому сравнение модели с данными всегда формулируется на языке вероятности.

Случайная величина и её распределение

  • Случайная величина \(X\) – экспериментально измеряемая величина, которая не может быть предсказана до проведения эксперимента.
  • Для дискретной \(X\): функция вероятностей (PMF=probability mass function) \[ p_k=P(X=x_k),\qquad \sum_k p_k=1. \]
  • Для непрерывной \(X\): плотность вероятности (PDF=probability density function) \[ P(x\le X<x+dx)=f(x)\,dx,\qquad \int_{-\infty}^{+\infty}f(x)\,dx=1. \]

Кумулятивная функция распределения (CDF)

  • Для непрерывной \(X\): \[ F(a) = P(X < a) = \int_{-\infty}^a f(x)\, dx \]

  • \(F(a)\) монотонно возрастает от 0 до 1.

  • \(F'(a) = f(a)\) для непрерывных распределений.

  • Вероятность попасть в интервал \([a,b)\): \[ P(a \le X < b) = F(b) - F(a). \]

Средние, дисперсии и моменты

Моменты распределения

  • Полезны моменты функции \(f(x)\): \[ \langle x^n\rangle = \mathbb{E}[X^n]=\int_{-\infty}^{+\infty} x^n f(x)\, dx. \]
  • Если известны все моменты \(\langle x^n\rangle\), то можно восстановить \(f(x)\) (не для любой функции!).

Практически важные моменты

  • Среднее: \[ \mu = \langle x\rangle=\mathbb{E}[X] =\int_{-\infty}^{+\infty} x f(x)\, dx. \]
  • Средний квадрат: \[ \langle x^2\rangle = \mathbb{E}[X^2]=\int_{-\infty}^{+\infty} x^2 f(x)\, dx. \]
  • Дисперсия: \[ \sigma^2=\mathrm{Var}(X)=\mathbb{E}[(X-\mu)^2]=\mathbb{E}[X^2-2\mu X+\mu^2]=\langle x^2\rangle - \langle x \rangle^2. \]

Моменты распределения произвольной функции \(g(X)\) случайной величины

  • Среднее значение функции \(g(X)\): \[ \langle g(x) \rangle = \mathbb{E}[g(X)] = \int g(x)f(x)\,dx. \]
  • Вариация функции \(g(X)\): \[ \mathrm{Var}(g(X)) = \mathbb{E}[(g(X) - \langle g(X) \rangle)^2] = \int \left(g(x) - \langle g(x) \rangle\right)^2 f(x)\,dx. \]

Базовые распределения

Три важных примера

  • Биномиальное распределение
  • Распределение Пуассона
  • Нормальное (гауссово) распределение

Счёт успехов: биномиальная модель

Биномиальное распределение

Если в \(n\) независимых испытаниях вероятность успеха равна \(p\), то \[ P(K=k)=\binom{n}{k}p^k(1-p)^{n-k},\qquad k=0,\dots,n. \]

где \[ \binom{n}{k}=\frac{n!}{k!(n-k)!} \] это число способов выбрать \(k\) успехов среди \(n\) испытаний.

Пример биномиального распределения

Наблюдаем \(n\) распадов \(W^{\pm}\). Число распадов \(W\to\mu\nu\): \(k\sim \mathrm{Bin}(n,p)\), где \(p\) — вероятность такого распада. Три случая: \(n=5,20,100\) при \(p=0.3\).

from math import comb
import numpy as np

p = 0.3
for n in [5, 20, 100]:
    k = np.arange(n + 1)
    pmf = np.array([comb(n, i) * p**i * (1-p)**(n-i) for i in k])

Моменты биномиального распределения

  • Математическое ожидание: \(\mathbb{E}[K]=np\)
  • Дисперсия: \(\mathrm{Var}(K)=np(1-p)\)
  • Пример: число распадов нужного канала при фиксированном числе родительских частиц.

Пошаговый вывод

Вывод \(\mathbb{E}[K]\)

  • По определению: \[ \mathbb{E}[K] =\sum_{k=0}^n k\,P(K=k) =\sum_{k=0}^n k\binom{n}{k}p^k(1-p)^{n-k}. \]

  • Используем тождество \[ k\binom{n}{k}=k \frac{n!}{k!(n-k)!} = n\frac{(n-1)!}{(k-1)!(n-k)!} = n\binom{n-1}{k-1}, \]

  • и получаем \[ \mathbb{E}[K] =np\sum_{k=1}^{n}\binom{n-1}{k-1}p^{k-1}(1-p)^{n-k}. \]

Вывод \(\mathbb{E}[K]\)

  • Положим \(j=k-1\): \[ \mathbb{E}[K] =np\sum_{j=0}^{n-1}\binom{n-1}{j}p^j(1-p)^{(n-1)-j}. \]

  • По биному Ньютона \[ \sum_{j=0}^{n-1}\binom{n-1}{j}p^j(1-p)^{(n-1)-j} =(p+(1-p))^{n-1}=1. \]

  • Итог: \[ \boxed{ \mathbb{E}[K]=np.} \]

Вывод \(\mathrm{Var}(K)\)

  • Начнём со второго факториального момента: \[ \mathbb{E}[K(K-1)] =\sum_{k=0}^{n}k(k-1)\binom{n}{k}p^k(1-p)^{n-k}. \]

  • Используем тождество

\[ k(k-1)\binom{n}{k}=k(k-1)\frac{n!}{k!(n-k)!} \]

\[ = n(n-1)\frac{(n-2)!}{(k-2)!(n-k)!} \]

\[ = n(n-1)\binom{n-2}{k-2}. \]

Вывод \(\mathrm{Var}(K)\)

  • Получаем тождество: \[ k(k-1)\binom{n}{k}=n(n-1)\binom{n-2}{k-2}. \]
  • Теперь, используя его в формуле для \(\mathbb{E}[K(K-1)]\), находим

\[ \mathbb{E}[K(K-1)] =\sum_{k=0}^{n}k(k-1)\binom{n}{k}p^k(1-p)^{n-k}. \]

\[ =n(n-1)p^2\sum_{k=2}^{n}\binom{n-2}{k-2}p^{k-2}(1-p)^{n-k} =n(n-1)p^2. \]

\[ \boxed{\mathbb{E}[K(K-1)]=n(n-1)p^2.} \]

Вывод \(\mathrm{Var}(K)\)

  • Используем очевидное тождество для \(K^2\): \[ K^2=K(K-1)+K, \]

  • поэтому \[ \mathbb{E}[K^2]=\mathbb{E}[K(K-1)]+\mathbb{E}[K] =n(n-1)p^2+np. \]

  • Теперь \[ \mathrm{Var}(K)=\mathbb{E}[K^2]-\mathbb{E}[K]^2 =\big(n(n-1)p^2+np\big)-(np)^2 =np(1-p). \]

Счёт редких событий: пуассоновская модель

Распределение Пуассона

  • Распределение Пуассона моделирует число событий в фиксированном интервале времени или пространства при постоянной средней интенсивности \(\lambda\) и независимых событиях.
  • Пример: число распадов радиоактивного источника за 1 минуту.
  • Вероятность наблюдения \(N=k\) событий при среднем числе событий \(\lambda\): \[ P(N=k)=\frac{\lambda^k e^{-\lambda}}{k!},\qquad k=0,1,2,\dots \]

Пример распределения Пуассона

Считаем число событий \(N\) за фиксированное время. Если среднее число событий равно \(\lambda\), то \(N\sim \mathrm{Pois}(\lambda)\). Три случая: \(\lambda=1,4,10\).

from math import factorial
import numpy as np

for lam in [1, 4, 10]:
    k = np.arange(26)
    pmf = np.exp(-lam) * lam**k / np.array([factorial(i) for i in k])

Моменты распределение Пуассона

  • \(\mathbb{E}[N]=\lambda\)
  • \(\mathrm{Var}(N)=\lambda\)

Пошаговый вывод

Вывод \(\mathbb{E}[N]\)

По определению: \[ \mathbb{E}[N]=\sum_{k=0}^{\infty} k\,\frac{\lambda^k e^{-\lambda}}{k!}. \]

Выносим множители за сумму: \[ \mathbb{E}[N]=\lambda e^{-\lambda}\sum_{k=1}^{\infty}\frac{\lambda^{k-1}}{(k-1)!}. \]

Сдвиг индекса \(j=k-1\): \[ \mathbb{E}[N]=\lambda e^{-\lambda}\sum_{j=0}^{\infty}\frac{\lambda^j}{j!} =\lambda e^{-\lambda}e^{\lambda} =\lambda. \]

\[ \boxed{\mathbb{E}[N]=\lambda.} \]

Вывод \(\mathrm{Var}(N)\)

Сначала второй факториальный момент: \[ \mathbb{E}[N(N-1)] =\sum_{k=0}^{\infty}k(k-1)\frac{\lambda^k e^{-\lambda}}{k!}. \]

Поскольку \(\dfrac{k(k-1)}{k!}=\dfrac{1}{(k-2)!}\): \[ \mathbb{E}[N(N-1)] =\lambda^2 e^{-\lambda}\sum_{k=2}^{\infty}\frac{\lambda^{k-2}}{(k-2)!} =\lambda^2 e^{-\lambda}\sum_{j=0}^{\infty}\frac{\lambda^j}{j!} =\lambda^2. \]

\[ \boxed{\mathbb{E}[N(N-1)]=\lambda^2.} \]

Вывод \(\mathrm{Var}(N)\)

  • Используем связь: \[ N^2=N(N-1)+N. \]
  • Тогда \[ \mathbb{E}[N^2]=\mathbb{E}[N(N-1)]+\mathbb{E}[N]=\lambda^2+\lambda. \]
  • И \[ \mathrm{Var}(N)=\mathbb{E}[N^2]-\mathbb{E}[N]^2 =(\lambda^2+\lambda)-\lambda^2 =\lambda. \]

Непрерывные ошибки: нормальная модель

Нормальное (гауссово) распределение

\[ f(x;\mu,\sigma)=\frac{1}{\sigma(2\pi)^{1/2}} \exp\!\left[-\frac{(x-\mu)^2}{2\sigma^2}\right]. \]

  • Непрерывная модель с центром \(\mu\) и масштабом разброса \(\sigma\).
  • Часто возникает как сумма многих малых независимых вкладов.

Много лет назад я назвал кривую Лапласа-Гаусса нормальной кривой. Это название, избегая международного спора о приоритете, имеет недостаток: оно заставляет думать, что все прочие распределения частот в том или ином смысле «ненормальны».

К. Пирсон (1920)

Пример нормального распределения

Параметр \(\mu\) задаёт среднее, \(\sigma\) — ширину. Три случая: \((\mu,\sigma)=(0,1),(0,2),(2,1)\).

import numpy as np

x = np.linspace(-6, 6, 400)
for mu, sigma in [(0, 1), (0, 2), (2, 1)]:
    pdf = np.exp(-0.5*((x-mu)/sigma)**2)/(sigma*np.sqrt(2*np.pi))

Моменты гауссова распределения

  • \(\mathbb{E}[X]=\mu\)
  • \(\mathrm{Var}(X)=\sigma^2\)

Пошаговый вывод

Вывод \(\mathbb{E}[X]\)

По определению: \[ \mathbb{E}[X] =\int_{-\infty}^{+\infty}x\, \frac{1}{\sigma(2\pi)^{1/2}} \exp\!\left[-\frac{(x-\mu)^2}{2\sigma^2}\right]dx. \]

Переход к стандартной нормали: \(z=\dfrac{x-\mu}{\sigma}\), \(x=\mu+\sigma z\), \(dx=\sigma dz\). \[ \mathbb{E}[X] =\int_{-\infty}^{+\infty}(\mu+\sigma z)\,\varphi(z)\,dz,\qquad \varphi(z)=\frac{1}{\sqrt{2\pi}}e^{-z^2/2}. \]

\[ \mathbb{E}[X] =\mu\int_{-\infty}^{+\infty}\varphi(z)\,dz +\sigma\int_{-\infty}^{+\infty}z\varphi(z)\,dz =\mu\cdot1+\sigma\cdot0=\mu, \] так как \(z\varphi(z)\) нечётная функция.

\[ \boxed{\mathbb{E}[X]=\mu.} \]

Вывод \(\mathrm{Var}(X)\)

По определению: \[ \mathrm{Var}(X)=\mathbb{E}[(X-\mu)^2] =\int_{-\infty}^{+\infty}(x-\mu)^2 f(x)\,dx. \]

При \(z=\dfrac{x-\mu}{\sigma}\): \[ \mathrm{Var}(X)=\sigma^2\int_{-\infty}^{+\infty}z^2\varphi(z)\,dz =\sigma^2\,\mathbb{E}[Z^2],\qquad Z\sim\mathrm{N}(0,1). \]

\[ \mathbb{E}[Z^2] =\int_{-\infty}^{+\infty}z^2\varphi(z)\,dz =\left[-z\varphi(z)\right]_{-\infty}^{+\infty} +\int_{-\infty}^{+\infty}\varphi(z)\,dz =1. \]

\[ \boxed{\mathrm{Var}(X)=\sigma^2.} \]

Резюме

Резюме по распределениям

Название Среднее Дисперсия Условия применения
Биномиальное \(K\sim\mathrm{Bin}(n,p)\) \(np\) \(np(1-p)\) Фиксированное \(n\); независимые испытания; постоянное \(p\).
Пуассон \(N\sim\mathrm{Pois}(\lambda)\) \(\lambda\) \(\lambda\) События в фиксированном интервале; постоянная интенсивность; независимость.
Нормальное \(X\sim\mathrm{N}(\mu,\sigma)\) \(\mu\) \(\sigma^2\) Непрерывные ошибки; сумма многих малых независимых вкладов.

Что важно запомнить

  • Данные в эксперименте флуктуируют, и эти флуктуации нужно описывать вероятностно.
  • Выбор распределения определяется физикой задачи.
  • Среднее и дисперсия — первые количественные характеристики распределения.
  • Биномиальное, пуассоновское и нормальное распределения — базовый рабочий набор экспериментатора.