Когда не возникает гауссового распределения

О чем вам не расскажут, но знать это нужно

Дмитрий В. Наумов (ОИЯИ)

Мотивация

Зачем нужна эта лекция

  • В лекции про ЦПТ мы увидели, как сумма бесконечного числа независимых вкладов описывается гауссовым распределением.
  • Но в реальной жизни гауссовое распределение возникает не всегда.
  • Важно понимать, когда и почему гауссово распределение не возникает.

Напоминание: ЦПТ и условия

  • Пусть \[ S_n=X_1+\dots+X_n. \]

  • Если величины независимы и имеют конечные средние и дисперсии, \[ \mathbb{E}[X_i]=\mu_i, \qquad \mathrm{Var}(X_i)=\sigma_i^2<\infty, \]

  • то при достаточно мягких дополнительных условиях нормированная сумма \[ Z_n=\frac{S_n-\mathbb{E}[S_n]}{\sqrt{\mathrm{Var}(S_n)}} \]

  • стремится к стандартному гауссу: \[ Z_n\Rightarrow \mathrm{N}(0,1). \]

ЦПТ для одинаковых распределений

  • Формулу \[ Z_n=\frac{S_n-\mathbb{E}[S_n]}{\sqrt{\mathrm{Var}(S_n)}} \] удобно переписать для одинаковых распределений: \[ Z_n=\frac{S_n/n-\mu}{\sigma/\sqrt{n}}, \] где \(\mu = \mathbb{E}[X_i]\) и \(\sigma^2 = \mathrm{Var}(X_i)\).
  • Тогда \(Z_n\) стремится к стандартному гауссу при \(n\to\infty\): \[ \lim\limits_{n\to\infty} Z_n\Rightarrow \mathrm{N}(0,1). \]
  • при конечных \(n\) среднее \(S_n\) стремится к \(\mu\), но его типичное отклонение от \(\mu\) имеет порядок \(\sigma/\sqrt{n}\).

Где спрятаны условия

  • Сумма должна состоять из бесконечного числа малых вкладов.

  • Ни один вклад не должен доминировать над всеми остальными.

  • Слагаемые не должны иметь бесконечно тяжёлых хвостов.

  • Корреляции должны отсутствовать.

  • Мы должны смотреть именно на сумму, а не на произвольную нелинейную функцию суммы.

  • Для суммы \[ S_n=\sum_{i=1}^n X_i \] дисперсия равна \[ \mathrm{Var}(S_n) =\sum_i\mathrm{Var}(X_i)+2\sum_{i<j}\mathrm{cov}(X_i,X_j). \]

  • Если ковариации равны нулю, дисперсии складываются.

  • Если ковариации велики, число слагаемых само по себе ничего не гарантирует.

  • Если дисперсии отдельных вкладов не существуют, формула теряет смысл.

Распределение Коши и ЦПТ

Напомним:

Стандартное распределение Коши: \[ f(x)=\frac{1}{\pi}\frac{1}{1+x^2}. \]

  • CDF распределения Коши: \[ F(x)=\frac{1}{2}+\frac{1}{\pi}\arctan(x). \]
  • Обратная функция позволяет разыгрывать случайные значения: \[ F^{-1}(u) = \tan\!\left[\pi\left(u-\frac{1}{2}\right)\right]. \]
  • Первый момент и дисперсия расходятся: \[ \mathbb{E}[|X|]=\infty, \qquad \mathbb{E}[X^2]=\infty. \]

Среднее Коши не сужается с ростом \(n\)

  • Пусть \[ X_1,\dots,X_n\sim \mathrm{Cauchy}(0,1) \] независимы.

  • Тогда, как мы видели в лекции про характеристические функции, сумма \[ S_n=\sum_{i=1}^n X_i \] имеет распределение: \[ S_n\sim \mathrm{Cauchy}(0,n). \]

  • И среднение независимых величин Коши не сужает распределение среднего: \[ S_n/n\sim \mathrm{Cauchy}(0,1). \]

Интерактив: среднее Коши не становится гауссом

Распределение Коши и статистика

  • В ФЭЧ распределение Коши известно как кривая Брейта-Вигнера. Она описывает резонансы.
  • Если среднее Коши не сужается с ростом \(n\), получается, нет смысла копить данные?
  • Нет. Этот вывод не верный. Но почему он неверный, мы поймем в лекции про оценки параметров.

Энергетические потери в тонком слое вещества

Почему здесь не возникает гауссовое распределение?

  • Заряженная частица теряет энергию в веществе через много актов ионизации и возбуждения.
  • Полная потеря энергии в тонком слое: \[ \Delta=\omega_1+\omega_2+\dots+\omega_N. \]
  • Но отдельные передачи энергии \(\omega_a\) не являются «одинаково малыми поправками».
  • Редкая большая передача энергии \(\delta\)-электрону может заметно изменить всю сумму.

Хвост от редких больших передач

Для быстрой заряженной частицы сечение передачи энергии электрону имеет приближённый вид \[ \frac{d\sigma}{d\omega}\propto \frac{1}{\omega^2}. \]

Поэтому вероятность большой передачи энергии ведёт себя как \[ P(\omega>W) \propto \int_W^{W_{\max}}\frac{d\omega}{\omega^2} \simeq \frac{1}{W}. \]

  • Хвост убывает медленно.
  • Сумма может определяться одним редким большим вкладом.

Распределение Ландау

В тонком слое потеря энергии описывается Ландау-подобным распределением: \[ p(\Delta)=\frac{1}{\xi} L\!\left(\frac{\Delta-\Delta_p}{\xi}\right). \]

Здесь \(\xi\) задаёт характерный масштаб потерь, а \(\Delta_p\) — наиболее вероятную потерю энергии.

Для частицы с зарядом \(z\) в слое толщины \(x\): \[ \xi=\frac{K}{2}\frac{Z}{A}\frac{z^2}{\beta^2}\rho x. \]

Форма распределения

Функция Ландау может быть задана интегрально: \[ L(\lambda) = \frac{1}{\pi} \int_0^{+\infty} \exp[-u\ln u-\lambda u]\sin(\pi u)\,du. \]

Её главный физический признак — длинный правый хвост: \[ L(\lambda)\sim \frac{1}{\lambda^2}, \qquad \lambda\to +\infty. \]

  • Наиболее вероятное значение конечно.
  • Среднее и дисперсия не определены.
  • Хвост задаётся редкими \(\delta\)-электронами.

Где здесь нарушается условие ЦПТ

Обычная ЦПТ требует, чтобы дисперсия одного вклада была конечной: \[ \mathrm{Var}(\omega)<\infty. \]

Но хвост вида \[ p(\omega)\propto \frac{1}{\omega^2} \]

даёт логарифмически расходящееся среднее в идеализированном пределе и расходящуюся дисперсию: \[ \int^\infty \omega^2\frac{d\omega}{\omega^2}=\infty. \]

  • Поэтому сумма не обязана стремиться к гауссу с нормировкой \(\sqrt n\).
  • Предельное распределение может быть устойчивым негассовым распределением.

Интерактив: распределение Ландау

Физические примеры

  • \(dE/dx\) в тонких кремниевых сенсорах.
  • Потери энергии в газовых трековых детекторах.
  • TPC: усечённое среднее используют именно для подавления длинного хвоста.
  • Калориметрические флуктуации с редкими большими локальными потерями.

Вывод

Распределение Ландау возникает потому, что сумма энергетических потерь не определяется суммой малых вкладов.

Редкая большая передача энергии может доминировать над наблюдаемой потерей энергии в тонком слое.

Важные замечания

  • Распределение Ландау — не точное распределение потери энергии в любом детекторе.

  • Это асимптотическая модель для тонкого слоя вещества, где полная потеря энергии складывается из многих независимых кулоновских столкновений, а спектр одиночных передач имеет длинный хвост \(\propto1/\varepsilon^2\).

  • Именно этот хвост делает распределение полной потери энергии асимметричным и негауссовым.

  • В реальном веществе хвост обрезан кинематикой и атомной структурой.

  • При более точном описании возникает распределение Вавилова, и в пределе большой толщины, снова гаусс.

Коррелированные слагаемые

Независимость переменных это не пустой звук

  • Для суммы \[ S_n=\sum_{i=1}^n X_i \]

  • дисперсия равна: \[ \mathrm{Var}(S_n) = \sum_i\sigma_i^2 + 2\sum_{i<j}\mathrm{cov}(X_i,X_j). \]

  • Если слагаемые независимы, то \[ \mathrm{cov}(X_i,X_j)=0. \]

  • Если нет — дисперсия может масштабироваться иначе.

Усреднение коррелированных величин

  • Пусть \[ \mathrm{Var}(X_i)=\sigma^2, \qquad \mathrm{corr}(X_i,X_j)=\rho \quad (i\ne j). \]

  • Для среднего \[ \langle X\rangle=\frac{1}{n}\sum_{i=1}^n X_i \] получаем \[ \begin{aligned} \mathrm{Var}(\langle X\rangle) &= \frac{1}{n^2}\left(\sum_i\sigma^2 + 2\sum_{i<j}\mathrm{cov}(X_i,X_j)\right)\\ &= \frac{1}{n^2}\left(n\sigma^2 + 2\frac{n(n-1)}{2}\rho\sigma^2\right)\\ &= \frac{\sigma^2}{n}\left[1+(n-1)\rho\right] \xrightarrow[n\to\infty]{} \rho\sigma^2. \end{aligned} \]

  • Коррелированная часть вариации остается в пределе \(n\to\infty\).

Коррелированная ошибка: общий сдвиг. Первый пример систематической ошибки

Пусть \[ X_i=\mu+C+\epsilon_i, \] где \[ C\sim \mathrm{N}(0,\sigma_C^2), \qquad \epsilon_i\sim \mathrm{N}(0,\sigma_\epsilon^2). \]

Тогда \[ \langle X\rangle=\mu+C+\frac{1}{n}\sum_i\epsilon_i. \]

Дисперсия среднего: \[ \boxed{\mathrm{Var}(\langle X\rangle)=\sigma_C^2+\frac{\sigma_\epsilon^2}{n}}. \]

Физические примеры:

  • общий сдвиг энергетической шкалы детектора;

  • общая ошибка калибровки усиления;

  • неопределённость световыхода или коэффициента пересчёта АЦП в энергию;

  • общая ошибка нормировки потока, светимости или активности источника;

  • общий дрейф температуры, давления, высокого напряжения или gain за время набора данных;

  • общий фон, нормировка которого известна с неопределённостью;

  • общий временной сдвиг в измерениях времени пролёта.

  • Во всех этих случаях увеличение числа измерений уменьшает только независимую часть ошибки. Общая систематическая составляющая не исчезает при усреднении.

Интерактив: коррелированная ошибка не исчезает

Смеси распределений

Сумма и смесь — разные вещи

  • Сумма: в каждом событии одновременно возникают оба вклада: \[ N=N_1+N_2. \]
  • Если независимы \[ N_1\sim\mathrm{Pois}(1000),\qquad N_2\sim\mathrm{Pois}(100). \]
  • то \[ N\sim\mathrm{Pois}(1100). \]
  • Смесь: каждое событие принадлежит только одному из нескольких классов.
  • Сумма описывает сложение вкладов внутри события; смесь — объединение разных типов событий в одной выборке.

Смесь: скрытый класс события

Пусть скрытая переменная \(\theta\) выбирает механизм: \[ \theta= \begin{cases} 1, & \text{первый класс},\\ 2, & \text{второй класс}. \end{cases} \]

  • Условно на класс: \[ N|\theta=1\sim\mathrm{Pois}(1000), \qquad N|\theta=2\sim\mathrm{Pois}(100). \]
  • Мы наблюдаем только \(N\), но не наблюдаем \(\theta\).
  • Внутри каждого класса распределение узкое, однако объединённая выборка может быть широкой или многопиковой.

Условный гаусс не означает безусловный гаусс

Пусть при фиксированном скрытом параметре \(\theta\) \[ X|\theta\sim \mathrm{N}(\mu_\theta,\sigma_\theta^2). \]

Если \(\theta\) не наблюдается, полная плотность равна \[ p(x)=\int p(\theta)\, \mathrm{N}(x;\mu_\theta,\sigma_\theta^2)\,d\theta. \]

Это смесь гауссовых распределений.

Дисперсия смеси: два источника разброса

По формуле полной дисперсии \[ \boxed{ \mathrm{Var}(X) = \mathbb{E}_\theta\!\left[\mathrm{Var}(X|\theta)\right] + \mathrm{Var}_\theta\!\left(\mathbb{E}[X|\theta]\right) } \]

Для условного гаусса: \[ \boxed{ \mathrm{Var}(X) = \mathbb{E}_\theta[\sigma_\theta^2] + \mathrm{Var}_\theta(\mu_\theta). } \]

  • Первый член — средняя ширина распределений внутри классов.
  • Второй член — разброс средних между классами.
  • Большая полная ширина может возникнуть из-за скрытой неоднородности выборки, а не из-за больших флуктуаций внутри каждого класса.

Численный пример: смесь двух пуассоновских классов

Пусть классы равновероятны: \[ N|\theta=1\sim\mathrm{Pois}(1000),\qquad N|\theta=2\sim\mathrm{Pois}(100). \]

  • Средняя внутриклассовая дисперсия: \[ \mathbb{E}_\theta[\mathrm{Var}(N|\theta)] =\frac{1000+100}{2}=550. \]
  • Разброс средних классов: \[ \mathrm{Var}_\theta(\mathbb{E}[N|\theta]) =\frac{(1000-550)^2+(100-550)^2}{2}=202500. \]
  • Полная дисперсия: \[ \mathrm{Var}(N)=550+202500=203050. \]

Вывод

Даже если каждый класс почти гауссов и узок, смесь классов может быть широкой, асимметричной или многопиковой.

Интерактив: смесь двух гауссов

Пример: жидкий сцинтиллятор

В жидком сцинтилляторе измеряемая величина может быть записана схематично как \[ Q=Q(E,\theta)+\text{фотонная статистика}+\text{электроника}, \] где \(\theta\) описывает скрытые детали события: \[ \theta=\{ \text{тип частицы}, \text{топология}, \text{позиция}, \text{вклад от Черенковского излучения}, \text{гашение}, \text{оптический путь} \}. \]

Один и тот же \(E\), разные события

Для \(\gamma\)-кванта энергия сначала передаётся вторичным электронам: \[ \gamma \to e_1+e_2+\dots+e_m. \]

Полная энергия может быть одинаковой, но световой выход нелинеен: \[ E_\gamma=\sum_{a=1}^m E_a. \] \[ Q\simeq \sum_a L(E_a), \qquad Q\ne C\sum_aE_a, \] где \(L(E)\) — нелинейная функция.

Следовательно, отклик зависит не только от \(E_\gamma\), но и от разложения энергии по вторичным частицам.

Отношение случайных величин

Отношение двух гауссовых величин

  • Пусть \[ X,Y\sim \mathrm{N}(0,1) \] независимы.

  • Тогда \[ R=\frac{X}{Y} \] имеет стандартное распределение Коши: \[ f_R(r)=\frac{1}{\pi(1+r^2)}. \]

Где это встречается

  • Отношение двух скоростей счёта.
  • Нормировка на контрольную область.
  • Поправка на эффективность.
  • Асимметрия вида \((N_1-N_2)/(N_1+N_2)\).
  • Восстановление величины через деление на малую или шумную оценку.

Интерактив: отношение гауссовых величин

Сводная карта причин

Когда гаусс не надо ожидать

Механизм Что нарушено Типичный симптом
Коши нет конечной дисперсии среднее не стабилизируется
тяжёлые хвосты медленная асимптотика редкие большие выбросы
доминирующий вклад нет малости вкладов хвост задаётся одним механизмом
корреляции нет независимости ошибка не падает как \(1/\sqrt n\)
смесь классов разные \(\mu_\theta,\sigma_\theta\) асимметрия, хвосты, два пика
нелинейность не сумма, а \(f(X)\) асимметрия, границы

Практический алгоритм

  • Сначала спросить: какая случайная величина реально суммируется?
  • Проверить: независимы ли вклады?
  • Проверить: конечна ли дисперсия и нет ли тяжёлых хвостов?
  • Проверить: нет ли скрытых классов событий?
  • Проверить: не применяем ли мы нелинейное преобразование?
  • Если сомневаемся — строить функцию правдоподобия или Monte Carlo, чтобы узнать вид распределения, а не предполагать всегда гауссовое.