Мотивация и обзор курса

Статистический анализ данных

Дмитрий В. Наумов (ОИЯИ)

О чем этот курс

О чем этот курс

  • В этому курсе мы разберем ключевые концепции, приемы и язык, на котором физики обсуждают результаты:
    • Я обнаружил сигнал со значимостью 5 \(\sigma\)!
    • Мы наблюдаем избыток событий в данных.
    • Значимого избытка событий не наблюдается.
    • Мы исключаем эту область параметров на уровне 95% C.L.
    • Мы устанавливаем верхний предел на сечение.
    • Фит хорошо сошелся.
    • Доминирующая неопределенность является систематической.
    • Корреляции между бинами важны.
    • Эти nuisance-параметры были профилированы в фите.
    • Нужно использовать полную ковариационную матрицу.

Зачем нам статистика в физике?

Четыре основных шага

  • Теория:
    • Эффект закодирован в \(\mathbf{t}\).
    • Пример: число бозонов Хиггса, рожденных на LHC.
  • Эксперимент:
    • Поиск эффекта. Наблюдаемое значение: \(\mathbf{d}\).
  • Статистический анализ:
    • Сравниваем ожидание модели \(\mathbf{t}\) с наблюдением \(\mathbf{d}\).
    • Делаем вывод:
      • теория подтверждается, это экспериментальное открытие.
      • теория опровергается, область параметров исключается.
  • Пишем статью.

Обозначения

  • Скалярные величины обозначаются курсивом: \(x\), \(y\), \(\theta\)

  • Векторы обозначаются полужирным шрифтом: \(\mathbf{x}=(x_1,x_2,\dots,x_n)\)

  • Матрицы обозначаются полужирными заглавными буквами: \(\mathbf{V}\), \(\mathbf{M}\)

  • Случайные величины обозначаются заглавными буквами: \(X\), \(Y\)

  • Их наблюденные значения обозначаются строчными буквами: \(x\), \(y\)

  • Вероятность события \(A\) обозначается как \(P(A)\)

  • Функция плотности вероятности обозначается как \(f(x)\) или \(p(x)\)

  • Параметры модели обозначаются через \(\theta\)

  • Оценки параметров обозначаются через \(\widehat{\theta}\)

  • Математическое ожидание: \(\mathbb{E}[X]\)

  • Дисперсия: \(\mathrm{Var}(X)\)

  • Стандартное отклонение: \(\sigma_X=\sqrt{\mathrm{Var}(X)}\)

  • Ковариация: \(\mathrm{cov}(X,Y)\)

  • Коэффициент корреляции: \(\rho(X,Y)\)

Частотный и байесовский подходы

Есть два основных подхода к интерпретации вероятности.

  • Относительная частота
    \(A\), \(B\), … — исходы повторяемого эксперимента.

    \[ P(A)=\lim\limits_{n\to\infty}\frac{\text{число наблюдений исхода }A}{n} \]

  • Байесовская вероятность
    \(A\) — утверждение или гипотеза, \(B\) — наблюдённые данные.

    \[ P(A\mid B)=\frac{P(B\mid A)\,P(A)}{P(B)} \]

  • В этом курсе основной акцент — частотная статистика.

Визуальное доказательство теоремы Байеса

Иллюстрация теоремы Байеса

Литература

Статистика в реальных физических результатах

Открытие бозона Хиггса

  • Что такое
    • \(p\)-value?
    • \(\sigma\)?

Daya Bay: открытие ненулевого \(\theta_{13}\)

Опубликовано в: Phys.Rev.Lett. 108 (2012) 171803

  • Что такое осцилляционный фит?
  • Что такое значение best fit?
  • Что такое статистическая значимость фита?

Daya Bay: исключение стерильных нейтрино

Опубликовано в: Phys.Rev.Lett. 133 (2024) 5, 051801

  • Что здесь исключено?
  • Почему это исключение обосновано?
  • Что такое “FC sensitivity”?
  • Что такое CL\(_s\)?

Что скрыто в этих графиках

  • случайные флуктуации
  • распределения вероятности
  • правдоподобие и \(\chi^2\)
  • best fit
  • доверительные интервалы и контуры
  • значимость и \(p\)-value
  • систематические неопределенности
  • nuisance-параметры
  • профилирование
  • верхние пределы и исключения

Если пока не все из этого понятно, этот курс для вас

Программа курса

Что мы изучим?

  • Вероятность, теорема Байеса
  • Случайные величины и плотности вероятности
  • Математическое ожидание, распространение ошибок
  • Различные распределения вероятности
  • Метод Монте-Карло
  • Статистические тесты: общие понятия
  • Статистики тестов, многомерные методы
  • Тесты goodness-of-fit: p-value, значимость, открытие и исключение
  • Методы Фельдмана-Казинса, CL\(_s\) и другие методы
  • Оценка параметров, метод максимального правдоподобия
  • Метод наименьших квадратов
  • Интервальные оценки, установление ограничений
  • Nuisance-параметры, систематические неопределенности
  • Примеры байесовского подхода

Первый пример: фит гауссианы

Игрушечный пример: определение ширины гауссианы

  • Предположим, что данные имеют гауссову форму \[ y(x)=\exp\!\left(-\frac{x^2}{2\sigma^2}\right), \] с известным центром \(x_0=0\) и нормировкой \(N=1\) и неизвестной шириной \(\sigma\).

  • Ваша задача: найти \(\sigma\), сравнив модель с данными.

  • Для каждого выбранного значения \(\sigma\) вычисляется \[ \chi^2(\sigma)=\sum_i \frac{[y_i-y(x_i;\sigma)]^2}{\delta y_i^2}. \]

  • Значение \(\sigma\), соответствующее best fit, минимизирует \(\chi^2\).

Псевдоданные и фит