Задачи: мотивация и обзор курса
Статистический анализ данных
Задачи
Задача 1. Модель и данные
В некотором эксперименте теория предсказывает число событий
\[ \mathbf{t}=(10,\ 20,\ 10). \]
Эксперимент дал результат
\[ \mathbf{d}=(12,\ 18,\ 11). \]
Ответьте:
- Что здесь является предсказанием модели?
- Что является данными эксперимента?
- В каких бинах данные больше предсказания?
- В каких бинах данные меньше предсказания?
- Можно ли по этим числам сразу сказать, что теория неверна?
Задача 2. Случайная величина и измеренное значение
До измерения результат эксперимента неизвестен. Обозначим его случайной величиной \(X\).
После измерения получено значение
\[ x=7.3. \]
Ответьте:
- Что обозначает \(X\)?
- Что обозначает \(x\)?
- Почему до измерения мы говорим о \(X\), а после измерения — о \(x\)?
- Приведите свой пример случайной величины и её измеренного значения.
Задача 3. Частота как оценка вероятности
Детектор зарегистрировал 100 событий. Из них 23 события прошли отбор.
Ответьте:
- Какую долю событий отобрал алгоритм?
- Как по этим данным оценить вероятность того, что следующее событие пройдёт отбор?
- Будет ли эта оценка точно равна истинной вероятности?
- Что изменится, если вместо 100 событий было бы зарегистрировано 10 000 событий?
Задача 4. Условная вероятность без формул
В выборке есть 1000 событий:
- 100 сигнальных событий;
- 900 фоновых событий.
Алгоритм помечает событие как «интересное». Он пометил:
- 80 сигнальных событий;
- 90 фоновых событий.
Ответьте:
- Сколько всего событий помечено как «интересные»?
- Какая доля сигнальных событий была помечена?
- Какая доля помеченных событий действительно является сигналом?
- Почему это разные числа?
- Что важнее для утверждения «мы нашли сигнал»: доля помеченных сигнальных событий или доля сигнала среди помеченных событий?
Задача 5. Точка наилучшего согласия
Одна и та же форма кривой сравнивается с данными при разных значениях параметра \(\sigma\).
Получены такие значения меры расхождения:
| \(\sigma\) | расхождение |
|---|---|
| 0.6 | 18.4 |
| 0.8 | 7.2 |
| 1.0 | 2.1 |
| 1.2 | 3.5 |
| 1.4 | 9.8 |
Ответьте:
- При каком значении \(\sigma\) модель лучше всего согласуется с данными?
- Почему это значение называется точкой наилучшего согласия?
- Значит ли это, что истинное значение \(\sigma\) точно равно найденному?
- Что нужно знать дополнительно, чтобы говорить об ошибке найденного значения?
Задача 6. Флуктуация или систематический сдвиг?
Ожидаемое число событий в каждом запуске равно примерно 100.
В первом случае получены результаты:
\[ 98,\quad 103,\quad 99,\quad 101,\quad 100. \]
Во втором случае получены результаты:
\[ 113,\quad 111,\quad 115,\quad 112,\quad 114. \]
Ответьте:
- В каком случае данные выглядят как случайные флуктуации около 100?
- В каком случае виден возможный систематический сдвиг?
- Почему отдельное значение 103 не выглядит подозрительным?
- Почему последовательность значений около 113 уже выглядит подозрительной?
- Что следовало бы проверить в эксперименте во втором случае?
Задача 7. Следы априорного распределения
Пусть измерения \(x_i\) независимы и имеют гауссовское распределение
\[ x_i\mid\theta\sim\mathcal N(\theta,1). \]
Рассмотрите выборку со средним \(\bar x=1\) сначала при \(n=1\), а затем при \(n=100\). Сравните три априорных распределения:
\[ \pi_1(\theta)\propto 1, \qquad \pi_2(\theta)\propto \exp\!\left(-\frac{\theta^2}{2}\right), \qquad \pi_3(\theta)\propto \frac{1}{1+\theta^2}. \]
Для каждого случая постройте функцию
\[ p(\theta\mid x_1,\ldots,x_n) \propto \pi_k(\theta) \exp\!\left[-\frac{n(\theta-\bar x)^2}{2}\right]. \]
Ответьте:
- Насколько различаются три результата после одного измерения?
- Что меняется после ста измерений?
- При каком условии влияние априорного распределения становится малым?
- Что произойдёт, если оно равно нулю в окрестности \(\bar x\)?
- Устраняет ли накопление данных вопрос о выборе самого первого априорного распределения?