Задачи: мотивация и обзор курса

Статистический анализ данных

Author

Дмитрий В. Наумов

← Вернуться к курсу

Задачи

Задача 1. Модель и данные

В некотором эксперименте теория предсказывает число событий

\[ \mathbf{t}=(10,\ 20,\ 10). \]

Эксперимент дал результат

\[ \mathbf{d}=(12,\ 18,\ 11). \]

Ответьте:

  1. Что здесь является предсказанием модели?
  2. Что является данными эксперимента?
  3. В каких бинах данные больше предсказания?
  4. В каких бинах данные меньше предсказания?
  5. Можно ли по этим числам сразу сказать, что теория неверна?

Задача 2. Случайная величина и измеренное значение

До измерения результат эксперимента неизвестен. Обозначим его случайной величиной \(X\).

После измерения получено значение

\[ x=7.3. \]

Ответьте:

  1. Что обозначает \(X\)?
  2. Что обозначает \(x\)?
  3. Почему до измерения мы говорим о \(X\), а после измерения — о \(x\)?
  4. Приведите свой пример случайной величины и её измеренного значения.

Задача 3. Частота как оценка вероятности

Детектор зарегистрировал 100 событий. Из них 23 события прошли отбор.

Ответьте:

  1. Какую долю событий отобрал алгоритм?
  2. Как по этим данным оценить вероятность того, что следующее событие пройдёт отбор?
  3. Будет ли эта оценка точно равна истинной вероятности?
  4. Что изменится, если вместо 100 событий было бы зарегистрировано 10 000 событий?

Задача 4. Условная вероятность без формул

В выборке есть 1000 событий:

  • 100 сигнальных событий;
  • 900 фоновых событий.

Алгоритм помечает событие как «интересное». Он пометил:

  • 80 сигнальных событий;
  • 90 фоновых событий.

Ответьте:

  1. Сколько всего событий помечено как «интересные»?
  2. Какая доля сигнальных событий была помечена?
  3. Какая доля помеченных событий действительно является сигналом?
  4. Почему это разные числа?
  5. Что важнее для утверждения «мы нашли сигнал»: доля помеченных сигнальных событий или доля сигнала среди помеченных событий?

Задача 5. Точка наилучшего согласия

Одна и та же форма кривой сравнивается с данными при разных значениях параметра \(\sigma\).

Получены такие значения меры расхождения:

\(\sigma\) расхождение
0.6 18.4
0.8 7.2
1.0 2.1
1.2 3.5
1.4 9.8

Ответьте:

  1. При каком значении \(\sigma\) модель лучше всего согласуется с данными?
  2. Почему это значение называется точкой наилучшего согласия?
  3. Значит ли это, что истинное значение \(\sigma\) точно равно найденному?
  4. Что нужно знать дополнительно, чтобы говорить об ошибке найденного значения?

Задача 6. Флуктуация или систематический сдвиг?

Ожидаемое число событий в каждом запуске равно примерно 100.

В первом случае получены результаты:

\[ 98,\quad 103,\quad 99,\quad 101,\quad 100. \]

Во втором случае получены результаты:

\[ 113,\quad 111,\quad 115,\quad 112,\quad 114. \]

Ответьте:

  1. В каком случае данные выглядят как случайные флуктуации около 100?
  2. В каком случае виден возможный систематический сдвиг?
  3. Почему отдельное значение 103 не выглядит подозрительным?
  4. Почему последовательность значений около 113 уже выглядит подозрительной?
  5. Что следовало бы проверить в эксперименте во втором случае?

Задача 7. Следы априорного распределения

Пусть измерения \(x_i\) независимы и имеют гауссовское распределение

\[ x_i\mid\theta\sim\mathcal N(\theta,1). \]

Рассмотрите выборку со средним \(\bar x=1\) сначала при \(n=1\), а затем при \(n=100\). Сравните три априорных распределения:

\[ \pi_1(\theta)\propto 1, \qquad \pi_2(\theta)\propto \exp\!\left(-\frac{\theta^2}{2}\right), \qquad \pi_3(\theta)\propto \frac{1}{1+\theta^2}. \]

Для каждого случая постройте функцию

\[ p(\theta\mid x_1,\ldots,x_n) \propto \pi_k(\theta) \exp\!\left[-\frac{n(\theta-\bar x)^2}{2}\right]. \]

Ответьте:

  1. Насколько различаются три результата после одного измерения?
  2. Что меняется после ста измерений?
  3. При каком условии влияние априорного распределения становится малым?
  4. Что произойдёт, если оно равно нулю в окрестности \(\bar x\)?
  5. Устраняет ли накопление данных вопрос о выборе самого первого априорного распределения?