Задачи: мотивация и обзор курса
Мотивация и обзор курса
Задачи
Задача 1. Модель и данные
В некотором эксперименте теория предсказывает число событий
\[ \mathbf{t}=(10,\ 20,\ 10). \]
Эксперимент дал результат
\[ \mathbf{d}=(12,\ 18,\ 11). \]
Ответьте:
- Что здесь является предсказанием модели?
- Что является наблюдёнными данными?
- В каких бинах данные больше предсказания?
- В каких бинах данные меньше предсказания?
- Можно ли по этим числам сразу сказать, что теория неверна?
Задача 2. Случайная величина и наблюдённое значение
До измерения результат эксперимента неизвестен. Обозначим его случайной величиной \(X\).
После измерения получено значение
\[ x=7.3. \]
Ответьте:
- Что обозначает \(X\)?
- Что обозначает \(x\)?
- Почему до измерения мы говорим о \(X\), а после измерения — о \(x\)?
- Приведите свой пример случайной величины и её наблюдённого значения.
Задача 3. Частота как оценка вероятности
Детектор зарегистрировал 100 событий. Из них 23 события прошли отбор.
Ответьте:
- Какую долю событий отобрал алгоритм?
- Как по этим данным оценить вероятность того, что следующее событие пройдёт отбор?
- Будет ли эта оценка точно равна истинной вероятности?
- Что изменится, если вместо 100 событий было бы зарегистрировано 10 000 событий?
Задача 4. Условная вероятность без формул
В выборке есть 1000 событий:
- 100 сигнальных событий;
- 900 фоновых событий.
Алгоритм помечает событие как «интересное». Он пометил:
- 80 сигнальных событий;
- 90 фоновых событий.
Ответьте:
- Сколько всего событий помечено как «интересные»?
- Какая доля сигнальных событий была помечена?
- Какая доля помеченных событий действительно является сигналом?
- Почему это разные числа?
- Что важнее для утверждения «мы нашли сигнал»: доля помеченных сигнальных событий или доля сигнала среди помеченных событий?
Задача 5. Первый смысл best fit
Одна и та же форма кривой сравнивается с данными при разных значениях параметра \(\sigma\).
Получены такие значения меры расхождения:
| \(\sigma\) | расхождение |
|---|---|
| 0.6 | 18.4 |
| 0.8 | 7.2 |
| 1.0 | 2.1 |
| 1.2 | 3.5 |
| 1.4 | 9.8 |
Ответьте:
- При каком значении \(\sigma\) модель лучше всего согласуется с данными?
- Почему это значение называется best fit?
- Значит ли это, что истинное значение \(\sigma\) точно равно найденному?
- Что нужно знать дополнительно, чтобы говорить об ошибке найденного значения?
Задача 6. Флуктуация или систематический сдвиг?
Ожидаемое число событий в каждом запуске равно примерно 100.
В первом случае получены результаты:
\[ 98,\quad 103,\quad 99,\quad 101,\quad 100. \]
Во втором случае получены результаты:
\[ 113,\quad 111,\quad 115,\quad 112,\quad 114. \]
Ответьте:
- В каком случае данные выглядят как случайные флуктуации около 100?
- В каком случае виден возможный систематический сдвиг?
- Почему отдельное значение 103 не выглядит подозрительным?
- Почему последовательность значений около 113 уже выглядит подозрительной?
- Что следовало бы проверить в эксперименте во втором случае?