Задачи: мотивация и обзор курса

Мотивация и обзор курса

Author

Дмитрий В. Наумов (ОИЯИ)

← Вернуться к курсу

Задачи

Задача 1. Модель и данные

В некотором эксперименте теория предсказывает число событий

\[ \mathbf{t}=(10,\ 20,\ 10). \]

Эксперимент дал результат

\[ \mathbf{d}=(12,\ 18,\ 11). \]

Ответьте:

  1. Что здесь является предсказанием модели?
  2. Что является наблюдёнными данными?
  3. В каких бинах данные больше предсказания?
  4. В каких бинах данные меньше предсказания?
  5. Можно ли по этим числам сразу сказать, что теория неверна?

Задача 2. Случайная величина и наблюдённое значение

До измерения результат эксперимента неизвестен. Обозначим его случайной величиной \(X\).

После измерения получено значение

\[ x=7.3. \]

Ответьте:

  1. Что обозначает \(X\)?
  2. Что обозначает \(x\)?
  3. Почему до измерения мы говорим о \(X\), а после измерения — о \(x\)?
  4. Приведите свой пример случайной величины и её наблюдённого значения.

Задача 3. Частота как оценка вероятности

Детектор зарегистрировал 100 событий. Из них 23 события прошли отбор.

Ответьте:

  1. Какую долю событий отобрал алгоритм?
  2. Как по этим данным оценить вероятность того, что следующее событие пройдёт отбор?
  3. Будет ли эта оценка точно равна истинной вероятности?
  4. Что изменится, если вместо 100 событий было бы зарегистрировано 10 000 событий?

Задача 4. Условная вероятность без формул

В выборке есть 1000 событий:

  • 100 сигнальных событий;
  • 900 фоновых событий.

Алгоритм помечает событие как «интересное». Он пометил:

  • 80 сигнальных событий;
  • 90 фоновых событий.

Ответьте:

  1. Сколько всего событий помечено как «интересные»?
  2. Какая доля сигнальных событий была помечена?
  3. Какая доля помеченных событий действительно является сигналом?
  4. Почему это разные числа?
  5. Что важнее для утверждения «мы нашли сигнал»: доля помеченных сигнальных событий или доля сигнала среди помеченных событий?

Задача 5. Первый смысл best fit

Одна и та же форма кривой сравнивается с данными при разных значениях параметра \(\sigma\).

Получены такие значения меры расхождения:

\(\sigma\) расхождение
0.6 18.4
0.8 7.2
1.0 2.1
1.2 3.5
1.4 9.8

Ответьте:

  1. При каком значении \(\sigma\) модель лучше всего согласуется с данными?
  2. Почему это значение называется best fit?
  3. Значит ли это, что истинное значение \(\sigma\) точно равно найденному?
  4. Что нужно знать дополнительно, чтобы говорить об ошибке найденного значения?

Задача 6. Флуктуация или систематический сдвиг?

Ожидаемое число событий в каждом запуске равно примерно 100.

В первом случае получены результаты:

\[ 98,\quad 103,\quad 99,\quad 101,\quad 100. \]

Во втором случае получены результаты:

\[ 113,\quad 111,\quad 115,\quad 112,\quad 114. \]

Ответьте:

  1. В каком случае данные выглядят как случайные флуктуации около 100?
  2. В каком случае виден возможный систематический сдвиг?
  3. Почему отдельное значение 103 не выглядит подозрительным?
  4. Почему последовательность значений около 113 уже выглядит подозрительной?
  5. Что следовало бы проверить в эксперименте во втором случае?