---
title: Теория вероятностей и статистическое оценивание
questionDates:
  q-transfer-0070: '2026-10-01'
seo:
  description: >-
    Тема «Теория вероятностей и статистическое оценивание» для собеседования
    Data Scientist. Если в комнате находится 3 человека, какова вероятность
    того, что по крайней мере двое из них будут одного пола? Где и как
    применяется Bootstrap?
  title: Теория вероятностей и статистическое оценивание — Data Scientist
---

[Все темы Data Scientist](/prep/data-scientist)

Подтемы:

- [Теория вероятности](#q-14bee738d69b81dc8065dad3523f2417)
- [Статистические распределения](#q-14bee738d69b814c9976c83ad4b2b809)
- [Теория оценок](#q-transfer-0070)
- [Метод максимального правдоподобия](#q-14bee738d69b8148a4cfec83f3258d88)
- [Центральная предельная теорема](#q-14bee738d69b815399abf5125653e6d7)
- [Доверительные интервалы](#q-14bee738d69b813c998fc1ed30d449ac)
- [Bootstrap](#q-14bee738d69b81daa711f48d549fdab1)

## <strong>Если в комнате находится 3 человека, какова вероятность того, что по крайней мере двое из них будут одного пола?</strong> [#q-14bee738d69b81dc8065dad3523f2417]

Если в модели задачи допускаются только две категории пола, среди трёх человек хотя бы двое неизбежно относятся к одной категории. Вероятность равна 1 по принципу Дирихле. Ниже рассмотрим другое событие&#58; в комнате представлены обе категории.

<strong>Пусть&#58;</strong>

- <InlineMath tex={"P(M)"} /> - вероятность того, что человек мужского пола

- <InlineMath tex={"P(F)"} /> - вероятность того, что человек женского пола

<strong>Тогда&#58;</strong>

- Вероятность того, что все три человека будут мужчинами&#58; <InlineMath tex={"P(M) _ P(M) _ P(M)"} />

- Вероятность того, что все три человека будут женщинами&#58; <InlineMath tex={"P(F) _ P(F) _ P(F)"} />

Вероятность того, что в комнате представлены обе категории, при независимом выборе равна&#58;

1 - (Вероятность всех мужчин + Вероятность всех женщин)

Это вероятность смешанной группы, а не ответ исходной задачи. Для исходного вопроса при двух категориях ответ всегда 1.

:::note[Ссылки для изучения]

1. [Принцип Дирихле: больше объектов, чем категорий](https://old.mccme.ru/free-books/prasolov/planim/gl21.htm)
   :::

---

## Как справедливо выбрать между А и Б с помощью монеты с неизвестным смещением вероятностей? [#q-14bee738d69b81d2b45aff0873c78580]

Если обе стороны монеты имеют разную вероятность выпадения, то можно использовать следующую стратегию для получения справедливого результата&#58;

1. Бросайте монету дважды. Пусть вероятность орла постоянна, броски независимы и 0 \< p \< 1.

1. Орёл-решка означает победу А, решка-орёл означает победу Б. При двух одинаковых результатах повторите пару бросков.

1. Вероятности орёл-решка и решка-орёл равны p(1 − p), поэтому оба игрока имеют одинаковые шансы.

Это метод фон Неймана. При p = 0 или p = 1 он не завершится; независимость и постоянство вероятности существенны.

:::note[Ссылки для изучения]

1. [Смещённая монета: трюк фон Неймана и независимость бросков](https://anton-petrunin.github.io/benders/benders.pdf)
   :::

---

## Из 100 монет одна с двумя орлами. Случайно выбранная монета выпала орлом. Какова вероятность, что она фальшивая? [#q-14bee738d69b8157adf1c70a39d2ce97]

Чтобы решить эту задачу, мы можем использовать формулу условной вероятности. Пусть&#58;

- <InlineMath tex={"A"} /> - событие, что выбранная монета фальшивая.

- <InlineMath tex={"B"} /> - событие, что выбранная монета выпадает орлом вверх.

Тогда мы хотим найти вероятность события A при условии события B, то есть <InlineMath tex={"P(A|B)"} />.

Используем формулу условной вероятности&#58;

<InlineMath tex={"P(A∣B)="} /> <InlineMath tex={"\\frac {P(A∩B)}{P(B)}"} />

Теперь оценим вероятности&#58;

- P<InlineMath tex={"(A)= \\frac{1}{100}"} />, так как в мешке 100 монет, и только одна из них фальшивая.

- <InlineMath tex={"P(B∣A)=1"} />, так как фальшивая монета всегда выпадает
  орлом вверх.

- <InlineMath tex={"P(B)"} /> - это вероятность того, что монета выпадет орлом
  вверх. Так как у нас есть только одна фальшивая монета, а мы знаем, что она
  выпадает орлом вверх, то
  <InlineMath
    tex={
      "P(B)=P(B∣A)⋅P(A)+P(B∣\\hat{A})⋅P(\\hat{A}) = 1⋅\\frac{1}{100}+ \\frac{1}{2}⋅ \\frac{99}{100}."
    }
  />

Теперь можем найти <InlineMath tex={"P(A∣B)"} />&#58;

<InlineMath
  tex={
    "P(A∣B)= \\frac{1 \\cdot \\frac{1}{100}}{1 \\cdot \\frac{1}{100} + \\frac{1}{2} \\cdot \\frac{99}{100}}"
  }
/>

Вычислив это выражение, мы получим вероятность того, что выбранная монета является фальшивой, при условии, что она выпала орлом вверх.

:::note[Ссылки для изучения]

1. [Формула Байеса: вероятность гипотезы после наблюдения](https://math.nsc.ru/LBRT/v1/OldDepartmentSite/chernova/tv/tv_nsu07.pdf)
   :::

---

## <strong>Расскажите как работает закон больших чисел. (ЗБЧ)</strong> [#q-14bee738d69b81e4980ecc23304a0e7b]

Закон больших чисел - это математическая теорема, утверждающая, что с увеличением числа испытаний среднее значение случайной величины стабилизируется и приближается к математическому ожиданию этой случайной величины. Другими словами, чем больше испытаний, тем ближе среднее значение к ожидаемому значению.

:::note[Ссылки для изучения]

1. [Закон больших чисел](https://habr.com/ru/articles/762540/)
   :::

---

## <strong>Какие типы распределений чаще всего используются в практике?</strong> [#q-14bee738d69b814c9976c83ad4b2b809]

В практике наиболее часто используются следующие типы распределений&#58;

1. Нормальное распределение (гауссовское)&#58; широко применяется в статистике из-за центральной предельной теоремы и подходит для моделирования многих естественных явлений.

1. Равномерное распределение&#58; все значения в интервале имеют одинаковую вероятность, часто используется в случайных экспериментах.

1. Биномиальное распределение&#58; описывает количество успехов в серии независимых и одинаково распределенных испытаний.

1. Экспоненциальное распределение&#58; используется для моделирования времени между двумя последовательными событиями в процессе Пуассона.

1. Пуассоновское распределение&#58; описывает количество событий, произошедших за фиксированный период времени или в фиксированном объеме пространства, при условии, что эти события происходят с фиксированной средней интенсивностью и независимо друг от друга.

:::note[Ссылки для изучения]

1. [Стандартные распределения: Бернулли, биномиальное, Пуассон, равномерное, экспоненциальное и нормальное](https://math.nsc.ru/LBRT/v1/OldDepartmentSite/chernova/tv/tv_nsu07.pdf)
   :::

---

## Чем различаются распределения Бернулли и биномиальное, их математические ожидания и дисперсии? [#q-14bee738d69b81bbbdafcd6a5a9bd4c3]

Распределение Бернулли является частным случаем биномиального распределения, где проводится только одно испытание. Оно описывает случайную переменную, которая принимает только два значения&#58; успех (обычно обозначается как 1) и неудачу (обычно обозначается как 0).

Интерпретация распределения Бернулли - это модель случайного эксперимента с двумя возможными исходами, где вероятность успеха (обычно обозначается как <InlineMath tex={"p"} />) и вероятность неудачи <InlineMath tex={"(1 - p)"} /> известны.

Математическое ожидание для распределения Бернулли равно вероятности успеха <InlineMath tex={"(p)"} />, а дисперсия равна <InlineMath tex={"p \* (1 - p)"} />.

Биномиальное распределение расширяет концепцию распределения Бернулли на случай проведения нескольких независимых испытаний, где вероятность успеха <InlineMath tex={"(p)"} /> остается <code>const</code>. Оно описывает количество успехов в серии независимых и одинаково распределенных испытаний.

Интерпретация биномиального распределения - это вероятность получить <InlineMath tex={"k"} /> успехов в <InlineMath tex={"n"} /> испытаниях, где вероятность успеха <InlineMath tex={"(p)"} /> остается постоянной для всех испытаний.

Математическое ожидание для биномиального распределения равно <InlineMath tex={"n _ p"} />, а дисперсия равна <InlineMath tex={"n _ p \* (1 - p)"} />.

:::note[Ссылки для изучения]

1. [Бернулли и биномиальное: определения, ожидания и дисперсии](https://math.nsc.ru/LBRT/v1/OldDepartmentSite/chernova/tv/tv_nsu07.pdf)
   :::

---

## <strong>Как проверить, что распределение нормальное?</strong> [#q-14bee738d69b81aca44fc5a5b72d3e19]

Для проверки нормальности распределения можно использовать статистические тесты, такие как тесты Колмогорова-Смирнова, Шапиро-Уилка, или анализ квантилей <code>&#40;Q&#45;Q plot&#41;</code>. В кратком варианте&#58;

1. <strong>Тест Колмогорова-Смирнова</strong>&#58; Проверяет, насколько хорошо
   ваше распределение соответствует нормальному распределению. Если p-value
   низкое (обычно меньше 0.05), то это говорит о том, что распределение значимо
   отличается от нормального.

1. <strong>Тест Шапиро-Уилка</strong>&#58; Этот тест также проверяет
   нормальность данных. Если p-value меньше выбранного уровня значимости, то
   гипотеза о нормальности отвергается.

1. <strong>Q-Q plot</strong>&#58; Этот график сравнивает квантили вашего
   распределения с квантилями нормального распределения. Если точки на графике
   лежат примерно на прямой линии, то распределение близко к нормальному. Если
   они значительно отклоняются, то распределение отличается от нормального.

Большое p-value означает, что тест не обнаружил достаточных оснований отвергнуть нормальность при своём размере выборки. Оно не доказывает нормальность. Q-Q plot служит визуальной диагностикой и не имеет p-value.

:::note[Ссылки для изучения]

1. [Нормальность: Шапиро—Уилк, размер выборки и визуальная диагностика](https://pozdniakov.github.io/tidy_stats/320-ttest.html)
   :::

---

## Чем MAP-оценка отличается от максимального правдоподобия? [#q-transfer-0070]

MLE выбирает параметры, максимизирующие likelihood наблюдаемых данных. MAP максимизирует posterior: `p(theta|data)` пропорционален `p(data|theta) * p(theta)`, поэтому учитывает prior. При плоском prior MAP совпадает с MLE в допустимой области. В log-шкале отрицательный log-prior становится регуляризатором: Gaussian prior соответствует L2, Laplace prior связан с L1. MAP дает точечную оценку и не заменяет полный Bayesian posterior или учет неопределенности параметров.

:::note[Ссылки для изучения]

1. [MAP и MLE: априорное знание, апостериорный максимум и связь с регуляризацией](https://contest.yandex.ru/tracks/ml/probabilistic-models/bayesian-estimation#ocenka-aposteriornogo-maksimuma-map)
   :::

---

## Что такое метод максимального правдоподобия? [#q-14bee738d69b8148a4cfec83f3258d88]

<span id="q-14bee738d69b81d5bdf3f3a9b72d3e4f"></span>

Метод максимального правдоподобия оценивает параметры модели, выбирая значение $\hat\theta$, при котором наблюдённые данные имеют наибольшее правдоподобие:

$$
\hat\theta = \arg\max_\theta L(\theta; x) = \arg\max_\theta \prod_i p(x_i \mid \theta).
$$

На практике обычно максимизируют логарифм правдоподобия: сумма логарифмов проще произведения и имеет тот же максимум. Правдоподобие рассматривают как функцию параметров при фиксированных данных; это не вероятность того, что параметр истинен.

:::note[Ссылки для изучения]

1. [Метод максимального правдоподобия и log-likelihood: определение и примеры](https://contest.yandex.ru/tracks/ml/mathematical-foundations/parametric-estimation#metod-maksimalnogo-pravdopodbiya)
   :::

---

## В чём смысл центральной предельной теоремы? [#q-14bee738d69b815399abf5125653e6d7]

<span id="q-14bee738d69b81bda7c3eb34f8210fdd"></span>

Для независимых одинаково распределённых случайных величин с конечными средним $\mu$ и дисперсией $\sigma^2$ стандартизированное выборочное среднее сходится по распределению к стандартному нормальному закону:

$$
\frac{\sqrt n(\bar X_n-\mu)}{\sigma} \xrightarrow{d} N(0,1).
$$

Поэтому при достаточно большом $n$ среднее примерно распределено как $N(\mu, \sigma^2/n)$, даже если исходное распределение не нормальное. Теорема не утверждает, что сами наблюдения становятся нормальными, а качество приближения зависит от исходного распределения.

:::note[Ссылки для изучения]

1. [ЦПТ: условия, нормирование среднего и смысл нормального приближения](https://books.econ.msu.ru/Introduction-to-Econometrics/chap06/6.1/)
   :::

---

## <strong>Как вычисляются доверительные интервалы?</strong> [#q-14bee738d69b813c998fc1ed30d449ac]

Доверительный интервал строят по выборке для неизвестного параметра. Уровень 95% означает, что при повторении процедуры около 95% построенных интервалов накрывают истинный параметр. Для среднего при подходящих предположениях используют выборочное среднее плюс-минус критическое значение, умноженное на стандартную ошибку. Это свойство процедуры, а не вероятность положения фиксированного параметра в уже вычисленном интервале.

:::note[Ссылки для изучения]

1. [Доверительный интервал среднего: стандартная ошибка и частотное покрытие](https://pozdniakov.github.io/tidy_stats/310-infer_stats.html)
   :::

---

## <strong>Где и как применяется Bootstrap?</strong> [#q-14bee738d69b81daa711f48d549fdab1]

Bootstrap применяется в статистике для оценки доверительных интервалов и стандартных ошибок параметров путем многократного выбора выборок из имеющихся данных с заменой. Этот метод позволяет оценить распределение выборочной статистики и провести статистические выводы о параметрах генеральной совокупности. Bootstrap широко используется в анализе данных, машинном обучении и других областях, где требуется оценка неопределенности и статистическая проверка гипотез.

:::note[Ссылки для изучения]

1. [Bootstrap в статистике](https://habr.com/ru/companies/X5Tech/articles/679842/)
   :::
