---
title: Статистические распределения
seo:
  title: Статистические распределения — Data Scientist
  description: "Тема «Статистические распределения» для собеседования Data Scientist. Какие типы распределений чаще всего используются в практике? Чем различаются распределения Бернулли и биномиальное, их математические ожидания и дисперсии?"
---

[Все темы Data Scientist](/data-scientist)

## <strong>Какие типы распределений чаще всего используются в практике?</strong> [#q-14bee738d69b814c9976c83ad4b2b809]

В практике наиболее часто используются следующие типы распределений&#58;

1. Нормальное распределение (гауссовское)&#58; широко применяется в статистике из-за центральной предельной теоремы и подходит для моделирования многих естественных явлений.

1. Равномерное распределение&#58; все значения в интервале имеют одинаковую вероятность, часто используется в случайных экспериментах.

1. Биномиальное распределение&#58; описывает количество успехов в серии независимых и одинаково распределенных испытаний.

1. Экспоненциальное распределение&#58; используется для моделирования времени между двумя последовательными событиями в процессе Пуассона.

1. Пуассоновское распределение&#58; описывает количество событий, произошедших за фиксированный период времени или в фиксированном объеме пространства, при условии, что эти события происходят с фиксированной средней интенсивностью и независимо друг от друга.

:::note[Ссылки для изучения]

1. [Типичные распределения вероятности](https://habr.com/ru/articles/331060/)
   :::

---

## Чем различаются распределения Бернулли и биномиальное, их математические ожидания и дисперсии? [#q-14bee738d69b81bbbdafcd6a5a9bd4c3]

Распределение Бернулли является частным случаем биномиального распределения, где проводится только одно испытание. Оно описывает случайную переменную, которая принимает только два значения&#58; успех (обычно обозначается как 1) и неудачу (обычно обозначается как 0).

Интерпретация распределения Бернулли - это модель случайного эксперимента с двумя возможными исходами, где вероятность успеха (обычно обозначается как <InlineMath tex={"p"} />) и вероятность неудачи <InlineMath tex={"(1 - p)"} /> известны.

Математическое ожидание для распределения Бернулли равно вероятности успеха <InlineMath tex={"(p)"} />, а дисперсия равна <InlineMath tex={"p \* (1 - p)"} />.

Биномиальное распределение расширяет концепцию распределения Бернулли на случай проведения нескольких независимых испытаний, где вероятность успеха <InlineMath tex={"(p)"} /> остается <code>const</code>. Оно описывает количество успехов в серии независимых и одинаково распределенных испытаний.

Интерпретация биномиального распределения - это вероятность получить <InlineMath tex={"k"} /> успехов в <InlineMath tex={"n"} /> испытаниях, где вероятность успеха <InlineMath tex={"(p)"} /> остается постоянной для всех испытаний.

Математическое ожидание для биномиального распределения равно <InlineMath tex={"n _ p"} />, а дисперсия равна <InlineMath tex={"n _ p \* (1 - p)"} />.

:::note[Ссылки для изучения]

1. [Типичные распределения вероятности](https://habr.com/ru/articles/331060/)
   :::

---

## <strong>Как проверить, что распределение нормальное?</strong> [#q-14bee738d69b81aca44fc5a5b72d3e19]

Для проверки нормальности распределения можно использовать статистические тесты, такие как тесты Колмогорова-Смирнова, Шапиро-Уилка, или анализ квантилей <code>&#40;Q&#45;Q plot&#41;</code>. В кратком варианте&#58;

1. <strong>Тест Колмогорова-Смирнова</strong>&#58; Проверяет, насколько хорошо
   ваше распределение соответствует нормальному распределению. Если p-value
   низкое (обычно меньше 0.05), то это говорит о том, что распределение значимо
   отличается от нормального.

1. <strong>Тест Шапиро-Уилка</strong>&#58; Этот тест также проверяет
   нормальность данных. Если p-value меньше выбранного уровня значимости, то
   гипотеза о нормальности отвергается.

1. <strong>Q-Q plot</strong>&#58; Этот график сравнивает квантили вашего
   распределения с квантилями нормального распределения. Если точки на графике
   лежат примерно на прямой линии, то распределение близко к нормальному. Если
   они значительно отклоняются, то распределение отличается от нормального.

Большое p-value означает, что тест не обнаружил достаточных оснований отвергнуть нормальность при своём размере выборки. Оно не доказывает нормальность. Q-Q plot служит визуальной диагностикой и не имеет p-value.

:::note[Ссылки для изучения]

1. [Нормальное распределение](https://habr.com/ru/companies/otus/articles/671322/)
   :::
