---
title: Описательная статистика
seo:
  title: Описательная статистика — Data Scientist
  description: "Тема «Описательная статистика» для собеседования Data Scientist. Что представляют собой среднее, медиана и мода? Как их можно определить на графике? Какой критерий используется для сравнения средних?"
---

[Все темы Data Scientist](/data-scientist)

## <strong>Что представляют собой среднее, медиана и мода? Как их можно определить на графике?</strong> [#q-14bee738d69b81de8a84f1bf647df598]

Определения&#58;

- <strong>Среднее</strong>&#58; это сумма всех значений в выборке, разделенная
  на количество значений. Он представляет собой "среднюю" или "типичную" точку
  данных.

- <strong>Медиана</strong>&#58; это значение, которое делит упорядоченный список
  данных на две равные половины. Если количество значений нечетное, то медиана -
  это значение, находящееся посередине; если количество значений четное, то
  медиана - это среднее значение двух средних значений.

- <strong>Мода</strong>&#58; это значение или значения, которые встречаются
  наиболее часто в выборке. Мода может быть одна или несколько.

На графике среднее можно определить как центр масс точек данных, медиану - как значение, в котором половина данных находится выше, а другая половина - ниже, и моду - как пик или пики в гистограмме, представляющие наиболее часто встречающиеся значения.

:::note[Ссылки для изучения]

1. [Описательная статистика](http://www.machinelearning.ru/wiki/index.php?title=%D0%9E%D0%BF%D0%B8%D1%81%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0)
   :::

---

## <strong>Как изменится среднее, медиана и мода при добавлении 1-2 значений, которые являются большими по модулю?</strong> [#q-14bee738d69b8170b3e9f900997e8631]

При добавлении 1-2 значений, которые являются большими по модулю&#58;

- <strong>Среднее</strong>&#58; может измениться сильно в сторону добавленных
  значений, особенно если они значительно отличаются от других значений в
  выборке.

- <strong>Медиана</strong>&#58; обычно меняется не так сильно, особенно если
  новые значения находятся далеко от центра распределения.

- <strong>Мода</strong>&#58; может остаться неизменной, если новые значения не
  повторяются или не повторяются достаточное количество раз для создания новых
  мод. Если новые значения повторяются и являются большинством, то мода
  изменится на эти значения.

:::note[Ссылки для изучения]

1. [Описательная статистика](http://www.machinelearning.ru/wiki/index.php?title=%D0%9E%D0%BF%D0%B8%D1%81%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0)
   :::

---

## <strong>Какой критерий используется для сравнения средних?</strong> [#q-14bee738d69b8184960be24906c7f2a1]

Для сравнения средних значений между двумя или более группами обычно используется t-критерий (например, t-тест Стьюдента) или его вариации, такие как&#58;

1. <code>t&#45;тест для независимых выборок</code>&#58; Используется для
   сравнения средних значений двух независимых групп.

1. <code>t&#45;тест для зависимых выборок</code>&#58; Применяется для сравнения
   средних значений в парных выборках, например, до и после вмешательства.

1. <code>ANOVA &#40;анализ дисперсии&#41;</code>&#58; Позволяет сравнивать
   средние значения более чем в двух группах.

:::note[Ссылки для изучения]

1. [Описательная статистика](http://www.machinelearning.ru/wiki/index.php?title=%D0%9E%D0%BF%D0%B8%D1%81%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0)
   :::

---

## <strong>Написать формулу кросс-энтропии. Как происходит минимизация ошибки?</strong> [#q-14bee738d69b813db9aec62b7e1bf27a]

Формула кросс-энтропии для бинарной классификации&#58;

<InlineMath
  tex={
    "J(\\theta) = -\\frac{1}{m} \\sum_{i=1}^{m} [y^{(i)} \\log(h_{\\theta}(x^{(i)})) + (1 - y^{(i)}) \\log(1 - h_{\\theta}(x^{(i)}))]"
  }
/>

где&#58;

- <InlineMath tex={"J(\\theta)"} /> - функция потерь (кросс-энтропия),

- <InlineMath tex={"m"} /> - количество примеров в обучающем наборе,

- <InlineMath tex={"y^{(i)}"} /> - истинное значение (0 или 1) целевой
  переменной для <InlineMath tex={"i"} />
  -го примера,

- <InlineMath tex={"h_{\\theta}(x^{(i)})"} /> - предсказанная вероятность
  принадлежности к классу 1 для <InlineMath tex={"i"} />
  -го примера при параметрах модели <InlineMath tex={"\\theta"} />.

Минимизация ошибки (и, соответственно, минимизация функции потерь) происходит с помощью методов оптимизации, таких как градиентный спуск. Модель обновляет свои параметры <InlineMath tex={"\\theta"} /> в направлении, противоположном градиенту функции потерь, с целью нахождения минимума функции потерь. Этот процесс повторяется до тех пор, пока не будет достигнута сходимость или другое условие останова.

:::note[Ссылки для изучения]

1. [Кросс-энтропия](https://habr.com/ru/articles/686806/)
   :::

---

## <strong>Чем является мат. ожидание константы?</strong> [#q-14bee738d69b816e8d10f2b532a4490c]

Математическое ожидание константы равно самой константе. Это представляет ожидаемое значение случайной величины, которая всегда принимает одно и то же значение, то есть не изменяется.

:::note[Ссылки для изучения]

1. [Описательная статистика](http://www.machinelearning.ru/wiki/index.php?title=%D0%9E%D0%BF%D0%B8%D1%81%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0)
   :::

---

## <strong>Для чего используется коэффициент корреляции Пирсона? Напишите формулу.</strong> [#q-14bee738d69b81b6a595d6faa9c09e7c]

Коэффициент корреляции Пирсона используется для измерения степени линейной взаимосвязи между двумя переменными. Формула&#58;

$$
r = \frac{{\sum (x_i - \bar{x})(y_i - \bar{y})}}{{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}}
$$

где&#58;

- <InlineMath tex={"r"} /> - коэффициент корреляции Пирсона,

- <InlineMath tex={"x_i"} /> и <InlineMath tex={"y_i"} /> - значения переменных
  <InlineMath tex={"x"} /> и <InlineMath tex={"y"} /> для
  <InlineMath tex={"i"} />
  -го наблюдения,

- <InlineMath tex={"\\bar{x}"} /> и <InlineMath tex={"\\bar{y}"} /> - средние
  значения переменных <InlineMath tex={"x"} /> и <InlineMath tex={"y"} />
  соответственно.

:::note[Ссылки для изучения]

1. [Описательная статистика](http://www.machinelearning.ru/wiki/index.php?title=%D0%9E%D0%BF%D0%B8%D1%81%D0%B0%D1%82%D0%B5%D0%BB%D1%8C%D0%BD%D0%B0%D1%8F_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0)
   :::

---

## <strong>Поправка Бонферрони.</strong> [#q-14bee738d69b815fa7f1d8ab11c53aa0]

Поправка Бонферрони - это метод коррекции уровня значимости при множественном сравнении гипотез, чтобы уменьшить вероятность совершения ошибки первого рода. Она заключается в том, что уровень значимости <InlineMath tex={"α"} /> делится на количество сравниваемых гипотез mm, чтобы скорректировать его в соответствии с числом проверок. Таким образом, скорректированный уровень значимости <InlineMath tex={"α\_{\\text{корр}}= \\frac{α}{m}"} />.

:::note[Ссылки для изучения]

1. [Поправка на множественную проверку гипотез](https://ru.wikipedia.org/wiki/%D0%9F%D0%BE%D0%BF%D1%80%D0%B0%D0%B2%D0%BA%D0%B0_%D0%BD%D0%B0_%D0%BC%D0%BD%D0%BE%D0%B6%D0%B5%D1%81%D1%82%D0%B2%D0%B5%D0%BD%D0%BD%D1%83%D1%8E_%D0%BF%D1%80%D0%BE%D0%B2%D0%B5%D1%80%D0%BA%D1%83_%D0%B3%D0%B8%D0%BF%D0%BE%D1%82%D0%B5%D0%B7)
   :::

---

## <strong>Что такое p-value?</strong> [#q-14bee738d69b810b957ed47c179c9bb2]

p-value представляет вероятность получить не менее экстремальное значение статистики при верной нулевой гипотезе и выполненных предположениях теста. Его сравнивают с заранее выбранным уровнем значимости α. Само p-value не является уровнем значимости, вероятностью истинности гипотезы или размером эффекта.

:::note[Ссылки для изучения]

1. [p-value для начинающих](https://habr.com/ru/companies/skillfactory/articles/510688/)
   :::
