---
title: Описательная статистика, гипотезы и A/B-тесты
questionDates:
  q-transfer-0027: '2026-10-01'
  q-transfer-0028: '2026-10-01'
  q-transfer-0029: '2026-10-01'
  q-transfer-0030: '2026-10-01'
  q-transfer-0031: '2026-10-01'
  q-transfer-0032: '2026-10-01'
  q-transfer-0033: '2026-10-01'
seo:
  description: >-
    Тема «Описательная статистика, гипотезы и A/B-тесты» для собеседования Data
    Scientist. Что представляют собой среднее, медиана и мода? Как их можно
    определить на графике? Какой критерий используется для сравнения средних?
  title: Описательная статистика, гипотезы и A/B-тесты — Data Scientist
---

[Все темы Data Scientist](/prep/data-scientist)

Подтемы:

- [Описательная статистика](#q-14bee738d69b81de8a84f1bf647df598)
- [Статистические тесты](#q-14bee738d69b81349ad5c539e9ecd838)
- [Проверка гипотез](#q-14bee738d69b819bba94df9ccbda5e3c)
- [Множественное сравнение выборок](#q-14bee738d69b8166bf7fd4a085f46d8e)

<span
  id="q-14bee738d69b813db9aec62b7e1bf27a"
  data-question-redirect="/prep/data-scientist/optimizaciya-i-funkcii-poter#q-14bee738d69b813db9aec62b7e1bf27a"
></span>

## <strong>Что представляют собой среднее, медиана и мода? Как их можно определить на графике?</strong> [#q-14bee738d69b81de8a84f1bf647df598]

Определения&#58;

- <strong>Среднее</strong>&#58; это сумма всех значений в выборке, разделенная
  на количество значений. Он представляет собой "среднюю" или "типичную" точку
  данных.

- <strong>Медиана</strong>&#58; это значение, которое делит упорядоченный список
  данных на две равные половины. Если количество значений нечетное, то медиана -
  это значение, находящееся посередине; если количество значений четное, то
  медиана - это среднее значение двух средних значений.

- <strong>Мода</strong>&#58; это значение или значения, которые встречаются
  наиболее часто в выборке. Мода может быть одна или несколько.

На графике среднее можно определить как центр масс точек данных, медиану - как значение, в котором половина данных находится выше, а другая половина - ниже, и моду - как пик или пики в гистограмме, представляющие наиболее часто встречающиеся значения.

:::note[Ссылки для изучения]

1. [Среднее и медиана: определения и влияние крайних значений](https://pozdniakov.github.io/tidy_stats/210-desc_stats.html#sec-median)
   :::

---

## <strong>Как изменится среднее, медиана и мода при добавлении 1-2 значений, которые являются большими по модулю?</strong> [#q-14bee738d69b8170b3e9f900997e8631]

При добавлении 1-2 значений, которые являются большими по модулю&#58;

- <strong>Среднее</strong>&#58; может измениться сильно в сторону добавленных
  значений, особенно если они значительно отличаются от других значений в
  выборке.

- <strong>Медиана</strong>&#58; обычно меняется не так сильно, особенно если
  новые значения находятся далеко от центра распределения.

- <strong>Мода</strong>&#58; может остаться неизменной, если новые значения не
  повторяются или не повторяются достаточное количество раз для создания новых
  мод. Если новые значения повторяются и являются большинством, то мода
  изменится на эти значения.

:::note[Ссылки для изучения]

1. [Среднее и медиана: определения и влияние крайних значений](https://pozdniakov.github.io/tidy_stats/210-desc_stats.html#sec-median)
   :::

---

## <strong>Какой критерий используется для сравнения средних?</strong> [#q-14bee738d69b8184960be24906c7f2a1]

Для сравнения средних значений между двумя или более группами обычно используется t-критерий (например, t-тест Стьюдента) или его вариации, такие как&#58;

1. <code>t&#45;тест для независимых выборок</code>&#58; Используется для
   сравнения средних значений двух независимых групп.

1. <code>t&#45;тест для зависимых выборок</code>&#58; Применяется для сравнения
   средних значений в парных выборках, например, до и после вмешательства.

1. <code>ANOVA &#40;анализ дисперсии&#41;</code>&#58; Позволяет сравнивать
   средние значения более чем в двух группах.

:::note[Ссылки для изучения]

1. [t-тест: независимые и связанные выборки](https://pozdniakov.github.io/tidy_stats/320-ttest.html)
1. [ANOVA: сравнение средних нескольких групп](https://pozdniakov.github.io/tidy_stats/350-anova.html)
   :::

---

## <strong>Чем является мат. ожидание константы?</strong> [#q-14bee738d69b816e8d10f2b532a4490c]

Математическое ожидание константы равно самой константе. Это представляет ожидаемое значение случайной величины, которая всегда принимает одно и то же значение, то есть не изменяется.

:::note[Ссылки для изучения]

1. [Свойства математического ожидания: константа и линейность](https://contest.yandex.ru/tracks/ml/mathematical-foundations/probability-distributions)
   :::

---

## <strong>Для чего используется коэффициент корреляции Пирсона? Напишите формулу.</strong> [#q-14bee738d69b81b6a595d6faa9c09e7c]

Коэффициент корреляции Пирсона используется для измерения степени линейной взаимосвязи между двумя переменными. Формула&#58;

$$
r = \frac{{\sum (x_i - \bar{x})(y_i - \bar{y})}}{{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}}
$$

где&#58;

- <InlineMath tex={"r"} /> - коэффициент корреляции Пирсона,

- <InlineMath tex={"x_i"} /> и <InlineMath tex={"y_i"} /> - значения переменных
  <InlineMath tex={"x"} /> и <InlineMath tex={"y"} /> для
  <InlineMath tex={"i"} />
  -го наблюдения,

- <InlineMath tex={"\\bar{x}"} /> и <InlineMath tex={"\\bar{y}"} /> - средние
  значения переменных <InlineMath tex={"x"} /> и <InlineMath tex={"y"} />
  соответственно.

:::note[Ссылки для изучения]

1. [Коэффициент корреляции Пирсона: ковариация и нормировка](https://pozdniakov.github.io/tidy_stats/330-cov_cor.html#sec-pearson_cor)
   :::

---

## <strong>Поправка Бонферрони.</strong> [#q-14bee738d69b815fa7f1d8ab11c53aa0]

Поправка Бонферрони - это метод коррекции уровня значимости при множественном сравнении гипотез, чтобы уменьшить вероятность совершения ошибки первого рода. Она заключается в том, что уровень значимости <InlineMath tex={"α"} /> делится на количество сравниваемых гипотез mm, чтобы скорректировать его в соответствии с числом проверок. Таким образом, скорректированный уровень значимости <InlineMath tex={"α\_{\\text{корр}}= \\frac{α}{m}"} />.

:::note[Ссылки для изучения]

1. [Поправка на множественную проверку гипотез](https://ru.wikipedia.org/wiki/%D0%9F%D0%BE%D0%BF%D1%80%D0%B0%D0%B2%D0%BA%D0%B0_%D0%BD%D0%B0_%D0%BC%D0%BD%D0%BE%D0%B6%D0%B5%D1%81%D1%82%D0%B2%D0%B5%D0%BD%D0%BD%D1%83%D1%8E_%D0%BF%D1%80%D0%BE%D0%B2%D0%B5%D1%80%D0%BA%D1%83_%D0%B3%D0%B8%D0%BF%D0%BE%D1%82%D0%B5%D0%B7)
   :::

---

## Что такое p-value? [#q-14bee738d69b810b957ed47c179c9bb2]

<span id="q-14bee738d69b81e19dc3d1467dd7c3bf"></span>

p-value показывает вероятность при верной нулевой гипотезе и выполненных предположениях теста получить значение статистики не менее экстремальное, чем наблюдаемое. Его сравнивают с заранее выбранным уровнем значимости $\alpha$.

Малое p-value говорит, что данные плохо согласуются с $H_0$, но не показывает вероятность истинности гипотезы, размер эффекта или практическую важность результата. Оно также не заменяет доверительный интервал и проверку предположений теста.

:::note[Ссылки для изучения]

1. [p-value: вероятность экстремальной статистики при H₀ и решение по уровню значимости](https://pozdniakov.github.io/tidy_stats/310-infer_stats.html#sec-nhst)
   :::

---

## Как спланировать и провести A/B-тест? [#q-14bee738d69b81349ad5c539e9ecd838]

<span id="q-14bee738d69b81cfb05dee4eb590095e"></span>

До запуска фиксируют гипотезу, основную метрику, минимально значимый эффект, уровень ошибки, требуемую мощность и правило остановки. По ним рассчитывают размер выборки и длительность. Пользователей случайно и стабильно распределяют между контролем и вариантом, проверяют отсутствие пересечений и корректность сбора данных.

Во время эксперимента не меняют критерий успеха по увиденным результатам. После набора выборки оценивают эффект и доверительный интервал, проверяют статистическую и практическую значимость, баланс групп, sample ratio mismatch и побочные метрики. Решение принимают с учётом цены внедрения и рисков, а не только по условию `p < 0.05`.

:::note[Ссылки для изучения]

1. [Планирование A/B-теста: сплитование, длительность, метрика и MDE — методичка Авито](https://habr.com/ru/companies/avito/articles/936804/)
2. [Гипотезы и метрики A/B-теста. Noukash, с 0:22](https://www.youtube.com/watch?v=FEI1OA-zgb8&t=22s)

:::

---

## <strong>Какие методы статистического тестирования вам известны?</strong> [#q-14bee738d69b818fa7d1d26293747526]

Некоторые методы статистического тестирования включают <code>t&#45;тест</code>, анализ дисперсии <code>&#40;ANOVA&#41;</code>, тест <code>хи&#45;квадрат</code>, тест <code>Манна&#45;Уитни</code>, корреляционный анализ, и др. Эти методы используются для проверки гипотез о различиях между группами или взаимосвязях между переменными на основе статистических данных.

:::note[Ссылки для изучения]

1. [t-тест: проверка средних и виды выборок](https://pozdniakov.github.io/tidy_stats/320-ttest.html)
1. [Хи-квадрат: наблюдаемые частоты и независимость категорий](https://pozdniakov.github.io/tidy_stats/325-chisq.html)
   :::

---

## <strong>Что такое параметрические и непараметрические тесты?</strong> [#q-14bee738d69b8155aa80eb83a661d9bb]

Параметрические тесты предполагают определенное распределение данных (например, нормальное) и используют параметры этого распределения (например, среднее значение, дисперсия) при проведении статистических тестов, таких как <code>t&#45;тест</code> или анализ дисперсии <code>&#40;ANOVA&#41;</code>. Непараметрические тесты не предполагают конкретного распределения данных и обычно используются для сравнения рангов или медиан двух или более выборок, например, тест <code>Уилкоксона</code> или тест <code>Манна&#45;Уитни</code>.

:::note[Ссылки для изучения]

1. [Допущения t-теста: нормальность и независимость](https://pozdniakov.github.io/tidy_stats/320-ttest.html#sec-assumptions_ttest)
1. [Манна–Уитни и сравнение средних: разные вопросы тестирования](https://habr.com/ru/companies/avito/articles/571094/)
   :::

---

## <strong>Как вычислять размер выборок в A/B тесте?</strong> [#q-14bee738d69b810c9fd0e9e109cc65b5]

Для вычисления размера выборки в A/B тесте учитываются следующие факторы&#58;

- Базовая конверсия <code>&#40;baseline conversion rate&#41;</code>

- Минимальный детектируемый эффект <code>&#40;minimum detectable effect&#41;</code>

- Уровень значимости <code>&#40;significance level&#41;</code>

- Мощность теста <code>&#40;power&#41;</code>

Размер выборки можно рассчитать через специальные формулы или онлайн-калькуляторы, учитывающие эти параметры.

:::note[Ссылки для изучения]

1. [Размеры групп в A/B-тесте: MDE и мощность](https://habr.com/ru/companies/avito/articles/936804/)
   :::

---

## <strong>Как понять как долго проводить A/B тест?</strong> [#q-14bee738d69b8119be08e99c77437342]

Время проведения A/B теста зависит от ожидаемого объёма трафика и целевой метрики. Используются такие факторы как&#58;

- Размер выборки

- Скорость трафика

- Целевые показатели статистической значимости и мощности теста.

Часто используют формулы или инструменты для расчёта минимального времени теста на основе этих факторов.

:::note[Ссылки для изучения]

1. [Длительность A/B-теста: MDE на исторических данных](https://habr.com/ru/companies/avito/articles/936804/)
   :::

---

## <strong>Как будем считать эффект от нашего A/B тест?</strong> [#q-14bee738d69b81faafe7c79b40a5ac75]

Эффект измеряется сравнением контрольной и тестовой групп по целевым метрикам, например, конверсии. Рассчитывают относительное изменение и проверяют его на статистическую значимость с помощью t-теста или других статистических тестов.

:::note[Ссылки для изучения]

1. [Эффект A/B-теста и доверительный интервал](https://habr.com/ru/companies/avito/articles/936804/)
   :::

---

## <strong>Какие выборки будут переданы в</strong> <code>t&#45;test</code><strong>, что там конкретно будет (физически)?</strong> [#q-14bee738d69b81ff840bf371f84e2842]

В <code>t&#45;тесте</code> выборки представляют собой данные по двум группам&#58; контрольной и тестовой. Это могут быть, например, значения конверсий, времени на сайте или других метрик, которые мы хотим сравнить.

:::note[Ссылки для изучения]

1. [Данные для теста: метрика по пользователям в контроле и варианте](https://habr.com/ru/companies/avito/articles/936804/)
   :::

---

## <strong>Что происходит внутри</strong> <code>t&#45;test</code><strong>?</strong> [#q-14bee738d69b8131b5d1dc1313fb4702]

<code>t&#45;test</code> вычисляет средние значения двух выборок и проверяет
гипотезу о равенстве средних значений. Также, важно учитывать дисперсию выборок
для точного расчёта.

:::note[Ссылки для изучения]

1. [t-тест: разность средних, стандартная ошибка и степени свободы](https://pozdniakov.github.io/tidy_stats/320-ttest.html#sec-ind_ttest)
   :::

---

## <strong>Как после</strong> <code>t&#45;test</code> <strong>считать</strong> <code>p&#45;value</code><strong>?</strong> [#q-14bee738d69b81b1bf67d09df168b303]

После вычисления t-статистики и числа степеней свободы p-value находят как вероятность получить не менее экстремальное значение при нулевой гипотезе. Для двустороннего теста это 2 × P(T ≥ |t|). scipy.stats.ttest_ind возвращает и статистику, и p-value; выбор односторонней или двусторонней альтернативы задают заранее.

:::note[Ссылки для изучения]

1. [p-value t-теста: хвосты распределения Стьюдента](https://pozdniakov.github.io/tidy_stats/320-ttest.html#sec-one_ttest)
   :::

---

## Почему срок A/B-теста скоринговой модели длиннее срока набора выборки? [#q-transfer-0027]

Набрать нужное число заявок недостаточно: целевой исход скоринга, например дефолт за 90 дней, становится известен только после окна наблюдения. Поэтому срок равен времени набора выборки плюс созревание исходов и лаг данных. Размер задают по baseline, MDE, мощности, доле одобрений и кластеризации, если она есть. Ранние прокси вроде первой просрочки могут ускорить сигнал только после проверки связи с конечным loss. Анализ проводят по когортам выдачи с одинаково полным окном.

:::note[Ссылки для изучения]

1. [Дефолт в кредитном скоринге: окно наблюдения](https://habr.com/ru/companies/alfa/articles/680346/)
   :::

---

## Как оценить распределение разницы конверсий в A/B-тесте? [#q-transfer-0028]

При независимых группах оценки конверсий имеют биномиальную дисперсию. Разницу `p_B - p_A` можно приблизить нормальным распределением со стандартной ошибкой из обеих групп и построить доверительный интервал. При достаточном числе успехов это удобно. Бутстреп дает эмпирическое распределение, но ресемплировать надо единицу рандомизации, обычно пользователя, а не события. Для малых счетчиков лучше точные или score-интервалы. Распределение оценки описывает неопределенность эффекта, а не разброс индивидуальных конверсий.

:::note[Ссылки для изучения]

1. [Конверсия как Бернулли: дисперсия бинарного исхода и биномиальная сумма](https://contest.yandex.ru/tracks/ml/mathematical-foundations/probability-distributions#raspredelenie-bernulli)
1. [Нормальное приближение разницы средних: сумма дисперсий и доверительный интервал](https://habr.com/ru/companies/avito/articles/936804/)
   :::

---

## Какие онлайн-метрики нужны для A/B-теста кредитного скоринга? [#q-transfer-0029]

Главная метрика должна отражать бизнес-результат с учетом одобрений и дефолтов, например прибыль или ожидаемый loss на выданный кредит. Рядом смотрят approval rate, bad rate и просрочку по зрелым когортам, объем выдач и calibration риска. Нужны guardrails по fairness, жалобам, ручным проверкам, latency и операционной емкости. ROC-AUC на заявках показывает ранжирование, но не доказывает прибыльность политики. Эксперимент оценивает связку модели, порога и процесса принятия решения.

:::note[Ссылки для изучения]

1. [Бизнес-компромисс скоринга: больше выдач при контролируемом уровне риска](https://habr.com/ru/companies/alfa/articles/680346/)
1. [Вероятность дефолта, ожидаемый убыток и калибровка риска на примере Точки](https://habr.com/ru/companies/tochka/articles/696226/)
   :::

---

## Как ускорить A/B-тест без роста ложноположительных результатов? [#q-transfer-0030]

Снизить требуемую выборку помогают уменьшение дисперсии и более чувствительная метрика: CUPED с предэкспериментальными данными, стратификация и корректная агрегация на единицу рандомизации. Календарный срок сокращает рост потока, но не произвольный просмотр результата. Proxy-метрика допустима после валидации связи с целью. Для ранней остановки используют заранее заданный group-sequential или другой sequential design с контролем ошибки первого рода. Обычный peeking и остановка при `p < 0,05` увеличивают ложноположительные результаты.

:::note[Ссылки для изучения]

1. [Последовательное тестирование: ранняя остановка A/B-теста с контролем ошибки первого рода](https://habr.com/ru/companies/tbank/articles/876984/)
   :::

---

## Как рандомизировать магазины между группами эксперимента? [#q-transfer-0031]

Единицей рандомизации делают магазин, потому что цена и поведение покупателей внутри магазина связаны. До теста магазины стратифицируют или матчят по региону, формату, размеру и историческим метрикам, затем случайно назначают варианты внутри страт. Связанные магазины или общие зоны спроса лучше держать в одном кластере. Баланс проверяют только по данным до теста. Анализ учитывает кластерный дизайн и число магазинов, а не притворяется, что каждая покупка независима.

:::note[Ссылки для изучения]

1. [Стратификация перед экспериментом: признаки магазинов и случайное распределение внутри страт](https://habr.com/ru/companies/X5Tech/articles/596279/)
   :::

---

## Как спроектировать эксперимент для алгоритма цен в физическом ритейле? [#q-transfer-0032]

Обычно рандомизируют магазины, регионы или временные кластеры, чтобы одна точка не применяла две цены одновременно. Главной метрикой лучше брать маржинальную прибыль, а не выручку. Guardrails включают объем продаж, списания, наличие товара, жалобы и долю ручных корректировок. Дизайн учитывает промо, сезонность, различия форматов и spillover, когда покупатель сравнивает соседние магазины. Анализ ведут на уровне единицы рандомизации с кластерными стандартными ошибками и заранее заданным горизонтом.

:::note[Ссылки для изучения]

1. [ML-ценообразование в ритейле: целевая маржа, guardrails и тесты по группам магазинов](https://habr.com/ru/companies/magnit/articles/954224/)
1. [Стратификация до теста: ковариаты магазинов и случайное назначение внутри страт](https://habr.com/ru/companies/X5Tech/articles/596279/)
   :::

---

## Когда выбрать t-тест, а когда критерий Манна-Уитни? [#q-transfer-0033]

Для двух независимых групп t-тест оценивает разницу средних. Обычно выбирают вариант Welch, который не требует равных дисперсий; при достаточной выборке он устойчив к умеренной ненормальности, но чувствителен к тяжелым хвостам и выбросам. Манна-Уитни сравнивает ранги; стандартная нулевая гипотеза предполагает одинаковые распределения. Статистика связана с вероятностью превосходства одного наблюдения над другим с поправкой на совпадения. Критерий не выявляет любое возможное различие распределений. Это не универсальный тест медиан. Интерпретировать его как сдвиг можно лишь при сходной форме распределений.

:::note[Ссылки для изучения]

1. [t-тест и поправка Уэлча: средние, дисперсии и допущения](https://pozdniakov.github.io/tidy_stats/320-ttest.html)
1. [Манн–Уитни: нулевая гипотеза и ограничения интерпретации средних/медиан](https://habr.com/ru/articles/990926/)
   :::

---

## <strong>Что такое уровень значимости?</strong> [#q-14bee738d69b819bba94df9ccbda5e3c]

Уровень значимости - это вероятность отвергнуть нулевую гипотезу, когда она на самом деле верна. Обычно обозначается символом α (альфа) и выбирается заранее исследователем. В научных исследованиях типичные значения α составляют 0.05 или 0.01, что соответствует вероятности ошибки первого рода в 5% или 1% соответственно.

:::note[Ссылки для изучения]

1. [Проверка статистических гипотез](http://www.machinelearning.ru/wiki/index.php?title=%D0%9F%D1%80%D0%BE%D0%B2%D0%B5%D1%80%D0%BA%D0%B0_%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D1%87%D0%B5%D1%81%D0%BA%D0%B8%D1%85_%D0%B3%D0%B8%D0%BF%D0%BE%D1%82%D0%B5%D0%B7)
   :::

---

## <strong>Как решить проблему множественной проверки выборок на соответствие гипотезы?</strong> [#q-14bee738d69b8166bf7fd4a085f46d8e]

Для решения проблемы множественной проверки выборок на соответствие гипотезе можно использовать методы поправки, такие как метод Бонферрони, метод Холма или метод Бенджамини-Хохберга. Эти методы позволяют скорректировать уровень значимости для компенсации увеличенного риска ложноположительных результатов при множественных сравнениях.

:::note[Ссылки для изучения]

1. [Метод Бенджамини-Хохберга](http://www.machinelearning.ru/wiki/index.php?title=%D0%9C%D0%B5%D1%82%D0%BE%D0%B4_%D0%91%D0%B5%D0%BD%D0%B4%D0%B6%D0%B0%D0%BC%D0%B8%D0%BD%D0%B8-%D0%A5%D0%BE%D1%85%D0%B1%D0%B5%D1%80%D0%B3%D0%B0)
   :::
