Описательная статистика, гипотезы и A/B-тесты
Подтемы:
Что представляют собой среднее, медиана и мода? Как их можно определить на графике?
Определения:
-
Среднее: это сумма всех значений в выборке, разделенная на количество значений. Он представляет собой “среднюю” или “типичную” точку данных.
-
Медиана: это значение, которое делит упорядоченный список данных на две равные половины. Если количество значений нечетное, то медиана - это значение, находящееся посередине; если количество значений четное, то медиана - это среднее значение двух средних значений.
-
Мода: это значение или значения, которые встречаются наиболее часто в выборке. Мода может быть одна или несколько.
На графике среднее можно определить как центр масс точек данных, медиану - как значение, в котором половина данных находится выше, а другая половина - ниже, и моду - как пик или пики в гистограмме, представляющие наиболее часто встречающиеся значения.
Ссылки для изучения
Как изменится среднее, медиана и мода при добавлении 1-2 значений, которые являются большими по модулю?
При добавлении 1-2 значений, которые являются большими по модулю:
-
Среднее: может измениться сильно в сторону добавленных значений, особенно если они значительно отличаются от других значений в выборке.
-
Медиана: обычно меняется не так сильно, особенно если новые значения находятся далеко от центра распределения.
-
Мода: может остаться неизменной, если новые значения не повторяются или не повторяются достаточное количество раз для создания новых мод. Если новые значения повторяются и являются большинством, то мода изменится на эти значения.
Ссылки для изучения
Какой критерий используется для сравнения средних?
Для сравнения средних значений между двумя или более группами обычно используется t-критерий (например, t-тест Стьюдента) или его вариации, такие как:
-
t-тест для независимых выборок: Используется для сравнения средних значений двух независимых групп. -
t-тест для зависимых выборок: Применяется для сравнения средних значений в парных выборках, например, до и после вмешательства. -
ANOVA (анализ дисперсии): Позволяет сравнивать средние значения более чем в двух группах.
Ссылки для изучения
Чем является мат. ожидание константы?
Математическое ожидание константы равно самой константе. Это представляет ожидаемое значение случайной величины, которая всегда принимает одно и то же значение, то есть не изменяется.
Ссылки для изучения
Для чего используется коэффициент корреляции Пирсона? Напишите формулу.
Коэффициент корреляции Пирсона используется для измерения степени линейной взаимосвязи между двумя переменными. Формула:
где:
-
- коэффициент корреляции Пирсона,
-
и - значения переменных и для
-го наблюдения,
-
и - средние значения переменных и соответственно.
Ссылки для изучения
Поправка Бонферрони.
Поправка Бонферрони - это метод коррекции уровня значимости при множественном сравнении гипотез, чтобы уменьшить вероятность совершения ошибки первого рода. Она заключается в том, что уровень значимости делится на количество сравниваемых гипотез mm, чтобы скорректировать его в соответствии с числом проверок. Таким образом, скорректированный уровень значимости .
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- 100 Data Science вопросов мидлу! Парень c Физтеха проходит собеседование · 7:03–7:38Мок-собеседование · Ответ кандидата
Кандидат объясняет, что при проверке многих гипотез можно получить ложное значимое различие, и предлагает поправку Бонферрони: делить уровень значимости на число попарных сравнений.
Что такое p-value?
p-value показывает вероятность при верной нулевой гипотезе и выполненных предположениях теста получить значение статистики не менее экстремальное, чем наблюдаемое. Его сравнивают с заранее выбранным уровнем значимости $\alpha$.
Малое p-value говорит, что данные плохо согласуются с $H_0$, но не показывает вероятность истинности гипотезы, размер эффекта или практическую важность результата. Оно также не заменяет доверительный интервал и проверку предположений теста.
Ссылки для изучения
Как спланировать и провести A/B-тест?
До запуска фиксируют гипотезу, основную метрику, минимально значимый эффект, уровень ошибки, требуемую мощность и правило остановки. По ним рассчитывают размер выборки и длительность. Пользователей случайно и стабильно распределяют между контролем и вариантом, проверяют отсутствие пересечений и корректность сбора данных.
Во время эксперимента не меняют критерий успеха по увиденным результатам. После набора выборки оценивают эффект и доверительный интервал, проверяют статистическую и практическую значимость, баланс групп, sample ratio mismatch и побочные метрики. Решение принимают с учётом цены внедрения и рисков, а не только по условию p < 0.05.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- Мок-интервью продакт-менеджера: кейс и A/B-тесты · 35:31–38:00Мок-собеседование · Совместный разбор
Разбор планирования A/B-теста: ключевая, прокси-, guardrail- и информационные метрики, тест и контроль с единственным изменением, проверка конфликтов с параллельными экспериментами.
Какие методы статистического тестирования вам известны?
Некоторые методы статистического тестирования включают t-тест, анализ дисперсии (ANOVA), тест хи-квадрат, тест Манна-Уитни, корреляционный анализ, и др. Эти методы используются для проверки гипотез о различиях между группами или взаимосвязях между переменными на основе статистических данных.
Ссылки для изучения
Что такое параметрические и непараметрические тесты?
Параметрические тесты предполагают определенное распределение данных (например, нормальное) и используют параметры этого распределения (например, среднее значение, дисперсия) при проведении статистических тестов, таких как t-тест или анализ дисперсии (ANOVA). Непараметрические тесты не предполагают конкретного распределения данных и обычно используются для сравнения рангов или медиан двух или более выборок, например, тест Уилкоксона или тест Манна-Уитни.
Ссылки для изучения
Как вычислять размер выборок в A/B тесте?
Для вычисления размера выборки в A/B тесте учитываются следующие факторы:
-
Базовая конверсия
(baseline conversion rate) -
Минимальный детектируемый эффект
(minimum detectable effect) -
Уровень значимости
(significance level) -
Мощность теста
(power)
Размер выборки можно рассчитать через специальные формулы или онлайн-калькуляторы, учитывающие эти параметры.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- Мок-интервью продакт-менеджера: кейс и A/B-тесты · 50:56–53:20Мок-собеседование · Совместный разбор
Как вычисляют размер выборки: для каждой метрики задают эффект и уровни ошибок первого и второго рода, получают необходимый объём и выбирают срок по ключевой и guardrail-метрикам.
Как понять как долго проводить A/B тест?
Время проведения A/B теста зависит от ожидаемого объёма трафика и целевой метрики. Используются такие факторы как:
-
Размер выборки
-
Скорость трафика
-
Целевые показатели статистической значимости и мощности теста.
Часто используют формулы или инструменты для расчёта минимального времени теста на основе этих факторов.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- Мок-интервью продакт-менеджера: кейс и A/B-тесты · 51:30–53:32Мок-собеседование · Совместный разбор
Участники определяют длительность эксперимента после расчёта объёма по метрикам: берут срок набора выборки для самой долгой важной метрики при текущем трафике.
Как будем считать эффект от нашего A/B тест?
Эффект измеряется сравнением контрольной и тестовой групп по целевым метрикам, например, конверсии. Рассчитывают относительное изменение и проверяют его на статистическую значимость с помощью t-теста или других статистических тестов.
Ссылки для изучения
Какие выборки будут переданы в t-test, что там конкретно будет (физически)?
В t-тесте выборки представляют собой данные по двум группам: контрольной и тестовой. Это могут быть, например, значения конверсий, времени на сайте или других метрик, которые мы хотим сравнить.
Ссылки для изучения
Что происходит внутри t-test?
t-test вычисляет средние значения двух выборок и проверяет
гипотезу о равенстве средних значений. Также, важно учитывать дисперсию выборок
для точного расчёта.
Ссылки для изучения
Как после t-test считать p-value?
После вычисления t-статистики и числа степеней свободы p-value находят как вероятность получить не менее экстремальное значение при нулевой гипотезе. Для двустороннего теста это 2 × P(T ≥ |t|). scipy.stats.ttest_ind возвращает и статистику, и p-value; выбор односторонней или двусторонней альтернативы задают заранее.
Ссылки для изучения
Почему срок A/B-теста скоринговой модели длиннее срока набора выборки?
Набрать нужное число заявок недостаточно: целевой исход скоринга, например дефолт за 90 дней, становится известен только после окна наблюдения. Поэтому срок равен времени набора выборки плюс созревание исходов и лаг данных. Размер задают по baseline, MDE, мощности, доле одобрений и кластеризации, если она есть. Ранние прокси вроде первой просрочки могут ускорить сигнал только после проверки связи с конечным loss. Анализ проводят по когортам выдачи с одинаково полным окном.
Ссылки для изучения
Как оценить распределение разницы конверсий в A/B-тесте?
При независимых группах оценки конверсий имеют биномиальную дисперсию. Разницу p_B - p_A можно приблизить нормальным распределением со стандартной ошибкой из обеих групп и построить доверительный интервал. При достаточном числе успехов это удобно. Бутстреп дает эмпирическое распределение, но ресемплировать надо единицу рандомизации, обычно пользователя, а не события. Для малых счетчиков лучше точные или score-интервалы. Распределение оценки описывает неопределенность эффекта, а не разброс индивидуальных конверсий.
Ссылки для изучения
Какие онлайн-метрики нужны для A/B-теста кредитного скоринга?
Главная метрика должна отражать бизнес-результат с учетом одобрений и дефолтов, например прибыль или ожидаемый loss на выданный кредит. Рядом смотрят approval rate, bad rate и просрочку по зрелым когортам, объем выдач и calibration риска. Нужны guardrails по fairness, жалобам, ручным проверкам, latency и операционной емкости. ROC-AUC на заявках показывает ранжирование, но не доказывает прибыльность политики. Эксперимент оценивает связку модели, порога и процесса принятия решения.
Ссылки для изучения
Как ускорить A/B-тест без роста ложноположительных результатов?
Снизить требуемую выборку помогают уменьшение дисперсии и более чувствительная метрика: CUPED с предэкспериментальными данными, стратификация и корректная агрегация на единицу рандомизации. Календарный срок сокращает рост потока, но не произвольный просмотр результата. Proxy-метрика допустима после валидации связи с целью. Для ранней остановки используют заранее заданный group-sequential или другой sequential design с контролем ошибки первого рода. Обычный peeking и остановка при p < 0,05 увеличивают ложноположительные результаты.
Ссылки для изучения
Как рандомизировать магазины между группами эксперимента?
Единицей рандомизации делают магазин, потому что цена и поведение покупателей внутри магазина связаны. До теста магазины стратифицируют или матчят по региону, формату, размеру и историческим метрикам, затем случайно назначают варианты внутри страт. Связанные магазины или общие зоны спроса лучше держать в одном кластере. Баланс проверяют только по данным до теста. Анализ учитывает кластерный дизайн и число магазинов, а не притворяется, что каждая покупка независима.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- 100 Data Science вопросов мидлу! Парень c Физтеха проходит собеседование · 8:01–8:59Мок-собеседование · Ответ кандидата
Кандидат предлагает делить магазины так, чтобы в тесте и контроле совпадало распределение товарооборота, а затем дополнительно сверить схожесть поведения во времени до эксперимента.
Как спроектировать эксперимент для алгоритма цен в физическом ритейле?
Обычно рандомизируют магазины, регионы или временные кластеры, чтобы одна точка не применяла две цены одновременно. Главной метрикой лучше брать маржинальную прибыль, а не выручку. Guardrails включают объем продаж, списания, наличие товара, жалобы и долю ручных корректировок. Дизайн учитывает промо, сезонность, различия форматов и spillover, когда покупатель сравнивает соседние магазины. Анализ ведут на уровне единицы рандомизации с кластерными стандартными ошибками и заранее заданным горизонтом.
Ссылки для изучения
Когда выбрать t-тест, а когда критерий Манна-Уитни?
Для двух независимых групп t-тест оценивает разницу средних. Обычно выбирают вариант Welch, который не требует равных дисперсий; при достаточной выборке он устойчив к умеренной ненормальности, но чувствителен к тяжелым хвостам и выбросам. Манна-Уитни сравнивает ранги; стандартная нулевая гипотеза предполагает одинаковые распределения. Статистика связана с вероятностью превосходства одного наблюдения над другим с поправкой на совпадения. Критерий не выявляет любое возможное различие распределений. Это не универсальный тест медиан. Интерпретировать его как сдвиг можно лишь при сходной форме распределений.
Ссылки для изучения
Что такое уровень значимости?
Уровень значимости - это вероятность отвергнуть нулевую гипотезу, когда она на самом деле верна. Обычно обозначается символом α (альфа) и выбирается заранее исследователем. В научных исследованиях типичные значения α составляют 0.05 или 0.01, что соответствует вероятности ошибки первого рода в 5% или 1% соответственно.
Ссылки для изучения
Как решить проблему множественной проверки выборок на соответствие гипотезы?
Для решения проблемы множественной проверки выборок на соответствие гипотезе можно использовать методы поправки, такие как метод Бонферрони, метод Холма или метод Бенджамини-Хохберга. Эти методы позволяют скорректировать уровень значимости для компенсации увеличенного риска ложноположительных результатов при множественных сравнениях.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- 100 Data Science вопросов мидлу! Парень c Физтеха проходит собеседование · 7:03–7:38Мок-собеседование · Ответ кандидата
При множественной проверке гипотез кандидат ожидает ложноположительные различия и предлагает поправку Бонферрони с корректировкой порога на число сравнений.







