Перейти к содержимому
На этой странице

Описательная статистика, гипотезы и A/B-тесты

Все темы Data Scientist

Подтемы:

Что представляют собой среднее, медиана и мода? Как их можно определить на графике?

Определения:

  • Среднее: это сумма всех значений в выборке, разделенная на количество значений. Он представляет собой “среднюю” или “типичную” точку данных.

  • Медиана: это значение, которое делит упорядоченный список данных на две равные половины. Если количество значений нечетное, то медиана - это значение, находящееся посередине; если количество значений четное, то медиана - это среднее значение двух средних значений.

  • Мода: это значение или значения, которые встречаются наиболее часто в выборке. Мода может быть одна или несколько.

На графике среднее можно определить как центр масс точек данных, медиану - как значение, в котором половина данных находится выше, а другая половина - ниже, и моду - как пик или пики в гистограмме, представляющие наиболее часто встречающиеся значения.


Как изменится среднее, медиана и мода при добавлении 1-2 значений, которые являются большими по модулю?

При добавлении 1-2 значений, которые являются большими по модулю:

  • Среднее: может измениться сильно в сторону добавленных значений, особенно если они значительно отличаются от других значений в выборке.

  • Медиана: обычно меняется не так сильно, особенно если новые значения находятся далеко от центра распределения.

  • Мода: может остаться неизменной, если новые значения не повторяются или не повторяются достаточное количество раз для создания новых мод. Если новые значения повторяются и являются большинством, то мода изменится на эти значения.


Какой критерий используется для сравнения средних?

Для сравнения средних значений между двумя или более группами обычно используется t-критерий (например, t-тест Стьюдента) или его вариации, такие как:

  1. t-тест для независимых выборок: Используется для сравнения средних значений двух независимых групп.

  2. t-тест для зависимых выборок: Применяется для сравнения средних значений в парных выборках, например, до и после вмешательства.

  3. ANOVA (анализ дисперсии): Позволяет сравнивать средние значения более чем в двух группах.


Чем является мат. ожидание константы?

Математическое ожидание константы равно самой константе. Это представляет ожидаемое значение случайной величины, которая всегда принимает одно и то же значение, то есть не изменяется.


Для чего используется коэффициент корреляции Пирсона? Напишите формулу.

Коэффициент корреляции Пирсона используется для измерения степени линейной взаимосвязи между двумя переменными. Формула:

r=∑(xi−xˉ)(yi−yˉ)∑(xi−xˉ)2∑(yi−yˉ)2r = \frac{{\sum (x_i - \bar{x})(y_i - \bar{y})}}{{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}}

где:

  • rr - коэффициент корреляции Пирсона,

  • xix_i и yiy_i - значения переменных xx и yy для

    ii

    -го наблюдения,

  • xˉ\bar{x} и yˉ\bar{y} - средние значения переменных xx и yy соответственно.


Поправка Бонферрони.

Поправка Бонферрони - это метод коррекции уровня значимости при множественном сравнении гипотез, чтобы уменьшить вероятность совершения ошибки первого рода. Она заключается в том, что уровень значимости αα делится на количество сравниваемых гипотез mm, чтобы скорректировать его в соответствии с числом проверок. Таким образом, скорректированный уровень значимости αкорр=αmα_{\text{корр}}= \frac{α}{m}.


Что такое p-value?

p-value показывает вероятность при верной нулевой гипотезе и выполненных предположениях теста получить значение статистики не менее экстремальное, чем наблюдаемое. Его сравнивают с заранее выбранным уровнем значимости $\alpha$.

Малое p-value говорит, что данные плохо согласуются с $H_0$, но не показывает вероятность истинности гипотезы, размер эффекта или практическую важность результата. Оно также не заменяет доверительный интервал и проверку предположений теста.


Как спланировать и провести A/B-тест?

До запуска фиксируют гипотезу, основную метрику, минимально значимый эффект, уровень ошибки, требуемую мощность и правило остановки. По ним рассчитывают размер выборки и длительность. Пользователей случайно и стабильно распределяют между контролем и вариантом, проверяют отсутствие пересечений и корректность сбора данных.

Во время эксперимента не меняют критерий успеха по увиденным результатам. После набора выборки оценивают эффект и доверительный интервал, проверяют статистическую и практическую значимость, баланс групп, sample ratio mismatch и побочные метрики. Решение принимают с учётом цены внедрения и рисков, а не только по условию p < 0.05.


Какие методы статистического тестирования вам известны?

Некоторые методы статистического тестирования включают t-тест, анализ дисперсии (ANOVA), тест хи-квадрат, тест Манна-Уитни, корреляционный анализ, и др. Эти методы используются для проверки гипотез о различиях между группами или взаимосвязях между переменными на основе статистических данных.


Что такое параметрические и непараметрические тесты?

Параметрические тесты предполагают определенное распределение данных (например, нормальное) и используют параметры этого распределения (например, среднее значение, дисперсия) при проведении статистических тестов, таких как t-тест или анализ дисперсии (ANOVA). Непараметрические тесты не предполагают конкретного распределения данных и обычно используются для сравнения рангов или медиан двух или более выборок, например, тест Уилкоксона или тест Манна-Уитни.


Как вычислять размер выборок в A/B тесте?

Для вычисления размера выборки в A/B тесте учитываются следующие факторы:

  • Базовая конверсия (baseline conversion rate)

  • Минимальный детектируемый эффект (minimum detectable effect)

  • Уровень значимости (significance level)

  • Мощность теста (power)

Размер выборки можно рассчитать через специальные формулы или онлайн-калькуляторы, учитывающие эти параметры.


Как понять как долго проводить A/B тест?

Время проведения A/B теста зависит от ожидаемого объёма трафика и целевой метрики. Используются такие факторы как:

  • Размер выборки

  • Скорость трафика

  • Целевые показатели статистической значимости и мощности теста.

Часто используют формулы или инструменты для расчёта минимального времени теста на основе этих факторов.


Как будем считать эффект от нашего A/B тест?

Эффект измеряется сравнением контрольной и тестовой групп по целевым метрикам, например, конверсии. Рассчитывают относительное изменение и проверяют его на статистическую значимость с помощью t-теста или других статистических тестов.


Какие выборки будут переданы в t-test, что там конкретно будет (физически)?

В t-тесте выборки представляют собой данные по двум группам: контрольной и тестовой. Это могут быть, например, значения конверсий, времени на сайте или других метрик, которые мы хотим сравнить.


Что происходит внутри t-test?

t-test вычисляет средние значения двух выборок и проверяет гипотезу о равенстве средних значений. Также, важно учитывать дисперсию выборок для точного расчёта.


Как после t-test считать p-value?

После вычисления t-статистики и числа степеней свободы p-value находят как вероятность получить не менее экстремальное значение при нулевой гипотезе. Для двустороннего теста это 2 × P(T ≥ |t|). scipy.stats.ttest_ind возвращает и статистику, и p-value; выбор односторонней или двусторонней альтернативы задают заранее.


Почему срок A/B-теста скоринговой модели длиннее срока набора выборки?

Набрать нужное число заявок недостаточно: целевой исход скоринга, например дефолт за 90 дней, становится известен только после окна наблюдения. Поэтому срок равен времени набора выборки плюс созревание исходов и лаг данных. Размер задают по baseline, MDE, мощности, доле одобрений и кластеризации, если она есть. Ранние прокси вроде первой просрочки могут ускорить сигнал только после проверки связи с конечным loss. Анализ проводят по когортам выдачи с одинаково полным окном.


Как оценить распределение разницы конверсий в A/B-тесте?

При независимых группах оценки конверсий имеют биномиальную дисперсию. Разницу p_B - p_A можно приблизить нормальным распределением со стандартной ошибкой из обеих групп и построить доверительный интервал. При достаточном числе успехов это удобно. Бутстреп дает эмпирическое распределение, но ресемплировать надо единицу рандомизации, обычно пользователя, а не события. Для малых счетчиков лучше точные или score-интервалы. Распределение оценки описывает неопределенность эффекта, а не разброс индивидуальных конверсий.


Какие онлайн-метрики нужны для A/B-теста кредитного скоринга?

Главная метрика должна отражать бизнес-результат с учетом одобрений и дефолтов, например прибыль или ожидаемый loss на выданный кредит. Рядом смотрят approval rate, bad rate и просрочку по зрелым когортам, объем выдач и calibration риска. Нужны guardrails по fairness, жалобам, ручным проверкам, latency и операционной емкости. ROC-AUC на заявках показывает ранжирование, но не доказывает прибыльность политики. Эксперимент оценивает связку модели, порога и процесса принятия решения.


Как ускорить A/B-тест без роста ложноположительных результатов?

Снизить требуемую выборку помогают уменьшение дисперсии и более чувствительная метрика: CUPED с предэкспериментальными данными, стратификация и корректная агрегация на единицу рандомизации. Календарный срок сокращает рост потока, но не произвольный просмотр результата. Proxy-метрика допустима после валидации связи с целью. Для ранней остановки используют заранее заданный group-sequential или другой sequential design с контролем ошибки первого рода. Обычный peeking и остановка при p < 0,05 увеличивают ложноположительные результаты.


Как рандомизировать магазины между группами эксперимента?

Единицей рандомизации делают магазин, потому что цена и поведение покупателей внутри магазина связаны. До теста магазины стратифицируют или матчят по региону, формату, размеру и историческим метрикам, затем случайно назначают варианты внутри страт. Связанные магазины или общие зоны спроса лучше держать в одном кластере. Баланс проверяют только по данным до теста. Анализ учитывает кластерный дизайн и число магазинов, а не притворяется, что каждая покупка независима.


Как спроектировать эксперимент для алгоритма цен в физическом ритейле?

Обычно рандомизируют магазины, регионы или временные кластеры, чтобы одна точка не применяла две цены одновременно. Главной метрикой лучше брать маржинальную прибыль, а не выручку. Guardrails включают объем продаж, списания, наличие товара, жалобы и долю ручных корректировок. Дизайн учитывает промо, сезонность, различия форматов и spillover, когда покупатель сравнивает соседние магазины. Анализ ведут на уровне единицы рандомизации с кластерными стандартными ошибками и заранее заданным горизонтом.


Когда выбрать t-тест, а когда критерий Манна-Уитни?

Для двух независимых групп t-тест оценивает разницу средних. Обычно выбирают вариант Welch, который не требует равных дисперсий; при достаточной выборке он устойчив к умеренной ненормальности, но чувствителен к тяжелым хвостам и выбросам. Манна-Уитни сравнивает ранги; стандартная нулевая гипотеза предполагает одинаковые распределения. Статистика связана с вероятностью превосходства одного наблюдения над другим с поправкой на совпадения. Критерий не выявляет любое возможное различие распределений. Это не универсальный тест медиан. Интерпретировать его как сдвиг можно лишь при сходной форме распределений.


Что такое уровень значимости?

Уровень значимости - это вероятность отвергнуть нулевую гипотезу, когда она на самом деле верна. Обычно обозначается символом α (альфа) и выбирается заранее исследователем. В научных исследованиях типичные значения α составляют 0.05 или 0.01, что соответствует вероятности ошибки первого рода в 5% или 1% соответственно.


Как решить проблему множественной проверки выборок на соответствие гипотезы?

Для решения проблемы множественной проверки выборок на соответствие гипотезе можно использовать методы поправки, такие как метод Бонферрони, метод Холма или метод Бенджамини-Хохберга. Эти методы позволяют скорректировать уровень значимости для компенсации увеличенного риска ложноположительных результатов при множественных сравнениях.

Собеседования: Data Science

Смотри записи интервью, узнай, какие вопросы задают и как отвечают кандидаты.

Вопросы и ответы

Не нашли ответ? Напишите мне в чат. Я делаю Шпаргалку и сам отвечаю на сообщения. Расскажите, что не работает или чего вам не хватает. Может, смогу сразу взять это в работу.

Откуда взяты вопросы?

Из реальных собеседований. Основой подборки стал опыт Вадима Новосёлова: он проходил интервью и записывал вопросы. Подробнее о материалах.

Насколько эти вопросы актуальны?

Эти вопросы встречались нам на реальных собеседованиях в 2025 году. Мы регулярно проходим собеседования и пополняем подборку новыми вопросами. Основы профессии и ключевые технологии остаются востребованными годами, а детали конкретных инструментов и версий стоит сверять с текущей документацией.

На какой уровень рассчитана подборка?

Мы проходили собеседования на вакансии уровня Middle+, а иногда и на Senior-позиции. Вопросы из этих интервью вошли в подборку. Направления работы: Data Scientist, ML-инженер. Глубина обсуждения зависит от вакансии: будь готов объяснить основную идею, привести практический пример и разобрать ограничения и альтернативы решения.

Этот вопрос точно будет на моём собеседовании?

Гарантии нет: набор вопросов зависит от компании, задач команды, уровня вакансии и самого интервьюера. Эти вопросы уже встречались на реальных собеседованиях, но на твоём интервью ту же тему могут проверить другой формулировкой, практической задачей или обсуждением твоего опыта. Используй подборку, чтобы разобраться в теме: объясняй идею своими словами, приводи примеры и готовься обсудить ограничения и альтернативы решения. Так будет проще ответить и на знакомый вопрос, и на неожиданные уточнения.