Перейти к содержимому
На этой странице

Теория вероятностей и статистическое оценивание

Все темы Data Scientist

Подтемы:

Если в комнате находится 3 человека, какова вероятность того, что по крайней мере двое из них будут одного пола?

Если в модели задачи допускаются только две категории пола, среди трёх человек хотя бы двое неизбежно относятся к одной категории. Вероятность равна 1 по принципу Дирихле. Ниже рассмотрим другое событие: в комнате представлены обе категории.

Пусть:
  • P(M)P(M) - вероятность того, что человек мужского пола

  • P(F)P(F) - вероятность того, что человек женского пола

Тогда:
  • Вероятность того, что все три человека будут мужчинами: P(M)P(M)P(M)P(M) _ P(M) _ P(M)

  • Вероятность того, что все три человека будут женщинами: P(F)P(F)P(F)P(F) _ P(F) _ P(F)

Вероятность того, что в комнате представлены обе категории, при независимом выборе равна:

1 - (Вероятность всех мужчин + Вероятность всех женщин)

Это вероятность смешанной группы, а не ответ исходной задачи. Для исходного вопроса при двух категориях ответ всегда 1.


Как справедливо выбрать между А и Б с помощью монеты с неизвестным смещением вероятностей?

Если обе стороны монеты имеют разную вероятность выпадения, то можно использовать следующую стратегию для получения справедливого результата:

  1. Бросайте монету дважды. Пусть вероятность орла постоянна, броски независимы и 0 < p < 1.

  2. Орёл-решка означает победу А, решка-орёл означает победу Б. При двух одинаковых результатах повторите пару бросков.

  3. Вероятности орёл-решка и решка-орёл равны p(1 − p), поэтому оба игрока имеют одинаковые шансы.

Это метод фон Неймана. При p = 0 или p = 1 он не завершится; независимость и постоянство вероятности существенны.


Из 100 монет одна с двумя орлами. Случайно выбранная монета выпала орлом. Какова вероятность, что она фальшивая?

Чтобы решить эту задачу, мы можем использовать формулу условной вероятности. Пусть:

  • AA - событие, что выбранная монета фальшивая.

  • BB - событие, что выбранная монета выпадает орлом вверх.

Тогда мы хотим найти вероятность события A при условии события B, то есть P(A∣B)P(A|B).

Используем формулу условной вероятности:

P(A∣B)=P(A∣B)= P(A∩B)P(B)\frac {P(A∩B)}{P(B)}

Теперь оценим вероятности:

  • P(A)=1100(A)= \frac{1}{100}, так как в мешке 100 монет, и только одна из них фальшивая.

  • P(B∣A)=1P(B∣A)=1, так как фальшивая монета всегда выпадает орлом вверх.

  • P(B)P(B) - это вероятность того, что монета выпадет орлом вверх. Так как у нас есть только одна фальшивая монета, а мы знаем, что она выпадает орлом вверх, то

    P(B)=P(B∣A)⋅P(A)+P(B∣A^)⋅P(A^)=1⋅1100+12⋅99100.P(B)=P(B∣A)⋅P(A)+P(B∣\hat{A})⋅P(\hat{A}) = 1⋅\frac{1}{100}+ \frac{1}{2}⋅ \frac{99}{100}.

Теперь можем найти P(A∣B)P(A∣B):

P(A∣B)=1⋅11001⋅1100+12⋅99100P(A∣B)= \frac{1 \cdot \frac{1}{100}}{1 \cdot \frac{1}{100} + \frac{1}{2} \cdot \frac{99}{100}}

Вычислив это выражение, мы получим вероятность того, что выбранная монета является фальшивой, при условии, что она выпала орлом вверх.


Расскажите как работает закон больших чисел. (ЗБЧ)

Закон больших чисел - это математическая теорема, утверждающая, что с увеличением числа испытаний среднее значение случайной величины стабилизируется и приближается к математическому ожиданию этой случайной величины. Другими словами, чем больше испытаний, тем ближе среднее значение к ожидаемому значению.


Какие типы распределений чаще всего используются в практике?

В практике наиболее часто используются следующие типы распределений:

  1. Нормальное распределение (гауссовское): широко применяется в статистике из-за центральной предельной теоремы и подходит для моделирования многих естественных явлений.

  2. Равномерное распределение: все значения в интервале имеют одинаковую вероятность, часто используется в случайных экспериментах.

  3. Биномиальное распределение: описывает количество успехов в серии независимых и одинаково распределенных испытаний.

  4. Экспоненциальное распределение: используется для моделирования времени между двумя последовательными событиями в процессе Пуассона.

  5. Пуассоновское распределение: описывает количество событий, произошедших за фиксированный период времени или в фиксированном объеме пространства, при условии, что эти события происходят с фиксированной средней интенсивностью и независимо друг от друга.


Чем различаются распределения Бернулли и биномиальное, их математические ожидания и дисперсии?

Распределение Бернулли является частным случаем биномиального распределения, где проводится только одно испытание. Оно описывает случайную переменную, которая принимает только два значения: успех (обычно обозначается как 1) и неудачу (обычно обозначается как 0).

Интерпретация распределения Бернулли - это модель случайного эксперимента с двумя возможными исходами, где вероятность успеха (обычно обозначается как pp) и вероятность неудачи (1−p)(1 - p) известны.

Математическое ожидание для распределения Бернулли равно вероятности успеха (p)(p), а дисперсия равна p∗(1−p)p * (1 - p).

Биномиальное распределение расширяет концепцию распределения Бернулли на случай проведения нескольких независимых испытаний, где вероятность успеха (p)(p) остается const. Оно описывает количество успехов в серии независимых и одинаково распределенных испытаний.

Интерпретация биномиального распределения - это вероятность получить kk успехов в nn испытаниях, где вероятность успеха (p)(p) остается постоянной для всех испытаний.

Математическое ожидание для биномиального распределения равно npn _ p, а дисперсия равна np∗(1−p)n _ p * (1 - p).


Как проверить, что распределение нормальное?

Для проверки нормальности распределения можно использовать статистические тесты, такие как тесты Колмогорова-Смирнова, Шапиро-Уилка, или анализ квантилей (Q-Q plot). В кратком варианте:

  1. Тест Колмогорова-Смирнова: Проверяет, насколько хорошо ваше распределение соответствует нормальному распределению. Если p-value низкое (обычно меньше 0.05), то это говорит о том, что распределение значимо отличается от нормального.

  2. Тест Шапиро-Уилка: Этот тест также проверяет нормальность данных. Если p-value меньше выбранного уровня значимости, то гипотеза о нормальности отвергается.

  3. Q-Q plot: Этот график сравнивает квантили вашего распределения с квантилями нормального распределения. Если точки на графике лежат примерно на прямой линии, то распределение близко к нормальному. Если они значительно отклоняются, то распределение отличается от нормального.

Большое p-value означает, что тест не обнаружил достаточных оснований отвергнуть нормальность при своём размере выборки. Оно не доказывает нормальность. Q-Q plot служит визуальной диагностикой и не имеет p-value.


Чем MAP-оценка отличается от максимального правдоподобия?

MLE выбирает параметры, максимизирующие likelihood наблюдаемых данных. MAP максимизирует posterior: p(theta|data) пропорционален p(data|theta) * p(theta), поэтому учитывает prior. При плоском prior MAP совпадает с MLE в допустимой области. В log-шкале отрицательный log-prior становится регуляризатором: Gaussian prior соответствует L2, Laplace prior связан с L1. MAP дает точечную оценку и не заменяет полный Bayesian posterior или учет неопределенности параметров.


Что такое метод максимального правдоподобия?

Метод максимального правдоподобия оценивает параметры модели, выбирая значение $\hat\theta$, при котором наблюдённые данные имеют наибольшее правдоподобие:

θ^=arg⁡max⁡θL(θ;x)=arg⁡max⁡θ∏ip(xi∣θ).\hat\theta = \arg\max_\theta L(\theta; x) = \arg\max_\theta \prod_i p(x_i \mid \theta).

На практике обычно максимизируют логарифм правдоподобия: сумма логарифмов проще произведения и имеет тот же максимум. Правдоподобие рассматривают как функцию параметров при фиксированных данных; это не вероятность того, что параметр истинен.


В чём смысл центральной предельной теоремы?

Для независимых одинаково распределённых случайных величин с конечными средним $\mu$ и дисперсией $\sigma^2$ стандартизированное выборочное среднее сходится по распределению к стандартному нормальному закону:

n(Xˉn−μ)σ→dN(0,1).\frac{\sqrt n(\bar X_n-\mu)}{\sigma} \xrightarrow{d} N(0,1).

Поэтому при достаточно большом $n$ среднее примерно распределено как $N(\mu, \sigma^2/n)$, даже если исходное распределение не нормальное. Теорема не утверждает, что сами наблюдения становятся нормальными, а качество приближения зависит от исходного распределения.


Как вычисляются доверительные интервалы?

Доверительный интервал строят по выборке для неизвестного параметра. Уровень 95% означает, что при повторении процедуры около 95% построенных интервалов накрывают истинный параметр. Для среднего при подходящих предположениях используют выборочное среднее плюс-минус критическое значение, умноженное на стандартную ошибку. Это свойство процедуры, а не вероятность положения фиксированного параметра в уже вычисленном интервале.


Где и как применяется Bootstrap?

Bootstrap применяется в статистике для оценки доверительных интервалов и стандартных ошибок параметров путем многократного выбора выборок из имеющихся данных с заменой. Этот метод позволяет оценить распределение выборочной статистики и провести статистические выводы о параметрах генеральной совокупности. Bootstrap широко используется в анализе данных, машинном обучении и других областях, где требуется оценка неопределенности и статистическая проверка гипотез.

Собеседования: Data Science

Смотри записи интервью, узнай, какие вопросы задают и как отвечают кандидаты.

Вопросы и ответы

Не нашли ответ? Напишите мне в чат. Я делаю Шпаргалку и сам отвечаю на сообщения. Расскажите, что не работает или чего вам не хватает. Может, смогу сразу взять это в работу.

Откуда взяты вопросы?

Из реальных собеседований. Основой подборки стал опыт Вадима Новосёлова: он проходил интервью и записывал вопросы. Подробнее о материалах.

Насколько эти вопросы актуальны?

Эти вопросы встречались нам на реальных собеседованиях в 2025 году. Мы регулярно проходим собеседования и пополняем подборку новыми вопросами. Основы профессии и ключевые технологии остаются востребованными годами, а детали конкретных инструментов и версий стоит сверять с текущей документацией.

На какой уровень рассчитана подборка?

Мы проходили собеседования на вакансии уровня Middle+, а иногда и на Senior-позиции. Вопросы из этих интервью вошли в подборку. Направления работы: Data Scientist, ML-инженер. Глубина обсуждения зависит от вакансии: будь готов объяснить основную идею, привести практический пример и разобрать ограничения и альтернативы решения.

Этот вопрос точно будет на моём собеседовании?

Гарантии нет: набор вопросов зависит от компании, задач команды, уровня вакансии и самого интервьюера. Эти вопросы уже встречались на реальных собеседованиях, но на твоём интервью ту же тему могут проверить другой формулировкой, практической задачей или обсуждением твоего опыта. Используй подборку, чтобы разобраться в теме: объясняй идею своими словами, приводи примеры и готовься обсудить ограничения и альтернативы решения. Так будет проще ответить и на знакомый вопрос, и на неожиданные уточнения.