Теория вероятностей и статистическое оценивание
Подтемы:
- Теория вероятности
- Статистические распределения
- Теория оценок
- Метод максимального правдоподобия
- Центральная предельная теорема
- Доверительные интервалы
- Bootstrap
Если в комнате находится 3 человека, какова вероятность того, что по крайней мере двое из них будут одного пола?
Если в модели задачи допускаются только две категории пола, среди трёх человек хотя бы двое неизбежно относятся к одной категории. Вероятность равна 1 по принципу Дирихле. Ниже рассмотрим другое событие: в комнате представлены обе категории.
Пусть:-
- вероятность того, что человек мужского пола
-
- вероятность того, что человек женского пола
-
Вероятность того, что все три человека будут мужчинами:
-
Вероятность того, что все три человека будут женщинами:
Вероятность того, что в комнате представлены обе категории, при независимом выборе равна:
1 - (Вероятность всех мужчин + Вероятность всех женщин)
Это вероятность смешанной группы, а не ответ исходной задачи. Для исходного вопроса при двух категориях ответ всегда 1.
Ссылки для изучения
Как справедливо выбрать между А и Б с помощью монеты с неизвестным смещением вероятностей?
Если обе стороны монеты имеют разную вероятность выпадения, то можно использовать следующую стратегию для получения справедливого результата:
-
Бросайте монету дважды. Пусть вероятность орла постоянна, броски независимы и 0 < p < 1.
-
Орёл-решка означает победу А, решка-орёл означает победу Б. При двух одинаковых результатах повторите пару бросков.
-
Вероятности орёл-решка и решка-орёл равны p(1 − p), поэтому оба игрока имеют одинаковые шансы.
Это метод фон Неймана. При p = 0 или p = 1 он не завершится; независимость и постоянство вероятности существенны.
Ссылки для изучения
Из 100 монет одна с двумя орлами. Случайно выбранная монета выпала орлом. Какова вероятность, что она фальшивая?
Чтобы решить эту задачу, мы можем использовать формулу условной вероятности. Пусть:
-
- событие, что выбранная монета фальшивая.
-
- событие, что выбранная монета выпадает орлом вверх.
Тогда мы хотим найти вероятность события A при условии события B, то есть .
Используем формулу условной вероятности:
Теперь оценим вероятности:
-
P, так как в мешке 100 монет, и только одна из них фальшивая.
-
, так как фальшивая монета всегда выпадает орлом вверх.
-
- это вероятность того, что монета выпадет орлом вверх. Так как у нас есть только одна фальшивая монета, а мы знаем, что она выпадает орлом вверх, то
Теперь можем найти :
Вычислив это выражение, мы получим вероятность того, что выбранная монета является фальшивой, при условии, что она выпала орлом вверх.
Ссылки для изучения
Расскажите как работает закон больших чисел. (ЗБЧ)
Закон больших чисел - это математическая теорема, утверждающая, что с увеличением числа испытаний среднее значение случайной величины стабилизируется и приближается к математическому ожиданию этой случайной величины. Другими словами, чем больше испытаний, тем ближе среднее значение к ожидаемому значению.
Ссылки для изучения
Какие типы распределений чаще всего используются в практике?
В практике наиболее часто используются следующие типы распределений:
-
Нормальное распределение (гауссовское): широко применяется в статистике из-за центральной предельной теоремы и подходит для моделирования многих естественных явлений.
-
Равномерное распределение: все значения в интервале имеют одинаковую вероятность, часто используется в случайных экспериментах.
-
Биномиальное распределение: описывает количество успехов в серии независимых и одинаково распределенных испытаний.
-
Экспоненциальное распределение: используется для моделирования времени между двумя последовательными событиями в процессе Пуассона.
-
Пуассоновское распределение: описывает количество событий, произошедших за фиксированный период времени или в фиксированном объеме пространства, при условии, что эти события происходят с фиксированной средней интенсивностью и независимо друг от друга.
Ссылки для изучения
Чем различаются распределения Бернулли и биномиальное, их математические ожидания и дисперсии?
Распределение Бернулли является частным случаем биномиального распределения, где проводится только одно испытание. Оно описывает случайную переменную, которая принимает только два значения: успех (обычно обозначается как 1) и неудачу (обычно обозначается как 0).
Интерпретация распределения Бернулли - это модель случайного эксперимента с двумя возможными исходами, где вероятность успеха (обычно обозначается как ) и вероятность неудачи известны.
Математическое ожидание для распределения Бернулли равно вероятности успеха , а дисперсия равна .
Биномиальное распределение расширяет концепцию распределения Бернулли на случай проведения нескольких независимых испытаний, где вероятность успеха остается const. Оно описывает количество успехов в серии независимых и одинаково распределенных испытаний.
Интерпретация биномиального распределения - это вероятность получить успехов в испытаниях, где вероятность успеха остается постоянной для всех испытаний.
Математическое ожидание для биномиального распределения равно , а дисперсия равна .
Ссылки для изучения
Как проверить, что распределение нормальное?
Для проверки нормальности распределения можно использовать статистические тесты, такие как тесты Колмогорова-Смирнова, Шапиро-Уилка, или анализ квантилей (Q-Q plot). В кратком варианте:
-
Тест Колмогорова-Смирнова: Проверяет, насколько хорошо ваше распределение соответствует нормальному распределению. Если p-value низкое (обычно меньше 0.05), то это говорит о том, что распределение значимо отличается от нормального.
-
Тест Шапиро-Уилка: Этот тест также проверяет нормальность данных. Если p-value меньше выбранного уровня значимости, то гипотеза о нормальности отвергается.
-
Q-Q plot: Этот график сравнивает квантили вашего распределения с квантилями нормального распределения. Если точки на графике лежат примерно на прямой линии, то распределение близко к нормальному. Если они значительно отклоняются, то распределение отличается от нормального.
Большое p-value означает, что тест не обнаружил достаточных оснований отвергнуть нормальность при своём размере выборки. Оно не доказывает нормальность. Q-Q plot служит визуальной диагностикой и не имеет p-value.
Ссылки для изучения
Чем MAP-оценка отличается от максимального правдоподобия?
MLE выбирает параметры, максимизирующие likelihood наблюдаемых данных. MAP максимизирует posterior: p(theta|data) пропорционален p(data|theta) * p(theta), поэтому учитывает prior. При плоском prior MAP совпадает с MLE в допустимой области. В log-шкале отрицательный log-prior становится регуляризатором: Gaussian prior соответствует L2, Laplace prior связан с L1. MAP дает точечную оценку и не заменяет полный Bayesian posterior или учет неопределенности параметров.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- 100 Data Science вопросов мидлу! Парень c Физтеха проходит собеседование · 5:14–5:52Мок-собеседование · Ответ кандидата
Кандидат последовательно определяет MLE и MAP: вероятность данных при параметрах и апостериорную вероятность параметров при наблюдаемых данных.
Что такое метод максимального правдоподобия?
Метод максимального правдоподобия оценивает параметры модели, выбирая значение $\hat\theta$, при котором наблюдённые данные имеют наибольшее правдоподобие:
На практике обычно максимизируют логарифм правдоподобия: сумма логарифмов проще произведения и имеет тот же максимум. Правдоподобие рассматривают как функцию параметров при фиксированных данных; это не вероятность того, что параметр истинен.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- 100 Data Science вопросов мидлу! Парень c Физтеха проходит собеседование · 5:14–5:31Мок-собеседование · Ответ кандидата
Краткое определение через выбор параметров модели, при которых наблюдаемая выборка имеет максимальное правдоподобие.
В чём смысл центральной предельной теоремы?
Для независимых одинаково распределённых случайных величин с конечными средним $\mu$ и дисперсией $\sigma^2$ стандартизированное выборочное среднее сходится по распределению к стандартному нормальному закону:
Поэтому при достаточно большом $n$ среднее примерно распределено как $N(\mu, \sigma^2/n)$, даже если исходное распределение не нормальное. Теорема не утверждает, что сами наблюдения становятся нормальными, а качество приближения зависит от исходного распределения.
Ссылки для изучения
Как вычисляются доверительные интервалы?
Доверительный интервал строят по выборке для неизвестного параметра. Уровень 95% означает, что при повторении процедуры около 95% построенных интервалов накрывают истинный параметр. Для среднего при подходящих предположениях используют выборочное среднее плюс-минус критическое значение, умноженное на стандартную ошибку. Это свойство процедуры, а не вероятность положения фиксированного параметра в уже вычисленном интервале.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- Аналитик данных | Собеседование | karpov.courses · 51:37–52:25Мок-собеседование · Объяснение интервьюера
Ведущий исправляет вероятностную трактовку и объясняет построение 95%-го доверительного интервала для среднего через повторные выборки.
Где и как применяется Bootstrap?
Bootstrap применяется в статистике для оценки доверительных интервалов и стандартных ошибок параметров путем многократного выбора выборок из имеющихся данных с заменой. Этот метод позволяет оценить распределение выборочной статистики и провести статистические выводы о параметрах генеральной совокупности. Bootstrap широко используется в анализе данных, машинном обучении и других областях, где требуется оценка неопределенности и статистическая проверка гипотез.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- РЕАЛЬНОЕ собеседование на Data Scientist. Алгоритмы + Python · 16:16–16:58Разбор интервью · Ответ кандидата
Кандидат объясняет bootstrap sampling с возвращением, out-of-bag наблюдения и обучение отдельных деревьев на bootstrap-подвыборках.







