Основные понятия · часть 1
Как оценить статистическую значимость анализа?
Оценка статистической значимости анализа включает следующие шаги:
-
Формулировка гипотезы: Определение нулевой и альтернативной гипотезы, которые требуется проверить.
-
Выбор уровня значимости: Установка уровня значимости (обычно 0.05), который определяет вероятность ошибки первого рода при отклонении нулевой гипотезы.
-
Сбор данных и анализ: Сбор данных и применение соответствующих статистических тестов (например, t-тест, z-тест, анализ дисперсии и т.д.), чтобы оценить, насколько полученные данные противоречат нулевой гипотезе.
-
Расчет
p-value: Вычисление p-value, который показывает вероятность получить такие или более экстремальные результаты, если нулевая гипотеза верна. Меньший p-value означает более сильное статистическое противоречие нулевой гипотезе. -
Принятие или отвержение гипотезы: Сравнение полученного p-value с уровнем значимости. Если p-value меньше уровня значимости, нулевая гипотеза отвергается в пользу альтернативной, и результат считается статистически значимым.
Что такое центральная предельная теорема, и почему она важна?
В классической ЦПТ независимые одинаково распределённые величины имеют конечное среднее и конечную ненулевую дисперсию. Их центрированная сумма, делённая на стандартное отклонение суммы, сходится по распределению к стандартному нормальному закону. Это обосновывает нормальное приближение распределения среднего, но не делает нормальными исходные данные.
ЦПТ важна потому, что:
-
Обоснование использования статистических методов: Многие статистические методы, основанные на предположении о нормальном распределении данных (например, доверительные интервалы, тесты гипотез), могут быть применены благодаря ЦПТ.
-
Прогнозирование и планирование: ЦПТ позволяет прогнозировать вероятностные распределения средних значений выборок и оценивать доверительные интервалы для этих средних значений.
-
Условия применимости методов: Понимание ЦПТ помогает оценить, когда нормальное приближение данных является разумным предположением, а когда необходимо рассмотреть альтернативные методы анализа данных.
Как эксперимент помогает изучить поведение и чем его данные отличаются от наблюдательных?
Пример постановки эксперимента:
Вопрос: Какой тип музыки заставляет людей тратить больше времени в магазине?
Эксперимент: Разделение клиентов магазина на две случайные группы. Одной группе играют популярную музыку, а другой — классическую. Затем фиксируют время, проведённое каждой группой в магазине.
Анализ данных: Сравнение среднего времени, проведённого в магазине, между двумя группами.
Контраст с наблюдениями: Данные наблюдений могут показывать, что клиенты тратят разное количество времени в магазине в зависимости от типа музыки. Однако, без эксперимента, сложно установить причинно-следственную связь между музыкой и временем, проведённым в магазине. Эксперимент позволяет контролировать влияние других факторов и делает выводы более надёжными и объективными.
Что такое подъем (lift), ключевые показатели эффективности (KPI), робастность, обучение модели, планирование эксперимента, правило 80/20?
Ниже представлены описания для каждого термина:
-
Подъем (
lift): Это показатель, используемый в маркетинге и анализе данных, который измеряет увеличение отклика или эффективности маркетинговой кампании или модели прогнозирования. Он выражает, насколько лучше (или хуже) модель или стратегия работает по сравнению с базовым случаем. -
Ключевые показатели эффективности (
KPI): Это метрики, которые используются для измерения производительности или успеха в достижении целей организации или проекта. Примеры KPI могут включать выручку, конверсию, удержание клиентов и т.д. -
Робастность: Это свойство модели или алгоритма быть устойчивым к изменениям в данных или условиях работы. Робастная модель сохраняет высокое качество предсказаний даже при наличии шума или аномалий в данных.
-
Обучение модели: Процесс настройки параметров модели на основе данных, чтобы модель могла делать предсказания о новых данных. Обучение модели включает выбор алгоритма, оптимизацию параметров и оценку качества модели.
-
Планирование эксперимента: Это процесс разработки и организации эксперимента или тестирования для проверки гипотез или определения оптимальных условий. Это важный шаг для обеспечения надёжности результатов и минимизации влияния внешних факторов.
-
Правило 80/20: Это принцип, согласно которому примерно 80% результатов достигается через 20% усилий или ресурсов. Он используется для оптимизации управления временем и ресурсами в различных областях, включая управление проектами и анализ данных.
Дайте определение понятиям «обеспечение качества» и «шесть сигм».
Определения:
-
Обеспечение качества: Это процесс управления и улучшения качества продукции или услуг на всех этапах их жизненного цикла, включая планирование, контроль, обеспечение и улучшение качества.
-
Шесть сигм: Методология управления качеством, направленная на минимизацию дефектов продукции или процессов до уровня, соответствующего не более 3.4 дефекта на миллион возможностей. Основной инструмент для реализации шести сигм является DMAIC (определение, измерение, анализ, улучшение, контроль).
Что такое RCA (root cause analysis)? Как отличить причину от корреляции?
RCA (Root Cause Analysis) — это процесс
исследования и выявления основных причин проблемы или нежелательного события, а
не только её симптомов. Основная цель RCA — найти корневые причины,
которые, устранённые, могут предотвратить повторение проблемы.
-
Причина — это фактор или условие, непосредственно вызывающее определённое событие или результат. Причинная связь подразумевает, что изменение этого фактора изменит результат.
-
Корреляция — это статистическая связь между двумя или более переменными, показывающая, что они изменяются вместе. Однако корреляция не обязательно означает наличие причинной связи — одна переменная может быть связана с другой, но не вызывать её.
Например, если провести анализ и обнаружить, что рост продаж мороженого коррелирует с уровнем преступности, это не означает, что мороженое вызывает преступность. Это просто указывает на статистическую связь между этими переменными. RCA помогает выявить, что именно факторы, такие как жаркая погода (вызывающая и повышающая продажи мороженого) и временной фактор (увеличение активности на улице), могут быть корневыми причинами повышения уровня преступности.
Приведите пример, когда медиана лучше описывает данные, чем среднее значение.
Примером, когда медиана лучше описывает данные, чем среднее значение, может служить ситуация с выбросами или асимметричным распределением данных.
Например, рассмотрим группу из 10 человек, чьи доходы составляют $20,000, $25,000, $30,000, $35,000, $40,000, $45,000, $50,000, $55,000, $60,000, $1,000,000.
Сумма доходов равна 1 360 000, поэтому средний доход составляет .
Однако выброс в виде дохода $1,000,000 значительно повлиял на среднее значение, делая его не репрезентативным для большинства людей в этой группе.
Медиана, или значение посередине, будет равна $42,500, что более точно отражает “типичный” доход в этой группе людей без учета выброса. Таким образом, в случае наличия выбросов или асимметрии в данных медиана может быть предпочтительнее, поскольку она менее чувствительна к экстремальным значениям и лучше отражает центральную тенденцию набора данных.
Что такое Закон больших чисел?
Закон больших чисел — это математическая теорема, которая утверждает, что с увеличением числа испытаний (или наблюдений) среднее значение случайных величин стремится к их математическому ожиданию. Иными словами, при достаточно большом числе независимых испытаний или наблюдений среднее значение выборки будет близко к математическому ожиданию генеральной совокупности.
Существует два основных вида закона больших чисел:
-
Закон больших чисел в слабой форме (ЗБЧ): Утверждает, что среднее значение выборки сходится по вероятности к математическому ожиданию случайной величины при увеличении размера выборки.
-
Сильный закон больших чисел: при соответствующих условиях выборочное среднее сходится к математическому ожиданию почти наверное. Это другая теорема, не центральная предельная теорема.
Закон больших чисел является ключевым концептом в теории вероятностей и статистике, используемым для объяснения стабильности средних значений и оценок при достаточно больших объемах данных.