Перейти к содержимому
шпаргалка.
Esc
навигацияоткрыть⌘Jпредпросмотр
На этой странице

Описательная статистика

Все темы Data Scientist

Что представляют собой среднее, медиана и мода? Как их можно определить на графике?

Определения:

  • Среднее: это сумма всех значений в выборке, разделенная на количество значений. Он представляет собой “среднюю” или “типичную” точку данных.

  • Медиана: это значение, которое делит упорядоченный список данных на две равные половины. Если количество значений нечетное, то медиана - это значение, находящееся посередине; если количество значений четное, то медиана - это среднее значение двух средних значений.

  • Мода: это значение или значения, которые встречаются наиболее часто в выборке. Мода может быть одна или несколько.

На графике среднее можно определить как центр масс точек данных, медиану - как значение, в котором половина данных находится выше, а другая половина - ниже, и моду - как пик или пики в гистограмме, представляющие наиболее часто встречающиеся значения.


Как изменится среднее, медиана и мода при добавлении 1-2 значений, которые являются большими по модулю?

При добавлении 1-2 значений, которые являются большими по модулю:

  • Среднее: может измениться сильно в сторону добавленных значений, особенно если они значительно отличаются от других значений в выборке.

  • Медиана: обычно меняется не так сильно, особенно если новые значения находятся далеко от центра распределения.

  • Мода: может остаться неизменной, если новые значения не повторяются или не повторяются достаточное количество раз для создания новых мод. Если новые значения повторяются и являются большинством, то мода изменится на эти значения.


Какой критерий используется для сравнения средних?

Для сравнения средних значений между двумя или более группами обычно используется t-критерий (например, t-тест Стьюдента) или его вариации, такие как:

  1. t-тест для независимых выборок: Используется для сравнения средних значений двух независимых групп.

  2. t-тест для зависимых выборок: Применяется для сравнения средних значений в парных выборках, например, до и после вмешательства.

  3. ANOVA (анализ дисперсии): Позволяет сравнивать средние значения более чем в двух группах.


Написать формулу кросс-энтропии. Как происходит минимизация ошибки?

Формула кросс-энтропии для бинарной классификации:

J(θ)=1mi=1m[y(i)log(hθ(x(i)))+(1y(i))log(1hθ(x(i)))]J(\theta) = -\frac{1}{m} \sum_{i=1}^{m} [y^{(i)} \log(h_{\theta}(x^{(i)})) + (1 - y^{(i)}) \log(1 - h_{\theta}(x^{(i)}))]

где:

  • J(θ)J(\theta) - функция потерь (кросс-энтропия),

  • mm - количество примеров в обучающем наборе,

  • y(i)y^{(i)} - истинное значение (0 или 1) целевой переменной для ii -го примера,

  • hθ(x(i))h_{\theta}(x^{(i)}) - предсказанная вероятность принадлежности к классу 1 для ii -го примера при параметрах модели θ\theta.

Минимизация ошибки (и, соответственно, минимизация функции потерь) происходит с помощью методов оптимизации, таких как градиентный спуск. Модель обновляет свои параметры θ\theta в направлении, противоположном градиенту функции потерь, с целью нахождения минимума функции потерь. Этот процесс повторяется до тех пор, пока не будет достигнута сходимость или другое условие останова.


Чем является мат. ожидание константы?

Математическое ожидание константы равно самой константе. Это представляет ожидаемое значение случайной величины, которая всегда принимает одно и то же значение, то есть не изменяется.


Для чего используется коэффициент корреляции Пирсона? Напишите формулу.

Коэффициент корреляции Пирсона используется для измерения степени линейной взаимосвязи между двумя переменными. Формула:

r=(xixˉ)(yiyˉ)(xixˉ)2(yiyˉ)2r = \frac{{\sum (x_i - \bar{x})(y_i - \bar{y})}}{{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}}

где:

  • rr - коэффициент корреляции Пирсона,

  • xix_i и yiy_i - значения переменных xx и yy для

    ii

    -го наблюдения,

  • xˉ\bar{x} и yˉ\bar{y} - средние значения переменных xx и yy соответственно.


Поправка Бонферрони.

Поправка Бонферрони - это метод коррекции уровня значимости при множественном сравнении гипотез, чтобы уменьшить вероятность совершения ошибки первого рода. Она заключается в том, что уровень значимости αα делится на количество сравниваемых гипотез mm, чтобы скорректировать его в соответствии с числом проверок. Таким образом, скорректированный уровень значимости αкорр=αmα_{\text{корр}}= \frac{α}{m}.


Что такое p-value?

p-value представляет вероятность получить не менее экстремальное значение статистики при верной нулевой гипотезе и выполненных предположениях теста. Его сравнивают с заранее выбранным уровнем значимости α. Само p-value не является уровнем значимости, вероятностью истинности гипотезы или размером эффекта.

Эта страница была полезной?