Перейти к содержимому
шпаргалка.
Esc
навигацияоткрыть⌘Jпредпросмотр
На этой странице

Логистическая регрессия

Все темы Data Scientist

Как работает логистическая регрессия и какую функцию потерь она использует?

Логистическая регрессия - это метод классификации, который используется для прогнозирования вероятности принадлежности наблюдения к определенному классу. Принцип работы логистической регрессии заключается в преобразовании линейной комбинации признаков в вероятности с использованием сигмоидной функции (логистической функции).

Функция потерь, обычно используемая для логистической регрессии, называется кросс-энтропией (или логистической функцией потерь). Она измеряет разницу между фактическими и предсказанными вероятностями классов и минимизируется в процессе обучения модели.


Как записывают и обучают логистическую регрессию и проверяют значимость коэффициентов?

Формула логистической регрессии выглядит следующим образом:

P(y=1x)=11+e(β0+β1x1+β2x2+...+βnxn)P(y=1|x) = \frac{1}{1 + e^{-(\beta_0 + \beta_1 x_1 + \beta_2 x_2 + ... + \beta_n x_n)}}

где:

  • P(y=1x)P(y=1|x) - вероятность того, что целевая переменная yy равна 1 при условии значений предикторов xx.

  • β0,β1,β2,...,βn\beta_0, \beta_1, \beta_2, ..., \beta_n - коэффициенты модели, которые необходимо оценить.

  • x1,x2,...,xnx_1, x_2, ..., x_n - значения предикторов.

Обучение логистической регрессии осуществляется путем минимизации функции потерь, такой как кросс-энтропия, с использованием методов оптимизации, таких как градиентный спуск или его вариации.

В обычной логистической регрессии без регуляризации значимость отдельного коэффициента часто проверяют тестом Вальда: z-статистика равна оценке коэффициента, делённой на её стандартную ошибку. Для сравнения вложенных моделей используют тест отношения правдоподобий. Проверяйте предпосылки модели и способ расчёта стандартных ошибок; обычный t-тест линейной регрессии нельзя переносить сюда автоматически.


Как записываются модель и функция потерь логистической регрессии?

Логистическая регрессия — это статистическая модель, используемая для оценки вероятности принадлежности к определённому классу (обычно бинарному). Она широко применяется в машинном обучении для задач классификации.

Математическая модель:

Основой логистической регрессии является логистическая функция, также называемая сигмоидной функцией, которая описывается формулой:

σ(z)=11+ez\sigma(z) = \frac{1}{1 + e^{-z}}

где zz — это линейная комбинация входных признаков xx и их весов ww, плюс свободный член bb:

z=w1x1+w2x2++wnxn+bz = w_1x_1 + w_2x_2 + \ldots + w_nx_n + b

Вероятность и классификация:

Логистическая регрессия моделирует вероятность P(y=1x)P(y=1|x) того, что пример xx принадлежит классу y=1y=1, как:

P(y=1x)=σ(wx+b)P(y=1|x) = \sigma(w \cdot x + b)

где wxw \cdot x обозначает скалярное произведение векторов весов и признаков, а bb — смещение (bias).

Обучение модели:

Цель обучения — найти параметры ww и bb, которые минимизируют ошибку между предсказанными и истинными метками. В логистической регрессии часто используется функция потерь, называемая логистической потерей или перекрёстной энтропией:

L(y,y^)=[ylog(y^)+(1y)log(1y^)]L(y, \hat{y}) = -[y \log(\hat{y}) + (1 - y) \log(1 - \hat{y})]

где yy — истинная метка, а y^\hat{y} — предсказанная вероятность.

Оптимизация:

Для минимизации функции потерь обычно используют методы оптимизации, такие как градиентный спуск. В каждом шаге веса ww и смещение bb обновляются в направлении, уменьшающем функцию потерь.

Логистическая регрессия эффективна для задач, где искомые зависимости в данных могут быть аппроксимированы линейной зависимостью, и она является фундаментом для многих других методов машинного обучения.


Как связаны сигмоида, логит и граница классов в логистической регрессии?

Формула логистической регрессии: P(y=1x)=11+ezP(y=1∣x)= \frac{1}{1+e^{-z}}

где P(y=1x)P(y=1∣x) - вероятность принадлежности к классу 1 для входного признака xx, ee - основание натурального логарифма, zz - линейная комбинация входных признаков с их весами:

z=w1x1+w2x2++wnxn+bz = w_1x_1 + w_2x_2 + \ldots + w_nx_n + b

Логит — логарифм отношения вероятности класса 1 к вероятности класса 0: logit(p)=logp1p=z\operatorname{logit}(p)=\log\frac{p}{1-p}=z при 0 < p < 1. Здесь p — вероятность класса 1, а z — линейная комбинация признаков до применения сигмоиды. Не следует путать логит с бинарной кросс-энтропией — функцией потерь для обучения модели.

Для получения метки класса задают порог t: при p ≥ t выбирают класс 1. При t = 0,5 это равносильно z ≥ 0, поэтому граница решений линейна в используемых признаках. Порог выбирают с учётом стоимости ошибок и требований задачи. Параметры модели обучают, минимизируя логистическую потерю; без регуляризации это эквивалентно максимизации правдоподобия.

Эта страница была полезной?