Линейные модели и метод наименьших квадратов
Подтемы:
Как работает линейная регрессия, какую функцию потерь использует и чем опасны большие веса?
Линейная регрессия - это метод статистического моделирования, используемый для анализа отношений между зависимой переменной и одной или несколькими независимыми переменными. Принцип работы линейной регрессии заключается в поиске линейной зависимости между независимыми и зависимой переменными путем подбора оптимальных весовых коэффициентов.
Преимущества линейной регрессии включают:
-
Простота и интерпретируемость: линейные модели легко интерпретировать и объяснить.
-
Эффективность: линейная регрессия имеет низкую вычислительную сложность и может быть быстро обучена на больших наборах данных.
-
Гибкость: линейная регрессия может быть легко расширена для учета сложных отношений между переменными, включая полиномиальные и взаимодействующие признаки.
Функция потерь, обычно используемая для линейной регрессии, - это среднеквадратичная ошибка (MSE), которая измеряет среднеквадратичное отклонение предсказанных значений от фактических значений.
Одной из проблем, связанных с большими значениями весовых коэффициентов, является переобучение модели. Большие веса могут привести к чрезмерной адаптации к обучающим данным, что ухудшит обобщающую способность модели на новых данных. Для борьбы с этой проблемой часто используются методы регуляризации, такие как L1 (Lasso) и L2 (Ridge) регрессии, которые штрафуют за большие значения весовых коэффициентов, помогая уменьшить их размер и предотвратить переобучение.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- Успешное собеседование на Data Science | Middle ML Developer · 4:30–7:30Разбор интервью · Ответ кандидата
Кандидат описывает линейную регрессию как линейную зависимость, объясняет добавление L1/L2-регуляризации к функции потерь и риск больших весов: небольшое изменение признака вызывает сильное изменение прогноза.
В чём основная проблема линейной регрессии в машинном обучении?
Основная проблема линейной регрессии заключается в том, что она может плохо справляться с моделированием сложных нелинейных зависимостей между признаками и целевой переменной. Линейная регрессия предполагает линейную связь между признаками и целевой переменной, что может быть недостаточно для точного предсказания в случае сложных данных.
Ссылки для изучения
Аналитическая регрессия что это такое, как решать?
Термин “аналитическая регрессия” неоднозначен. Если речь об аналитическом решении линейной регрессии методом наименьших квадратов, веса находят из нормальных уравнений. При полном столбцовом ранге решение единственно; в вычислениях обычно используют QR- или SVD-разложение, избегая явного обращения матрицы.
Ссылки для изучения
Что представляет собой Теорема Гаусса-Маркова?
Теорема утверждает, что при выполнении определённых условий (линейности модели, гомоскедастичности, отсутствия автокорреляции и пр.), линейные оценки методом наименьших квадратов являются лучшими линейными несмещёнными оценками (BLUE).
Ссылки для изучения
Может ли регрессия предсказать отрицательное значение при положительном таргете?
Да. Линейная регрессия имеет неограниченный выход и может дать отрицательный прогноз даже при положительных train-таргетах. Дерево регрессии обычно предсказывает среднее в листе и не выходит за диапазон обучающих таргетов, как и обычный KNN с положительными весами, но плохо экстраполирует. Если отрицательные значения невозможны, можно моделировать log(y) с корректным обратным преобразованием, выбрать распределение с положительной link-функцией или применить ограниченную модель. Простое clipping искажает ошибки и calibration.
Ссылки для изучения
Примеры хороших ответов из реальных собеседований
- Успешное собеседование на Data Science | Middle ML Developer · 13:33–14:50Разбор интервью · Совместный разбор
Кандидат объясняет, почему линейная регрессия может дать значение вне диапазона обучающего target, и сравнивает её с деревьями и forest.
Как работает логистическая регрессия и какую функцию потерь она использует?
Логистическая регрессия - это метод классификации, который используется для прогнозирования вероятности принадлежности наблюдения к определенному классу. Принцип работы логистической регрессии заключается в преобразовании линейной комбинации признаков в вероятности с использованием сигмоидной функции (логистической функции).
Функция потерь, обычно используемая для логистической регрессии, называется кросс-энтропией (или логистической функцией потерь). Она измеряет разницу между фактическими и предсказанными вероятностями классов и минимизируется в процессе обучения модели.
Ссылки для изучения
Как записывают и обучают логистическую регрессию и проверяют значимость коэффициентов?
Формула логистической регрессии выглядит следующим образом:
где:
-
- вероятность того, что целевая переменная равна 1 при условии значений предикторов .
-
- коэффициенты модели, которые необходимо оценить.
-
- значения предикторов.
Обучение логистической регрессии осуществляется путем минимизации функции потерь, такой как кросс-энтропия, с использованием методов оптимизации, таких как градиентный спуск или его вариации.
В обычной логистической регрессии без регуляризации значимость отдельного коэффициента часто проверяют тестом Вальда: z-статистика равна оценке коэффициента, делённой на её стандартную ошибку. Для сравнения вложенных моделей используют тест отношения правдоподобий. Проверяйте предпосылки модели и способ расчёта стандартных ошибок; обычный t-тест линейной регрессии нельзя переносить сюда автоматически.
Ссылки для изучения
Как записываются модель и функция потерь логистической регрессии?
Логистическая регрессия — это статистическая модель, используемая для оценки вероятности принадлежности к определённому классу (обычно бинарному). Она широко применяется в машинном обучении для задач классификации.
Математическая модель:
Основой логистической регрессии является логистическая функция, также называемая сигмоидной функцией, которая описывается формулой:
где — это линейная комбинация входных признаков и их весов , плюс свободный член :
Вероятность и классификация:
Логистическая регрессия моделирует вероятность того, что пример принадлежит классу , как:
где обозначает скалярное произведение векторов весов и признаков, а — смещение (bias).
Обучение модели:
Цель обучения — найти параметры и , которые минимизируют ошибку между предсказанными и истинными метками. В логистической регрессии часто используется функция потерь, называемая логистической потерей или перекрёстной энтропией:
где — истинная метка, а — предсказанная вероятность.
Оптимизация:
Для минимизации функции потерь обычно используют методы оптимизации, такие как градиентный спуск. В каждом шаге веса и смещение обновляются в направлении, уменьшающем функцию потерь.
Логистическая регрессия эффективна для задач, где искомые зависимости в данных могут быть аппроксимированы линейной зависимостью, и она является фундаментом для многих других методов машинного обучения.
Ссылки для изучения
Как связаны сигмоида, логит и граница классов в логистической регрессии?
Формула логистической регрессии:где - вероятность принадлежности к классу 1 для входного признака , - основание натурального логарифма, - линейная комбинация входных признаков с их весами:
Логит — логарифм отношения вероятности класса 1 к вероятности класса 0: при 0 < p < 1. Здесь p — вероятность класса 1, а z — линейная комбинация признаков до применения сигмоиды. Не следует путать логит с бинарной кросс-энтропией — функцией потерь для обучения модели.
Для получения метки класса задают порог t: при p ≥ t выбирают класс 1. При t = 0,5 это равносильно z ≥ 0, поэтому граница решений линейна в используемых признаках. Порог выбирают с учётом стоимости ошибок и требований задачи. Параметры модели обучают, минимизируя логистическую потерю; без регуляризации это эквивалентно максимизации правдоподобия.
Ссылки для изучения
Что такое метод наименьших квадратов (МНК)?
Метод наименьших квадратов (МНК) - это статистический метод, используемый для оценки параметров линейной модели путем минимизации суммы квадратов разностей между наблюдаемыми значениями и значениями, предсказанными моделью. В основе МНК лежит принцип нахождения “наилучшей” прямой (или плоскости в случае многомерных данных), которая наилучшим образом соответствует набору данных. Этот метод широко используется в регрессионном анализе для оценки параметров линейной зависимости между переменными.
Ссылки для изучения
Почему МНК минимизирует квадраты ошибок, а не кубы?
Квадраты неотрицательны, поэтому ошибки разных знаков не компенсируются. Для линейной модели сумма квадратов образует гладкую выпуклую функцию, которую удобно оптимизировать; при гауссовском шуме её минимум совпадает с оценкой максимального правдоподобия.
Куб сохраняет знак: большие отрицательные ошибки могут уменьшать сумму, а целевая функция может быть не ограничена снизу. Чётные степени выше второй возможны, но ещё сильнее наказывают выбросы и усложняют оптимизацию. Квадратичная потеря тоже чувствительна к выбросам, поэтому при необходимости используют MAE или Huber loss.
Ссылки для изучения







