Перейти к содержимому
На этой странице

Линейные модели и метод наименьших квадратов

Все темы Data Scientist

Подтемы:

Как работает линейная регрессия, какую функцию потерь использует и чем опасны большие веса?

Линейная регрессия - это метод статистического моделирования, используемый для анализа отношений между зависимой переменной и одной или несколькими независимыми переменными. Принцип работы линейной регрессии заключается в поиске линейной зависимости между независимыми и зависимой переменными путем подбора оптимальных весовых коэффициентов.

Преимущества линейной регрессии включают:

  1. Простота и интерпретируемость: линейные модели легко интерпретировать и объяснить.

  2. Эффективность: линейная регрессия имеет низкую вычислительную сложность и может быть быстро обучена на больших наборах данных.

  3. Гибкость: линейная регрессия может быть легко расширена для учета сложных отношений между переменными, включая полиномиальные и взаимодействующие признаки.

Функция потерь, обычно используемая для линейной регрессии, - это среднеквадратичная ошибка (MSE), которая измеряет среднеквадратичное отклонение предсказанных значений от фактических значений.

Одной из проблем, связанных с большими значениями весовых коэффициентов, является переобучение модели. Большие веса могут привести к чрезмерной адаптации к обучающим данным, что ухудшит обобщающую способность модели на новых данных. Для борьбы с этой проблемой часто используются методы регуляризации, такие как L1 (Lasso) и L2 (Ridge) регрессии, которые штрафуют за большие значения весовых коэффициентов, помогая уменьшить их размер и предотвратить переобучение.


В чём основная проблема линейной регрессии в машинном обучении?

Основная проблема линейной регрессии заключается в том, что она может плохо справляться с моделированием сложных нелинейных зависимостей между признаками и целевой переменной. Линейная регрессия предполагает линейную связь между признаками и целевой переменной, что может быть недостаточно для точного предсказания в случае сложных данных.


Аналитическая регрессия что это такое, как решать?

Термин “аналитическая регрессия” неоднозначен. Если речь об аналитическом решении линейной регрессии методом наименьших квадратов, веса находят из нормальных уравнений. При полном столбцовом ранге решение единственно; в вычислениях обычно используют QR- или SVD-разложение, избегая явного обращения матрицы.


Что представляет собой Теорема Гаусса-Маркова?

Теорема утверждает, что при выполнении определённых условий (линейности модели, гомоскедастичности, отсутствия автокорреляции и пр.), линейные оценки методом наименьших квадратов являются лучшими линейными несмещёнными оценками (BLUE).


Может ли регрессия предсказать отрицательное значение при положительном таргете?

Да. Линейная регрессия имеет неограниченный выход и может дать отрицательный прогноз даже при положительных train-таргетах. Дерево регрессии обычно предсказывает среднее в листе и не выходит за диапазон обучающих таргетов, как и обычный KNN с положительными весами, но плохо экстраполирует. Если отрицательные значения невозможны, можно моделировать log(y) с корректным обратным преобразованием, выбрать распределение с положительной link-функцией или применить ограниченную модель. Простое clipping искажает ошибки и calibration.


Как работает логистическая регрессия и какую функцию потерь она использует?

Логистическая регрессия - это метод классификации, который используется для прогнозирования вероятности принадлежности наблюдения к определенному классу. Принцип работы логистической регрессии заключается в преобразовании линейной комбинации признаков в вероятности с использованием сигмоидной функции (логистической функции).

Функция потерь, обычно используемая для логистической регрессии, называется кросс-энтропией (или логистической функцией потерь). Она измеряет разницу между фактическими и предсказанными вероятностями классов и минимизируется в процессе обучения модели.


Как записывают и обучают логистическую регрессию и проверяют значимость коэффициентов?

Формула логистической регрессии выглядит следующим образом:

P(y=1∣x)=11+e−(β0+β1x1+β2x2+...+βnxn)P(y=1|x) = \frac{1}{1 + e^{-(\beta_0 + \beta_1 x_1 + \beta_2 x_2 + ... + \beta_n x_n)}}

где:

  • P(y=1∣x)P(y=1|x) - вероятность того, что целевая переменная yy равна 1 при условии значений предикторов xx.

  • β0,β1,β2,...,βn\beta_0, \beta_1, \beta_2, ..., \beta_n - коэффициенты модели, которые необходимо оценить.

  • x1,x2,...,xnx_1, x_2, ..., x_n - значения предикторов.

Обучение логистической регрессии осуществляется путем минимизации функции потерь, такой как кросс-энтропия, с использованием методов оптимизации, таких как градиентный спуск или его вариации.

В обычной логистической регрессии без регуляризации значимость отдельного коэффициента часто проверяют тестом Вальда: z-статистика равна оценке коэффициента, делённой на её стандартную ошибку. Для сравнения вложенных моделей используют тест отношения правдоподобий. Проверяйте предпосылки модели и способ расчёта стандартных ошибок; обычный t-тест линейной регрессии нельзя переносить сюда автоматически.


Как записываются модель и функция потерь логистической регрессии?

Логистическая регрессия — это статистическая модель, используемая для оценки вероятности принадлежности к определённому классу (обычно бинарному). Она широко применяется в машинном обучении для задач классификации.

Математическая модель:

Основой логистической регрессии является логистическая функция, также называемая сигмоидной функцией, которая описывается формулой:

σ(z)=11+e−z\sigma(z) = \frac{1}{1 + e^{-z}}

где zz — это линейная комбинация входных признаков xx и их весов ww, плюс свободный член bb:

z=w1x1+w2x2+…+wnxn+bz = w_1x_1 + w_2x_2 + \ldots + w_nx_n + b

Вероятность и классификация:

Логистическая регрессия моделирует вероятность P(y=1∣x)P(y=1|x) того, что пример xx принадлежит классу y=1y=1, как:

P(y=1∣x)=σ(w⋅x+b)P(y=1|x) = \sigma(w \cdot x + b)

где w⋅xw \cdot x обозначает скалярное произведение векторов весов и признаков, а bb — смещение (bias).

Обучение модели:

Цель обучения — найти параметры ww и bb, которые минимизируют ошибку между предсказанными и истинными метками. В логистической регрессии часто используется функция потерь, называемая логистической потерей или перекрёстной энтропией:

L(y,y^)=−[ylog⁡(y^)+(1−y)log⁡(1−y^)]L(y, \hat{y}) = -[y \log(\hat{y}) + (1 - y) \log(1 - \hat{y})]

где yy — истинная метка, а y^\hat{y} — предсказанная вероятность.

Оптимизация:

Для минимизации функции потерь обычно используют методы оптимизации, такие как градиентный спуск. В каждом шаге веса ww и смещение bb обновляются в направлении, уменьшающем функцию потерь.

Логистическая регрессия эффективна для задач, где искомые зависимости в данных могут быть аппроксимированы линейной зависимостью, и она является фундаментом для многих других методов машинного обучения.


Как связаны сигмоида, логит и граница классов в логистической регрессии?

Формула логистической регрессии: P(y=1∣x)=11+e−zP(y=1∣x)= \frac{1}{1+e^{-z}}

где P(y=1∣x)P(y=1∣x) - вероятность принадлежности к классу 1 для входного признака xx, ee - основание натурального логарифма, zz - линейная комбинация входных признаков с их весами:

z=w1x1+w2x2+…+wnxn+bz = w_1x_1 + w_2x_2 + \ldots + w_nx_n + b

Логит — логарифм отношения вероятности класса 1 к вероятности класса 0: logit⁡(p)=log⁡p1−p=z\operatorname{logit}(p)=\log\frac{p}{1-p}=z при 0 < p < 1. Здесь p — вероятность класса 1, а z — линейная комбинация признаков до применения сигмоиды. Не следует путать логит с бинарной кросс-энтропией — функцией потерь для обучения модели.

Для получения метки класса задают порог t: при p ≥ t выбирают класс 1. При t = 0,5 это равносильно z ≥ 0, поэтому граница решений линейна в используемых признаках. Порог выбирают с учётом стоимости ошибок и требований задачи. Параметры модели обучают, минимизируя логистическую потерю; без регуляризации это эквивалентно максимизации правдоподобия.


Что такое метод наименьших квадратов (МНК)?

Метод наименьших квадратов (МНК) - это статистический метод, используемый для оценки параметров линейной модели путем минимизации суммы квадратов разностей между наблюдаемыми значениями и значениями, предсказанными моделью. В основе МНК лежит принцип нахождения “наилучшей” прямой (или плоскости в случае многомерных данных), которая наилучшим образом соответствует набору данных. Этот метод широко используется в регрессионном анализе для оценки параметров линейной зависимости между переменными.


Почему МНК минимизирует квадраты ошибок, а не кубы?

Квадраты неотрицательны, поэтому ошибки разных знаков не компенсируются. Для линейной модели сумма квадратов образует гладкую выпуклую функцию, которую удобно оптимизировать; при гауссовском шуме её минимум совпадает с оценкой максимального правдоподобия.

Куб сохраняет знак: большие отрицательные ошибки могут уменьшать сумму, а целевая функция может быть не ограничена снизу. Чётные степени выше второй возможны, но ещё сильнее наказывают выбросы и усложняют оптимизацию. Квадратичная потеря тоже чувствительна к выбросам, поэтому при необходимости используют MAE или Huber loss.

Собеседования: Data Science

Смотри записи интервью, узнай, какие вопросы задают и как отвечают кандидаты.

Вопросы и ответы

Не нашли ответ? Напишите мне в чат. Я делаю Шпаргалку и сам отвечаю на сообщения. Расскажите, что не работает или чего вам не хватает. Может, смогу сразу взять это в работу.

Откуда взяты вопросы?

Из реальных собеседований. Основой подборки стал опыт Вадима Новосёлова: он проходил интервью и записывал вопросы. Подробнее о материалах.

Насколько эти вопросы актуальны?

Эти вопросы встречались нам на реальных собеседованиях в 2025 году. Мы регулярно проходим собеседования и пополняем подборку новыми вопросами. Основы профессии и ключевые технологии остаются востребованными годами, а детали конкретных инструментов и версий стоит сверять с текущей документацией.

На какой уровень рассчитана подборка?

Мы проходили собеседования на вакансии уровня Middle+, а иногда и на Senior-позиции. Вопросы из этих интервью вошли в подборку. Направления работы: Data Scientist, ML-инженер. Глубина обсуждения зависит от вакансии: будь готов объяснить основную идею, привести практический пример и разобрать ограничения и альтернативы решения.

Этот вопрос точно будет на моём собеседовании?

Гарантии нет: набор вопросов зависит от компании, задач команды, уровня вакансии и самого интервьюера. Эти вопросы уже встречались на реальных собеседованиях, но на твоём интервью ту же тему могут проверить другой формулировкой, практической задачей или обсуждением твоего опыта. Используй подборку, чтобы разобраться в теме: объясняй идею своими словами, приводи примеры и готовься обсудить ограничения и альтернативы решения. Так будет проще ответить и на знакомый вопрос, и на неожиданные уточнения.