---
title: Линейная регрессия
seo:
  title: Линейная регрессия — Data Scientist
  description: "Тема «Линейная регрессия» для собеседования Data Scientist. Как работает линейная регрессия, какую функцию потерь использует и чем опасны большие веса? В чём основная проблема линейной регрессии в машинном обучении?"
---

[Все темы Data Scientist](/data-scientist)

## Как работает линейная регрессия, какую функцию потерь использует и чем опасны большие веса? [#q-14bee738d69b81e496c3f2ff6c6aece8]

Линейная регрессия - это метод статистического моделирования, используемый для анализа отношений между зависимой переменной и одной или несколькими независимыми переменными. Принцип работы линейной регрессии заключается в поиске линейной зависимости между независимыми и зависимой переменными путем подбора оптимальных весовых коэффициентов.

Преимущества линейной регрессии включают&#58;

1. Простота и интерпретируемость&#58; линейные модели легко интерпретировать и объяснить.

1. Эффективность&#58; линейная регрессия имеет низкую вычислительную сложность и может быть быстро обучена на больших наборах данных.

1. Гибкость&#58; линейная регрессия может быть легко расширена для учета сложных отношений между переменными, включая полиномиальные и взаимодействующие признаки.

Функция потерь, обычно используемая для линейной регрессии, - это среднеквадратичная ошибка <code>&#40;MSE&#41;</code>, которая измеряет среднеквадратичное отклонение предсказанных значений от фактических значений.

Одной из проблем, связанных с большими значениями весовых коэффициентов, является переобучение модели. Большие веса могут привести к чрезмерной адаптации к обучающим данным, что ухудшит обобщающую способность модели на новых данных. Для борьбы с этой проблемой часто используются методы регуляризации, такие как <code>L1 &#40;Lasso&#41;</code> и <code>L2 &#40;Ridge&#41;</code> регрессии, которые штрафуют за большие значения весовых коэффициентов, помогая уменьшить их размер и предотвратить переобучение.

:::note[Ссылки для изучения]

1. [Линейная регрессия в ML](https://ml-cheatsheet-russian.readthedocs.io/ru/latest/linear_regression.html)
   :::

---

## <strong>Почему у линейной регрессии функция потерь именно квадратичная, а не кубическая, с четвертой или пятой степенью?</strong> [#q-14bee738d69b81c8b956ec4f74b950bb]

Линейная регрессия использует квадратичную функцию потерь, потому что она является удобной математической формой для оптимизации и имеет несколько важных свойств&#58;

1. <strong>Простота</strong>&#58; Функция потерь в форме квадрата разности между
   предсказанными и фактическими значениями делает вычисления более простыми и
   эффективными.

1. Выпуклость&#58; квадратичная функция потерь не имеет неглобальных локальных минимумов. Единственность решения требует полного столбцового ранга матрицы признаков; при линейной зависимости столбцов минимум может достигаться при разных весах.

1. <strong>Интерпретируемость</strong>&#58; Минимизация квадратичной функции
   потерь приводит к оценкам параметров модели, которые можно легко
   интерпретировать, так как они имеют прямую связь с наиболее вероятным набором
   параметров данных.

1. <strong>Математические свойства</strong>&#58; Многие методы оптимизации,
   такие как метод наименьших квадратов (МНК), легко применяются к квадратичной
   функции потерь.

Хотя в некоторых случаях могут быть использованы другие функции потерь, квадратичная функция потерь является стандартным выбором для линейной регрессии из-за своей эффективности и удобства.

:::note[Ссылки для изучения]

1. [Линейная регрессия в ML](https://ml-cheatsheet-russian.readthedocs.io/ru/latest/linear_regression.html)
   :::

---

## <strong>В чём основная проблема линейной регрессии в машинном обучении?</strong> [#q-14bee738d69b81cda9d5f5fc8039a0fb]

Основная проблема линейной регрессии заключается в том, что она может плохо справляться с моделированием сложных нелинейных зависимостей между признаками и целевой переменной. Линейная регрессия предполагает линейную связь между признаками и целевой переменной, что может быть недостаточно для точного предсказания в случае сложных данных.

:::note[Ссылки для изучения]

1. [Линейная регрессия в ML](https://ml-cheatsheet-russian.readthedocs.io/ru/latest/linear_regression.html)
   :::

---

## <strong>Аналитическая регрессия что это такое, как решать?</strong> [#q-14bee738d69b81259dfbf64a4507d939]

Термин "аналитическая регрессия" неоднозначен. Если речь об аналитическом решении линейной регрессии методом наименьших квадратов, веса находят из нормальных уравнений. При полном столбцовом ранге решение единственно; в вычислениях обычно используют QR- или SVD-разложение, избегая явного обращения матрицы.

:::note[Ссылки для изучения]

1. [Линейная регрессия в ML](https://ml-cheatsheet-russian.readthedocs.io/ru/latest/linear_regression.html)
   :::

---

## <strong>Что представляет собой Теорема Гаусса-Маркова?</strong> [#q-14bee738d69b819582f4e55d957710e5]

Теорема утверждает, что при выполнении определённых условий (линейности модели, гомоскедастичности, отсутствия автокорреляции и пр.), линейные оценки методом наименьших квадратов являются лучшими линейными несмещёнными оценками <code>&#40;BLUE&#41;</code>.

:::note[Ссылки для изучения]

1. [Линейная регрессия в ML](https://ml-cheatsheet-russian.readthedocs.io/ru/latest/linear_regression.html)
   :::
