---
title: Линейные модели и метод наименьших квадратов
questionDates:
  q-transfer-0046: '2026-10-01'
seo:
  description: >-
    Тема «Линейные модели и метод наименьших квадратов» для собеседования Data
    Scientist. Как работает линейная регрессия, какую функцию потерь использует
    и чем опасны большие веса? Аналитическая регрессия что это такое, как
    решать?
  title: Линейные модели и метод наименьших квадратов — Data Scientist
---

[Все темы Data Scientist](/prep/data-scientist)

Подтемы:

- [Линейная регрессия](#q-14bee738d69b81e496c3f2ff6c6aece8)
- [Логистическая регрессия](#q-14bee738d69b81798374cf477a8587ce)
- [Метод наименьших квадратов](#q-14bee738d69b815aae5ed079e61d7d99)

## Как работает линейная регрессия, какую функцию потерь использует и чем опасны большие веса? [#q-14bee738d69b81e496c3f2ff6c6aece8]

Линейная регрессия - это метод статистического моделирования, используемый для анализа отношений между зависимой переменной и одной или несколькими независимыми переменными. Принцип работы линейной регрессии заключается в поиске линейной зависимости между независимыми и зависимой переменными путем подбора оптимальных весовых коэффициентов.

Преимущества линейной регрессии включают&#58;

1. Простота и интерпретируемость&#58; линейные модели легко интерпретировать и объяснить.

1. Эффективность&#58; линейная регрессия имеет низкую вычислительную сложность и может быть быстро обучена на больших наборах данных.

1. Гибкость&#58; линейная регрессия может быть легко расширена для учета сложных отношений между переменными, включая полиномиальные и взаимодействующие признаки.

Функция потерь, обычно используемая для линейной регрессии, - это среднеквадратичная ошибка <code>&#40;MSE&#41;</code>, которая измеряет среднеквадратичное отклонение предсказанных значений от фактических значений.

Одной из проблем, связанных с большими значениями весовых коэффициентов, является переобучение модели. Большие веса могут привести к чрезмерной адаптации к обучающим данным, что ухудшит обобщающую способность модели на новых данных. Для борьбы с этой проблемой часто используются методы регуляризации, такие как <code>L1 &#40;Lasso&#41;</code> и <code>L2 &#40;Ridge&#41;</code> регрессии, которые штрафуют за большие значения весовых коэффициентов, помогая уменьшить их размер и предотвратить переобучение.

:::note[Ссылки для изучения]

1. [Линейная регрессия: MSE, большие веса и регуляризация](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models#matematicheskoe-opisanie)
   :::

---

## <strong>В чём основная проблема линейной регрессии в машинном обучении?</strong> [#q-14bee738d69b81cda9d5f5fc8039a0fb]

Основная проблема линейной регрессии заключается в том, что она может плохо справляться с моделированием сложных нелинейных зависимостей между признаками и целевой переменной. Линейная регрессия предполагает линейную связь между признаками и целевой переменной, что может быть недостаточно для точного предсказания в случае сложных данных.

:::note[Ссылки для изучения]

1. [Ограничение линейной модели и добавление нелинейных признаков](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models#matematicheskoe-opisanie)
   :::

---

## <strong>Аналитическая регрессия что это такое, как решать?</strong> [#q-14bee738d69b81259dfbf64a4507d939]

Термин "аналитическая регрессия" неоднозначен. Если речь об аналитическом решении линейной регрессии методом наименьших квадратов, веса находят из нормальных уравнений. При полном столбцовом ранге решение единственно; в вычислениях обычно используют QR- или SVD-разложение, избегая явного обращения матрицы.

:::note[Ссылки для изучения]

1. [Аналитическое решение МНК: проекция, полный ранг и устойчивость](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models#mnk-tochnyj-analiticheskij-metod)
1. [Вычисление МНК с помощью сингулярного разложения](https://scikit-learn.ru/stable/modules/linear_model.html#ordinary-least-squares)
   :::

---

## <strong>Что представляет собой Теорема Гаусса-Маркова?</strong> [#q-14bee738d69b819582f4e55d957710e5]

Теорема утверждает, что при выполнении определённых условий (линейности модели, гомоскедастичности, отсутствия автокорреляции и пр.), линейные оценки методом наименьших квадратов являются лучшими линейными несмещёнными оценками <code>&#40;BLUE&#41;</code>.

:::note[Ссылки для изучения]

1. [Теорема Гаусса—Маркова: предпосылки и BLUE для множественной регрессии](https://books.econ.msu.ru/Introduction-to-Econometrics/chap03/3.2/)
   :::

---

## Может ли регрессия предсказать отрицательное значение при положительном таргете? [#q-transfer-0046]

Да. Линейная регрессия имеет неограниченный выход и может дать отрицательный прогноз даже при положительных train-таргетах. Дерево регрессии обычно предсказывает среднее в листе и не выходит за диапазон обучающих таргетов, как и обычный KNN с положительными весами, но плохо экстраполирует. Если отрицательные значения невозможны, можно моделировать `log(y)` с корректным обратным преобразованием, выбрать распределение с положительной link-функцией или применить ограниченную модель. Простое clipping искажает ошибки и calibration.

:::note[Ссылки для изучения]

1. [Линейная регрессия: линейная функция ответа и вещественная область значений](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models#matematicheskoe-opisanie)
   :::

---

## Как работает логистическая регрессия и какую функцию потерь она использует? [#q-14bee738d69b81798374cf477a8587ce]

Логистическая регрессия - это метод классификации, который используется для прогнозирования вероятности принадлежности наблюдения к определенному классу. Принцип работы логистической регрессии заключается в преобразовании линейной комбинации признаков в вероятности с использованием сигмоидной функции (логистической функции).

Функция потерь, обычно используемая для логистической регрессии, называется кросс-энтропией (или логистической функцией потерь). Она измеряет разницу между фактическими и предсказанными вероятностями классов и минимизируется в процессе обучения модели.

:::note[Ссылки для изучения]

1. [Логистическая регрессия: сигмоида и бинарная кросс-энтропия](https://scikit-learn.ru/stable/modules/linear_model.html#logistic-regression)
2. [Логистическая регрессия. machine learrrning, с 0:02](https://www.youtube.com/watch?v=9BoVCdedvW8&t=2s)

:::

---

## Как записывают и обучают логистическую регрессию и проверяют значимость коэффициентов? [#q-14bee738d69b819f8a43c00d7bc6913b]

Формула логистической регрессии выглядит следующим образом&#58;

$$
P(y=1|x) = \frac{1}{1 + e^{-(\beta_0 + \beta_1 x_1 + \beta_2 x_2 + ... + \beta_n x_n)}}
$$

где&#58;

- <InlineMath tex={"P(y=1|x)"} /> - вероятность того, что целевая переменная
  <InlineMath tex={"y"} /> равна 1 при условии значений предикторов
  <InlineMath tex={"x"} />.

- <InlineMath tex={"\\beta_0, \\beta_1, \\beta_2, ..., \\beta_n"} /> -
  коэффициенты модели, которые необходимо оценить.

- <InlineMath tex={"x_1, x_2, ..., x_n"} /> - значения предикторов.

Обучение логистической регрессии осуществляется путем минимизации функции потерь, такой как кросс-энтропия, с использованием методов оптимизации, таких как градиентный спуск или его вариации.

В обычной логистической регрессии без регуляризации значимость отдельного коэффициента часто проверяют тестом Вальда&#58; z-статистика равна оценке коэффициента, делённой на её стандартную ошибку. Для сравнения вложенных моделей используют тест отношения правдоподобий. Проверяйте предпосылки модели и способ расчёта стандартных ошибок; обычный t-тест линейной регрессии нельзя переносить сюда автоматически.

:::note[Ссылки для изучения]

1. [Логистическая регрессия: вероятности и функция потерь](https://scikit-learn.ru/stable/modules/linear_model.html#logistic-regression)
1. [Значимость коэффициентов логит-модели: нормальная статистика и тест отношения правдоподобий](https://books.econ.msu.ru/Introduction-to-Econometrics/chap10/10.3/)
   :::

---

## Как записываются модель и функция потерь логистической регрессии? [#q-14bee738d69b815cb4bcef2267043742]

Логистическая регрессия — это статистическая модель, используемая для оценки вероятности принадлежности к определённому классу (обычно бинарному). Она широко применяется в машинном обучении для задач классификации.

#### Математическая модель&#58;

Основой логистической регрессии является логистическая функция, также называемая сигмоидной функцией, которая описывается формулой&#58;

$$
\sigma(z) = \frac{1}{1 + e^{-z}}
$$

где <InlineMath tex={"z"} /> — это линейная комбинация входных признаков <InlineMath tex={"x"} /> и их весов <InlineMath tex={"w"} />, плюс свободный член <InlineMath tex={"b"} />&#58;

$$
z = w_1x_1 + w_2x_2 + \ldots + w_nx_n + b
$$

#### Вероятность и классификация&#58;

Логистическая регрессия моделирует вероятность <InlineMath tex={"P(y=1|x) "} /> того, что пример <InlineMath tex={"x"} /> принадлежит классу <InlineMath tex={"y=1"} />, как&#58;

$$
P(y=1|x) = \sigma(w \cdot x + b)
$$

где <InlineMath tex={"w \\cdot x "} /> обозначает скалярное произведение векторов весов и признаков, а <InlineMath tex={"b"} /> — смещение <code>&#40;bias&#41;</code>.

#### Обучение модели&#58;

Цель обучения — найти параметры <InlineMath tex={"w"} /> и <InlineMath tex={"b"} />, которые минимизируют ошибку между предсказанными и истинными метками. В логистической регрессии часто используется функция потерь, называемая логистической потерей или перекрёстной энтропией&#58;

$$
L(y, \hat{y}) = -[y \log(\hat{y}) + (1 - y) \log(1 - \hat{y})]
$$

где <InlineMath tex={"y"} /> — истинная метка, а <InlineMath tex={"\\hat{y}"} /> — предсказанная вероятность.

#### Оптимизация&#58;

Для минимизации функции потерь обычно используют методы оптимизации, такие как градиентный спуск. В каждом шаге веса <InlineMath tex={"w"} /> и смещение <InlineMath tex={"b"} /> обновляются в направлении, уменьшающем функцию потерь.

Логистическая регрессия эффективна для задач, где искомые зависимости в данных могут быть аппроксимированы линейной зависимостью, и она является фундаментом для многих других методов машинного обучения.

:::note[Ссылки для изучения]

1. [Логистическая регрессия: сигмоида и бинарная кросс-энтропия](https://scikit-learn.ru/stable/modules/linear_model.html#logistic-regression)
2. [Логистическая регрессия. machine learrrning, с 0:02](https://www.youtube.com/watch?v=9BoVCdedvW8&t=2s)

:::

---

## Как связаны сигмоида, логит и граница классов в логистической регрессии? [#q-14bee738d69b81199aeaf68ccfc67de4]

<strong>Формула логистической регрессии&#58;</strong>
<InlineMath tex={"P(y=1∣x)= \\frac{1}{1+e^{-z}}"} />

где <InlineMath tex={"P(y=1∣x)"} /> - вероятность принадлежности к классу 1 для входного признака <InlineMath tex={"x"} />, <InlineMath tex={"e"} /> - основание натурального логарифма, <InlineMath tex={"z"} /> - линейная комбинация входных признаков с их весами&#58;

<InlineMath tex={"z = w_1x_1 + w_2x_2 + \\ldots + w_nx_n + b"} />

Логит — логарифм отношения вероятности класса 1 к вероятности класса 0&#58; <InlineMath tex={"\\operatorname{logit}(p)=\\log\\frac{p}{1-p}=z"} /> при 0 \< p \< 1. Здесь p — вероятность класса 1, а z — линейная комбинация признаков до применения сигмоиды. Не следует путать логит с бинарной кросс-энтропией — функцией потерь для обучения модели.

Для получения метки класса задают порог t&#58; при p ≥ t выбирают класс 1. При t = 0,5 это равносильно z ≥ 0, поэтому граница решений линейна в используемых признаках. Порог выбирают с учётом стоимости ошибок и требований задачи. Параметры модели обучают, минимизируя логистическую потерю; без регуляризации это эквивалентно максимизации правдоподобия.

:::note[Ссылки для изучения]

1. [Логит и сигмоида: линейный скор и гиперплоскость классов](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models#logisticheskaya-regressiya)
1. [Вероятности и порог классификации в логистической регрессии](https://scikit-learn.ru/stable/modules/linear_model.html#logistic-regression)
1. [Сигмоида и граница классов. machine learrrning, с 19:01](https://www.youtube.com/watch?v=9BoVCdedvW8&t=1141s)

:::

---

## <strong>Что такое метод наименьших квадратов (МНК)?</strong> [#q-14bee738d69b815aae5ed079e61d7d99]

Метод наименьших квадратов <code>&#40;МНК&#41;</code> - это статистический метод, используемый для оценки параметров линейной модели путем минимизации суммы квадратов разностей между наблюдаемыми значениями и значениями, предсказанными моделью. В основе <code>МНК</code> лежит принцип нахождения "наилучшей" прямой (или плоскости в случае многомерных данных), которая наилучшим образом соответствует набору данных. Этот метод широко используется в регрессионном анализе для оценки параметров линейной зависимости между переменными.

:::note[Ссылки для изучения]

1. [Метод наименьших квадратов: минимизация суммы квадратов отклонений](https://mathprofi.ru/metod_naimenshih_kvadratov.html)
   :::

---

## Почему МНК минимизирует квадраты ошибок, а не кубы? [#q-14bee738d69b811ea993e938ed0b8d5c]

<span id="q-14bee738d69b81c8b956ec4f74b950bb"></span>

Квадраты неотрицательны, поэтому ошибки разных знаков не компенсируются. Для линейной модели сумма квадратов образует гладкую выпуклую функцию, которую удобно оптимизировать; при гауссовском шуме её минимум совпадает с оценкой максимального правдоподобия.

Куб сохраняет знак: большие отрицательные ошибки могут уменьшать сумму, а целевая функция может быть не ограничена снизу. Чётные степени выше второй возможны, но ещё сильнее наказывают выбросы и усложняют оптимизацию. Квадратичная потеря тоже чувствительна к выбросам, поэтому при необходимости используют MAE или Huber loss.

:::note[Ссылки для изучения]

1. [Почему используют сумму квадратов ошибок: расстояние L2, удобство оптимизации и нормальный шум](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models#svedenie-k-zadache-optimizacii)
   :::
