---
title: Основы ML и выбор модели
questionDates:
  q-transfer-0047: '2026-10-01'
seo:
  description: >-
    Тема «Основы ML и выбор модели» для собеседования Data Scientist. Какие
    основные типы задач машинного обучения существуют? Что такое алгоритмы без
    учителя в машинном обучении?
  title: Основы ML и выбор модели — Data Scientist
---

[Все темы Data Scientist](/prep/data-scientist)

Подтемы:

- [Типы задач машинного обучения](#q-14bee738d69b81caac5ddc702803b104)
- [Сравнение методов машинного обучения](#q-14bee738d69b81598458c728fb54f8d2)
- [Этапы построения модели ML](#q-14bee738d69b81fa957dcdd648df8dd5)

<span
  id="q-14bee738d69b81ea876af3ff4609f65c"
  data-question-redirect="/prep/data-scientist/kompyuternoe-zrenie#q-14bee738d69b81ea876af3ff4609f65c"
></span>

## <strong>Какие основные типы задач машинного обучения существуют?</strong> [#q-14bee738d69b81caac5ddc702803b104]

<strong>Основные типы задач машинного обучения&#58;</strong>

1. Обучение с учителем <code>&#40;Supervised Learning&#41;</code>&#58; модели обучаются на размеченных данных, где каждому входному примеру соответствует выходной ответ. К задачам относятся классификация и регрессия.

1. Обучение без учителя <code>&#40;Unsupervised Learning&#41;</code>&#58; модели обучаются на неразмеченных данных без предоставления выходной информации. К задачам относятся кластеризация, снижение размерности и ассоциативное обучение.

1. Полуобученное обучение <code>&#40;Semi&#45;supervised Learning&#41;</code>&#58; использует как размеченные, так и неразмеченные данные для обучения модели.

1. Обучение с подкреплением <code>&#40;Reinforcement Learning&#41;</code>&#58; агент обучается взаимодействовать с окружающей средой, чтобы выполнить определенную задачу, максимизируя некоторую награду.

:::note[Ссылки для изучения]

1. [Базовые задачи ML: обучение с учителем и кластеризация без учителя](https://contest.yandex.ru/tracks/ml/introduction/machine-learning)
   :::

---

## <strong>Что такое алгоритмы без учителя в машинном обучении?</strong> [#q-14bee738d69b811f8f9ad4ce7e866d62]

Алгоритмы без учителя в машинном обучении предназначены для работы с неразмеченными данными, то есть данными, где нет заранее определенных выходных меток или ответов. Они позволяют находить в данных закономерности, структуры или группы, не требуя заранее известных ответов. К основным задачам алгоритмов без учителя относятся кластеризация, снижение размерности и ассоциативное обучение.

:::note[Ссылки для изучения]

1. [Базовые задачи ML: обучение с учителем и кластеризация без учителя](https://contest.yandex.ru/tracks/ml/introduction/machine-learning)
   :::

---

## <strong>Чем логистическая регрессия отличается от линейной регрессии?</strong> [#q-14bee738d69b81598458c728fb54f8d2]

Логистическая регрессия используется для задач классификации, в то время как линейная регрессия - для задач регрессии. В логистической регрессии используется логистическая функция для предсказания вероятности принадлежности к определенному классу, в то время как в линейной регрессии прогнозируется непрерывное числовое значение.

:::note[Ссылки для изучения]

1. [Линейная и логистическая модели: числовой ответ и вероятность класса](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models)
   :::

---

## <strong>Почему некоторые предпочитают использовать линейную регрессию вместо деревьев решений?</strong> [#q-14bee738d69b813dbb5bf64e6c7fb396]

Некоторые предпочитают использовать линейную регрессию вместо деревьев решений из-за следующих причин&#58;

- Простота интерпретации и понимания результатов модели.

- Эффективность на больших наборах данных и при наличии линейных зависимостей между признаками и целевой переменной.

- Меньшая склонность к переобучению, особенно при ограниченном количестве данных.

:::note[Ссылки для изучения]

1. [Устройство линейной модели и работа с разреженными признаками](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models)
   :::

---

## <strong>Каковы различия между алгоритмами</strong> <code>k&#45;Nearest Neighbors &#40;kNN&#41;</code> <strong>и</strong> <code>k&#45;Means</code><strong>?</strong> [#q-14bee738d69b815ab831ff1f68a48ef8]

<code>k&#45;Nearest Neighbors &#40;kNN&#41;</code> - это алгоритм классификации
или регрессии, который основывается на принципе "ближайших соседей", используя
расстояние между точками данных.

<code>k&#45;Means</code> - это алгоритм кластеризации, который группирует точки
данных в заданное количество кластеров, минимизируя среднеквадратичное
расстояние между точками кластера и их центроидами.

:::note[Ссылки для изучения]

1. [kNN: предсказание по ближайшим размеченным объектам](https://education.yandex.ru/handbook/ml/article/metricheskiye-metody)
1. [k-means: присвоение кластеру и пересчёт центров](https://education.yandex.ru/handbook/ml/article/klasterizaciya)
   :::

---

## <strong>Какие есть еще линейные модели кроме лин. и лог. регрессий?</strong> [#q-14bee738d69b81979ec8c35f56c144d7]

Помимо линейной и логистической регрессий, существуют и другие линейные модели&#58;

1. <code>Ridge регрессия</code>&#58; Регрессионная модель, которая вводит штраф
   на коэффициенты модели с целью снижения переобучения.

1. <code>Lasso регрессия</code>&#58; Также регрессионная модель, которая
   добавляет штраф к абсолютным значениям коэффициентов, что может привести к
   отбору признаков.

1. <code>ElasticNet регрессия</code>&#58; Комбинация Ridge и Lasso регрессий,
   которая вводит штрафы на коэффициенты как по их абсолютным значениям, так и
   по их квадратам.

1. <code>Метод опорных векторов &#40;SVM&#41;</code>&#58; Линейная модель для
   задач классификации и регрессии, которая стремится найти гиперплоскость
   максимального зазора между классами.

1. <code>Линейная дискриминантный анализ &#40;LDA&#41;</code>&#58;
   Статистический метод, который моделирует распределение признаков в каждом
   классе и использует его для принятия решений.

1. <code>Обобщенные линейные модели &#40;GLM&#41;</code>&#58; Класс моделей,
   который обобщает линейные модели, позволяя выбирать различные функции связи и
   распределения ошибок.

:::note[Ссылки для изучения]

1. [Линейные модели в ML](https://education.yandex.ru/handbook/ml/article/linear-models)
   :::

---

## Чем отличаются случайный лес и градиентный бустинг? [#q-14bee738d69b816db65fffc75784b1e7]

<span id="q-14bee738d69b81fea606fc3ea85751c3"></span>

Случайный лес обучает деревья независимо на bootstrap-выборках и случайных подмножествах признаков. Их прогнозы усредняют или выбирают голосованием. Такая случайность снижает корреляцию деревьев и в основном уменьшает дисперсию модели; обучение легко распараллелить.

Градиентный бустинг строит деревья последовательно. Каждое новое дерево приближает отрицательный градиент функции потерь и корректирует текущий ансамбль. Бустинг часто даёт выше качество после настройки, но чувствительнее к learning rate, глубине, числу деревьев, шуму и переобучению. Его деревья обычно неглубокие, а прогнозы суммируются.

:::note[Ссылки для изучения]

1. [Случайный лес: bootstrap, случайные признаки и усреднение независимых деревьев](https://contest.yandex.ru/tracks/ml/supervised-learning/ensembles-in-machine-learning#sluchajnyj-les)
1. [Градиентный бустинг: последовательное исправление ансамбля и антиградиент функции потерь](https://contest.yandex.ru/tracks/ml/supervised-learning/gradient-boosting#obobshchenie-na-drugie-funkcii-poter)
   :::

---

## <strong>В чём разница между случайным лесом и деревом решений в машинном обучении?</strong> [#q-14bee738d69b817785a8cd93ab36e25a]

Основное различие между случайным лесом и деревом решений заключается в том, что случайный лес является ансамблевым методом, состоящим из множества деревьев решений, в то время как дерево решений - это одиночный алгоритм. В случайном лесе каждое дерево строится независимо на подмножестве данных, а затем результаты объединяются для получения итогового предсказания. Это позволяет снизить переобучение и повысить устойчивость модели.

:::note[Ссылки для изучения]

1. [Случайный лес как ансамбль разных решающих деревьев](https://contest.yandex.ru/tracks/ml/supervised-learning/ensembles-in-machine-learning)
   :::

---

## <strong>Есть три модели (бустинг, логрег и рандомфорест) на какие критерии следует обратить внимание при выборе модели?</strong> [#q-14bee738d69b81bb978dd4682b0e6fca]

При выборе модели следует обратить внимание на следующие критерии&#58;

1. Производительность модели&#58; Оцените скорость обучения и предсказания для каждой модели, особенно если важна скорость работы в реальном времени.

1. Обобщающая способность&#58; сравнивайте модели на валидационной выборке или кросс-валидации. Тестовую выборку используйте для окончательной оценки после выбора модели.

1. Интерпретируемость&#58; Некоторые модели, такие как логистическая регрессия, легче интерпретировать, чем другие, например, бустинг или случайный лес. Если важно понимать, какие признаки влияют на прогнозы, это стоит учитывать.

1. Устойчивость к выбросам&#58; Оцените, насколько модели устойчивы к выбросам в данных. Некоторые модели могут быть более чувствительны к выбросам, чем другие.

1. Гибкость&#58; Рассмотрите, насколько легко модель можно настроить и насколько она гибкая в использовании. Некоторые модели могут требовать меньше тюнинга гиперпараметров или быть более подходящими для конкретных типов данных.

:::note[Ссылки для изучения]

1. [Выбор ML-модели: метрики, скорость и интерпретируемость](https://contest.yandex.ru/tracks/ml/supervised-learning/conclusion)
1. [Линейные модели: регуляризация и выбор по валидационной выборке](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models)
   :::

---

## <strong>В каком случае линейная регрессия будет лучше бустинга?</strong> [#q-14bee738d69b8165a848c56339a9afc1]

Линейная регрессия может быть лучше бустинга в случае, когда данные действительно линейно зависят от предикторов и нет необходимости в модели с высокой сложностью. Если взаимосвязи в данных просты и линейные, то линейная регрессия может обеспечить достаточно хорошее качество прогнозов при меньшем числе параметров и менее высокой вычислительной сложности.

:::note[Ссылки для изучения]

1. [Линейная регрессия и регуляризация](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models)
1. [Когда усложнение модели оправдано: метрики и ограничения деревьев](https://contest.yandex.ru/tracks/ml/supervised-learning/conclusion)
   :::

---

## Когда логистическая регрессия предпочтительнее случайного леса? [#q-transfer-0047]

Логистическая регрессия хороша, когда зависимость примерно линейна в log-odds, признаки разреженные, данных немного, а важны скорость и объяснимые коэффициенты. С регуляризацией она часто дает сильный baseline и неплохие вероятности. Случайный лес удобнее для нелинейностей и взаимодействий без ручного задания, но тяжелее, менее прозрачен и его вероятности могут требовать калибровки. Выбор делают по честной validation, включая calibration, latency и стабильность, а не по сложности алгоритма.

:::note[Ссылки для изучения]

1. [Логистическая регрессия и её сильные стороны: линейные log-odds, регуляризация и разреженные признаки](https://contest.yandex.ru/tracks/ml/supervised-learning/linear-models)
   :::

---

## <strong>Расскажите, как вы будете собирать данные, создавать и выводить в продакшен.</strong> [#q-14bee738d69b81fa957dcdd648df8dd5]

Для сбора данных я бы использовал различные методы, включая внешние API, веб-скрапинг, базы данных и собственные источники. Затем данные можно обработать и очистить, чтобы подготовить их для моделирования. Для создания модели я бы использовал подходящие методы машинного обучения или статистического анализа в зависимости от задачи. После тщательной проверки и оценки модели, я бы интегрировал ее в продуктовую среду, используя подходящие инструменты и технологии, чтобы обеспечить надежную и эффективную работу в реальном времени.

:::note[Ссылки для изучения]

1. [Жизненный цикл ML-системы: данные, эксперименты, деплой и мониторинг](https://habr.com/ru/articles/678150/)
   :::
