---
title: Классификация
seo:
  title: Классификация — Data Scientist
  description: Тема «Классификация» для собеседования Data Scientist. Дайте определение классификации. Какие методы классификации вы знаете?
---

[Все темы Data Scientist](/data-scientist)

## <strong>Дайте определение классификации.</strong> [#q-14bee738d69b81119489c18faf4ae37e]

Классификация - это задача машинного обучения, в которой модель стремится присвоить объектам (например, изображениям, тексту, звуку) один из заранее определенных классов на основе их признаков. Иными словами, это процесс прогнозирования категории или метки для новых наблюдений на основе известных примеров обучающего набора данных.

:::note[Ссылки для изучения]

1. [Классификация в ML](http://www.machinelearning.ru/wiki/index.php?title=%D0%9A%D0%BB%D0%B0%D1%81%D1%81%D0%B8%D1%84%D0%B8%D0%BA%D0%B0%D1%86%D0%B8%D1%8F)
   :::

---

## <strong>Какие методы классификации вы знаете?</strong> [#q-14bee738d69b817d89b3dbba88d7a027]

Основные методы классификации&#58;

1. <strong>Логистическая регрессия</strong>&#58; Используется для бинарной
   классификации, предсказывая вероятность принадлежности к одному из двух
   классов.

1. <strong>Метод k-ближайших соседей</strong> <code>&#40;k&#45;NN&#41;</code>
   &#58; Классифицирует объекты на основе их близости к другим объектам в
   обучающем наборе.

1. <strong>Деревья решений и случайный лес</strong>&#58; Построение и
   использование деревьев решений для принятия решений на основе значений
   признаков. Случайный лес - ансамбль деревьев решений.

1. <strong>Метод опорных векторов</strong> <code>&#40;SVM&#41;</code>&#58;
   Находит разделяющую гиперплоскость между классами, максимизируя отступ и
   минимизируя ошибку.

1. <strong>Нейронные сети</strong>&#58; Используются для классификации на основе
   обучения на большом количестве данных и выявления сложных зависимостей.

1. <strong>Наивный байесовский классификатор</strong>&#58; Основан на теореме
   Байеса и предполагает независимость признаков для упрощения модели.

1. <strong>Градиентный бустинг и его вариации</strong>&#58; Строит ансамбль
   слабых моделей, постепенно улучшая результат путем добавления новых моделей,
   сконцентрированных на ошибках предыдущих.

:::note[Ссылки для изучения]

1. [Классификация в ML](http://www.machinelearning.ru/wiki/index.php?title=%D0%9A%D0%BB%D0%B0%D1%81%D1%81%D0%B8%D1%84%D0%B8%D0%BA%D0%B0%D1%86%D0%B8%D1%8F)
   :::

---

## <strong>Какие есть метрики бинарной классификации? Как они считаются с точки зрения матрицы ошибок?</strong> [#q-14bee738d69b812bba1ff31f51710067]

<strong>Вот несколько основных метрик бинарной классификации</strong>&#58;

{/* prettier-ignore */}
1. <code>Точность &#40;Accuracy&#41;</code>&#58; Доля правильно классифицированных объектов от общего числа объектов.

    - Формула:

       $$
       \frac {(TP + TN)}  {(TP + TN + FP + FN)}
       $$

1. <code>Точность &#40;Precision&#41;</code>&#58; Доля правильно классифицированных положительных объектов от общего числа положительных объектов, предсказанных моделью.

    - Формула:

       $$
       \frac {TP} {(TP + FP)}
       $$

1. <code>Полнота &#40;Recall&#41;</code>&#58; Доля правильно классифицированных положительных объектов от общего числа положительных объектов в исходном наборе данных.

    - Формула:

       $$
       \frac {TP} {(TP + FN)}
       $$

1. <code>F1&#45;мера &#40;F1&#45;Score&#41;</code>&#58; Среднее гармоническое между точностью и полнотой. Оценка баланса между точностью и полнотой.

    - Формула:

       $$
       2 \cdot \frac{(Precision * Recall)}{ (Precision + Recall)}
       $$

Эти метрики вычисляются на основе матрицы ошибок, которая представляет собой таблицу, где строки представляют истинные классы, а столбцы представляют прогнозируемые классы.

- <strong>True Positive (TP)</strong>&#58; Количество объектов, которые
  правильно классифицированы как положительные.

- <strong>True Negative (TN)</strong>&#58; Количество объектов, которые
  правильно классифицированы как отрицательные.

- <strong>False Positive (FP)</strong>&#58; Количество объектов, которые
  неправильно классифицированы как положительные (ошибки первого рода).

- <strong>False Negative (FN)</strong>&#58; Количество объектов, которые
  неправильно классифицированы как отрицательные (ошибки второго рода).

:::note[Ссылки для изучения]

1. [Метрики бинарной классификации](https://qudata.com/ml/ru/ML_Binary_Metrics.html)
   :::

---

## <strong>Метрики классификации и их интерпретация.</strong> [#q-14bee738d69b814d87c7e3cf11fb162b]

<strong>
  Вот краткое описание основных метрик классификации и их интерпретация&#58;
</strong>

{/* prettier-ignore */}
1. <code>Точность &#40;Accuracy&#41;</code>&#58;

    - Интерпретация&#58; Доля правильно классифицированных объектов от общего числа объектов.

    - Пример&#58; Accuracy 0.85 означает, что модель правильно классифицировала 85% всех объектов.

1. <code>Точность &#40;Precision&#41;</code>&#58;

    - Интерпретация&#58; Доля правильно классифицированных положительных объектов от общего числа объектов, предсказанных как положительные.

    - Пример&#58; Precision 0.75 означает, что 75% объектов, предсказанных как положительные, действительно положительны.

1. <code>Полнота &#40;Recall&#41;</code>&#58;

    - Интерпретация&#58; Доля правильно классифицированных положительных объектов от общего числа положительных объектов в исходном наборе данных.

    - Пример&#58; Recall 0.80 означает, что модель обнаружила 80% всех положительных объектов.

1. <code>F1&#45;мера &#40;F1&#45;Score&#41;</code>&#58;

    - Интерпретация&#58; Среднее гармоническое между точностью и полнотой. Оценка баланса между точностью и полнотой.

    - Пример&#58; F1-Score 0.80 означает, что среднее гармоническое между точностью и полнотой равно 0.80.

:::note[Ссылки для изучения]

1. [Основные метрики задач классификации](https://webiomed.ai/blog/osnovnye-metriki-zadach-klassifikatsii-v-mashinnom-obuchenii/)
   :::
