---
title: Поиск выбросов · часть 1
seo:
  title: Поиск выбросов · часть 1 — Data Scientist
  description: Тема «Поиск выбросов · часть 1» для собеседования Data Scientist. Какие методы поиска выбросов вы знаете?
---

[Все темы Data Scientist](/data-scientist)

## <strong>Какие методы поиска выбросов вы знаете?</strong> [#q-14bee738d69b81f88a0fd14ece0bcb95]

Некоторые методы поиска выбросов&#58;

1. <strong>Метод межквартильного размаха</strong> <code>&#40;IQR&#41;</code>
   &#58; Определяет выбросы как значения, находящиеся за пределами интервала
   <InlineMath tex={"Q1−1.5×IQR и Q3+1.5×IQR"} />, где
   <InlineMath tex={"Q1 "} /> - первый квартиль, <InlineMath tex={"Q3 "} /> -
   третий квартиль, а <InlineMath tex={"IQR"} /> - межквартильный размах.

1. <strong>Z-оценка</strong> <code>&#40;Z&#45;score&#41;</code>&#58; Оценивает,
   насколько значение отклоняется от среднего значения в единицах стандартного
   отклонения. Значения, сильно отклоняющиеся от среднего на основе Z-оценки,
   могут быть выбросами.

1. Local Outlier Factor (LOF)&#58; Сравнивает локальную плотность объекта с плотностями соседей. Чем больше LOF, тем подозрительнее объект. В scikit-learn атрибут negative_outlier_factor\_ хранит отрицательный LOF, поэтому у выбросов он ниже.

1. <strong>Изолирующий лес</strong> <code>&#40;Isolation Forest&#41;</code>&#58;
   Основанный на идее того, что выбросы имеют более короткие пути в деревьях
   решений, чем нормальные наблюдения. Алгоритм строит лес случайных деревьев и
   измеряет среднюю длину пути до выбранного объекта.

1. <strong>DBSCAN</strong>
   <code>
     &#40;Density&#45;Based Spatial Clustering of Applications with Noise&#41;
   </code>
   &#58; Кластеризует точки пространства данных на основе их плотности. Точки,
   не попадающие в какой-либо кластер, считаются выбросами.

:::note[Ссылки для изучения]

1. [Обнаружение выбросов в ML](https://www.dmitrymakarov.ru/data-analysis/outliers-09/)
   :::
