Обработка данных
Как вы обрабатываете пропуски? Какие методы подстановки вы рекомендуете?
Существует несколько способов обработки пропущенных данных:
-
удаление строк с пропущенными данными;
-
подстановка среднего значения, медианы или моды;
-
присваивание уникального значения;
-
предсказание пропущенных значений;
-
использование алгоритма, допускающего пропуски – например, случайный лес.
Удаление строк с пропусками может уменьшить выборку и внести смещение, если пропуски связаны с анализируемыми величинами. Метод выбирают по механизму пропусков и цели анализа. Универсально лучшего решения нет; сравнивайте варианты на валидации и оценивайте чувствительность выводов.
Является ли подстановка средних значений вместо пропусков допустимым? Почему?
Подстановка средних значений – это метод замены пропусков в наборе данных средними значениями соответствующих признаков.
Как правило, подстановка средних значений – плохой метод, поскольку он не принимает во внимание корреляцию между признаками.
Например, у нас есть таблица с данными о возрасте и уровне физической формы, и для 80-летнего человека уровень физической формы пропущен. Если мы возьмем средний уровень физической формы для всех возрастов от 15 до 80 лет, очевидно, что наш 80-летний получит более высокий уровень, чем имеет на самом деле.
Кроме того, подстановка средних значений уменьшает дисперсию данных и повышает уровень ошибок. Это приводит к менее точной модели и более узким доверительным интервалам.