Функции потерь
Что такое кросс-энтропия?
Кросс-энтропия - это мера расхождения между двумя вероятностными распределениями. В контексте машинного обучения, особенно в задачах классификации, кросс-энтропия используется как функция потерь для оценки различия между фактическими и предсказанными вероятностями классов. Она стремится минимизировать разницу между предсказанными и истинными вероятностями, что делает ее хорошим выбором для обучения моделей классификации.
Назовите пять функций потерь.
Основные функции потерь:
-
Среднеквадратичная ошибка
(MSE): Используется в задачах регрессии для измерения среднеквадратичной разницы между предсказанными и фактическими значениями. -
Кросс-энтропия: Часто применяется в задачах классификации для измерения расхождения между фактическими и предсказанными вероятностями классов.
-
Hinge loss: Используется для обучения классификаторов с отступом, например линейного SVM.
-
Абсолютная ошибка
(MAE): Еще одна функция потерь для задач регрессии, измеряющая среднее абсолютное отклонение между предсказанными и фактическими значениями. -
Хьюбера потеря: Альтернатива среднеквадратичной ошибке, которая менее чувствительна к выбросам в данных, используется также в задачах регрессии.
Какие функции потерь для классификации вы знаете?
Для классификации часто используются следующие функции потерь:
-
Кросс-энтропия
(Cross-Entropy): Часто используется в задачах бинарной и многоклассовой классификации. Эта функция измеряет расхождение между фактическими и предсказанными вероятностями классов. -
Логарифмическая потеря
(Log Loss): Аналогично кросс-энтропии, используется для оценки вероятностей предсказанных классов и часто используется в задачах бинарной и многоклассовой классификации. -
Hinge Loss: Обычно используется в задачах обучения опорных векторов
(SVM)для максимизации зазора между классами. -
Exponential Loss: Используется в алгоритмах градиентного бустинга для классификации, таких как
AdaBoost, для минимизации ошибок весовых коэффициентов. -
Focal Loss: Разработана для улучшения обучения моделей в задачах с сильным дисбалансом классов, минимизируя потери для хорошо классифицированных примеров.
Какие функции потерь для регрессии вы знаете?
Для задач регрессии часто используются следующие функции потерь:
-
Среднеквадратичная ошибка
(MSE): Это наиболее распространенная функция потерь для задач регрессии. Она измеряет среднеквадратичную разницу между предсказанными и фактическими значениями. -
Средняя абсолютная ошибка
(MAE): Эта функция потерь измеряет среднее абсолютное отклонение между предсказанными и фактическими значениями. -
Квантильная потеря
(Quantile Loss): Позволяет оценивать квантили целевой переменной и используется в задачах, где важно учитывать не только среднее значение, но и дисперсию. -
Хьюберова потеря
(Huber Loss): Эта функция является комбинацией MSE и MAE и более устойчива к выбросам в данных. -
Средняя квадратичная логарифмическая ошибка (MSLE): Сравнивает log(1 + y) и log(1 + прогноз) для неотрицательных значений. Она оценивает расхождение в логарифмическом масштабе.
Можно ли использовать MSE для классификации и чем она отличается от кросс-энтропии?
MSE можно применять к вероятностным прогнозам классификации. В бинарной задаче квадрат разности вероятности и метки 0/1 называется оценкой Брайера. Выбор между ней и кросс-энтропией зависит от цели и свойств оптимизации.
-
Формат вывода: вероятности являются числами, поэтому их можно сравнивать с метками 0/1 через MSE.
-
Оптимизация: MSE после сигмоиды может давать малые градиенты при уверенных ошибочных прогнозах; кросс-энтропия обычно лучше подходит для обучения логистической регрессии.
-
Неотрицательность: MSE всегда неотрицательна, поскольку усредняет квадраты ошибок. Сама функция потерь не ограничивает диапазон выходов модели.
Чем различаются MAE и MAPE и какая метрика понятнее бизнесу?
Среднее абсолютное отклонение (MAE) и средняя абсолютная процентная ошибка (MAPE) обе измеряют среднее отклонение предсказанных значений от фактических, но существует небольшая, но важная разница между ними:
MAE (Mean Absolute Error) измеряет среднее абсолютное
отклонение между предсказанными и фактическими значениями. Формула
MAE:
Где - фактическое значение, - предсказанное значение, а - количество наблюдений.
MAPE (Mean Absolute Percentage Error) выражает среднее
абсолютное отклонение в процентах от фактических значений. Формула
MAPE:
Разница между ними состоит в том, что MAPE выражается в процентах и показывает относительную ошибку предсказаний по сравнению с фактическими значениями, в то время как MAE показывает абсолютное отклонение в том же масштабе, что и фактические значения.
Относительно того, какая из них более понятна для бизнеса, это зависит от конкретного контекста и того, как компания интерпретирует и использует ошибки в своей деятельности. MAPE может быть более интуитивно понятной метрикой для бизнеса, так как она выражена в процентах и позволяет оценить ошибку относительно размера фактических значений. Однако в некоторых случаях более прямолинейное представление MAE может быть также полезным.