ROC-AUC
У какой модели лучше ROC-AUC: 0.51, 0.65 или 0.88?
Модель с AUC-ROC 0.88 будет иметь более высокую предсказательную способность. AUC-ROC (Area Under the Receiver Operating Characteristic curve) измеряет способность модели различать между классами. Чем выше значение AUC-ROC, тем лучше модель разделяет классы и, следовательно, имеет более высокую предсказательную способность.
Что произойдёт с графиком если мы возведём все предсказания в квадрат?
Если предсказания неотрицательны, например вероятности от 0 до 1, возведение в квадрат сохраняет их порядок. ROC-кривая и AUC не изменятся, изменятся только пороги. Для оценок с отрицательными значениями порядок может измениться, поэтому инвариантность не гарантирована.
Что будет с графиком и метрикой если к предикту добавить константу?
При добавлении одной константы ко всем оценкам порядок сохраняется, поэтому ROC-кривая и AUC не изменятся. Изменятся пороги; метрики при фиксированном числовом пороге могут стать другими.
Расскажите о метрике ROC-AUC. Что означает значение 0.5 ROC-AUC?
Метрика ROC-AUC (Receiver Operating Characteristic - Area Under the Curve) измеряет качество бинарной классификации, оценивая способность модели разделять классы. ROC-AUC представляет собой площадь под кривой ROC (Receiver Operating Characteristic), которая отображает отношение между долей истинно положительных результатов (True Positive Rate) и долей ложно положительных результатов (False Positive Rate) при изменении порога классификации.
Значение ROC-AUC находится в диапазоне от 0 до 1. Чем ближе значение к 1, тем лучше модель отличает между классами: положительным и отрицательным. Значение 0.5 ROC-AUC говорит о том, что модель не различает между классами лучше, чем случайный выбор, что соответствует отсутствию дискриминирующей способности модели.
Как изменится roc_auc, если мы продублируем в выборке единицы 4 раза, а нули 7 раз?
Если мы продублируем единицы 4 раза и нули 7 раз в выборке, то ROC AUC не изменится, поскольку он оценивает порядок ранжирования классов, а не их абсолютные частоты. Как только порядок ранжирования останется неизменным, ROC AUC будет таким же, как и до дублирования.
Как строится ROC-AUC?
ROC-AUC
(Receiver Operating Characteristic - Area Under the Curve)
— это графический метод оценки качества бинарных классификаторов и состоит из двух основных компонентов: кривой ROC и площади под этой кривой (AUC).
Как строится кривая ROC:
-
Оси графика: Ось X отображает False Positive Rate
(FPR), а ось Y — True Positive Rate(TPR).-
True Positive Rate (TPR), также известен как
RecallилиSensitivity, рассчитывается как . -
False Positive Rate (FPR) рассчитывается как .
-
-
Пороги классификации: Для построения кривой ROC модель применяется к данным, чтобы получить оценки вероятностей принадлежности к положительному классу. Затем изменяется порог, при котором предсказания считаются положительными, от низкого к высокому. Для каждого порога вычисляются значения TPR и FPR.
-
График: Каждая пара значений (FPR, TPR), полученная в результате изменения порога, отмечается на графике, образуя кривую.
AUC (Area Under the Curve):
- AUC — это мера, которая позволяет оценить, насколько хорошо модель способна различать классы. Значение AUC лежит в диапазоне от 0 до 1, где 1 означает идеальное различение классов, а 0.5 — что модель не имеет дискриминационной способности (работает на уровне случайных предсказаний).
Значение ROC-AUC:
ROC-AUC широко используется для оценки и сравнения моделей, поскольку площадь под кривой ROC не зависит от конкретного порога классификации и позволяет увидеть, насколько хорошо модель управляется с различением классов при разных уровнях чувствительности и специфичности.
Как вообще интерпретировать PR-AUC или ROC-AUC?
Площадь под PR-кривой (PR AUC) и площадь под ROC-кривой (ROC AUC) являются метриками оценки качества модели классификации.
-
PR AUC (площадь под PR-кривой): Оценивает качество модели, учитывая точность и полноту. Чем выше PR AUC, тем лучше модель способна находить положительные классы и минимизировать ложные срабатывания.
-
ROC AUC (площадь под ROC-кривой): Оценивает способность модели различать между классами. ROC AUC показывает отношение между долей истинно положительных и долей ложно положительных предсказаний при различных пороговых значениях. Чем выше ROC AUC, тем лучше модель различает между классами.
Интерпретация:
-
PR AUC: более высокое значение обычно лучше при оценке на одной выборке. Базовый уровень precision случайного ранжирования равен доле положительного класса, поэтому универсального ориентира 0.5 нет. При сравнении уточняйте, используется площадь с интерполяцией или Average Precision.
-
ROC AUC: Чем больше значение ROC AUC, тем лучше модель. Значение 0.5 также означает случайное угадывание, а значение 1 означает идеальную модель.
Что произойдёт с ROC-AUC если помножить предсказания на константу?
При умножении на положительную константу ROC-AUC не меняется. Отрицательная константа обращает порядок, и AUC становится 1 − AUC при стандартном учёте совпадений. Умножение на ноль делает все оценки равными и даёт AUC 0.5, если в выборке есть оба класса.