#28 Собеседование Data Scientist в Т-Банк | Теория + Лайфкодинг
Разбор интервью Data Scientist в Т-Банке: деревья, случайный лес и бустинг, важность признаков, метрики классификации и практические задачи.
Вадим Новосёлов | Карьера в IT
Открыть на YouTube- Опубликовано на YouTube:
- Просмотры на YouTube: 32,7 тыс.
- Лайки на YouTube: 1,6 тыс.
Таймлайн
Коротко о видео
Разбор интервью в Т-Банке сосредоточен на деревьях, ансамблях и метриках бинарной классификации, после чего кандидат решает две практические задачи. Особое внимание уделено тому, как объяснять ROC-AUC заказчику и как менять баланс precision и recall.
Затронутые темы
Что взять на заметку
- Категориальные признаки можно кодировать заранее или обрабатывать нативно, но важно объяснить риск утечки при target encoding.
- Чтобы повысить recall ценой precision, обычно снижают порог положительного класса и проверяют новую рабочую точку по PR-кривой.
- При дисбалансе классов нужно назвать способ усреднения метрик: micro учитывает все объекты вместе, macro даёт классам равный вес, weighted учитывает размер классов.