Вернуться в видеотеку

Middle Data Scientist | Выпуск 1. Секция ML | Собеседование | karpov.courses

Первая часть mock-интервью по ML для Middle Data Scientist. Разбираются дизайн LTV-модели, оценка прогнозов, бустинг, регуляризация и понижение размерности.

Источник: karpov.courses

Открыть на YouTube

Таймлайн

Коротко о видео

Это mock-интервью на позицию Middle Data Scientist: кандидатка решает ML Design-задачу о прогнозировании LTV клиента на горизонте шести месяцев в финтех-продукте. Собеседники уточняют бизнес-контекст, холодный старт, переобучение при аномалиях, выбор признаков, валидацию и представление результата бизнесу. Во второй части обсуждают метрики и функции потерь, деревья решений и gradient boosting, особенности CatBoost, регуляризацию и методы понижения размерности.

Затронутые темы

Что взять на заметку

  • Для задачи LTV сначала зафиксируйте тип бизнеса, горизонт прогноза, определение ухода клиента и то, какие решения бизнес примет по прогнозу.
  • Начните с интерпретируемого baseline на поведенческих признаках — например, recency, frequency и истории операций — и валидируйте его на последовательных временных окнах.
  • Сравнивайте линейную модель с градиентным бустингом после обогащения данных профилем клиента, источником привлечения и при необходимости макроэкономическими признаками.
  • Для новых пользователей выделяйте отдельный сценарий: используйте анкету, trial-период, раннее поведение в продукте и источник привлечения, а не признаки, требующие длинной истории.
  • При аномалиях и сдвигах поведения не обещайте устойчивый прогноз: отслеживайте смещение ошибки, объясняйте ограничение бизнесу и переобучайте модель на обновлённых данных.
  • При сильно различающихся денежных объёмах проверяйте относительные и асимметричные метрики; MSE может быть чувствительна к выбросам, а квантильная функция потерь позволяет по-разному штрафовать недо- и перепрогноз.
  • Деревья регрессии не экстраполируют за диапазон целевой переменной в обучающих данных; gradient boosting последовательно улучшает ансамбль, обучая следующие деревья на ошибках предыдущих.

Рекомендуем посмотреть