Middle Data Scientist | Выпуск 1. Секция ML | Собеседование | karpov.courses
Первая часть mock-интервью по ML для Middle Data Scientist. Разбираются дизайн LTV-модели, оценка прогнозов, бустинг, регуляризация и понижение размерности.
karpov.courses
Открыть на YouTube- Опубликовано на YouTube:
- Просмотры на YouTube: 27,7 тыс.
- Лайки на YouTube: 528
Таймлайн
Коротко о видео
Это mock-интервью на позицию Middle Data Scientist: кандидатка решает ML Design-задачу о прогнозировании LTV клиента на горизонте шести месяцев в финтех-продукте. Собеседники уточняют бизнес-контекст, холодный старт, переобучение при аномалиях, выбор признаков, валидацию и представление результата бизнесу. Во второй части обсуждают метрики и функции потерь, деревья решений и gradient boosting, особенности CatBoost, регуляризацию и методы понижения размерности.
Затронутые темы
Что взять на заметку
- Для задачи LTV сначала зафиксируйте тип бизнеса, горизонт прогноза, определение ухода клиента и то, какие решения бизнес примет по прогнозу.
- Начните с интерпретируемого baseline на поведенческих признаках — например, recency, frequency и истории операций — и валидируйте его на последовательных временных окнах.
- Сравнивайте линейную модель с градиентным бустингом после обогащения данных профилем клиента, источником привлечения и при необходимости макроэкономическими признаками.
- Для новых пользователей выделяйте отдельный сценарий: используйте анкету, trial-период, раннее поведение в продукте и источник привлечения, а не признаки, требующие длинной истории.
- При аномалиях и сдвигах поведения не обещайте устойчивый прогноз: отслеживайте смещение ошибки, объясняйте ограничение бизнесу и переобучайте модель на обновлённых данных.
- При сильно различающихся денежных объёмах проверяйте относительные и асимметричные метрики; MSE может быть чувствительна к выбросам, а квантильная функция потерь позволяет по-разному штрафовать недо- и перепрогноз.
- Деревья регрессии не экстраполируют за диапазон целевой переменной в обучающих данных; gradient boosting последовательно улучшает ансамбль, обучая следующие деревья на ошибках предыдущих.