Вернуться в видеотеку

#14 Успешное собеседование Data Scientist | Оффер 350к

Техническое собеседование Data Scientist с разбором ансамблей деревьев, метрик качества и прикладного кейса по прогнозированию нагрузки колл-центра. Автор также рассказывает о своём подходе к подготовке через реальные интервью.

Источник: Вадим Новосёлов | Карьера в IT

Открыть на YouTube

Таймлайн

Коротко о видео

Автор показывает запись технической части собеседования Data Scientist и заявляет, что после него получил реальный оффер, однако название компании не раскрывается. Вопросы охватывают градиентный бустинг и случайный лес, построение деревьев, метрики классификации и регрессии. В финале разбирают бизнес-кейс: прогноз нагрузки колл-центра доставки и планирование смен операторов.

Затронутые темы

Что взять на заметку

  • В градиентном бустинге последующие модели обучаются исправлять ошибку предыдущего ансамбля; гиперпараметры удобно разделять на параметры деревьев и процесса обучения.
  • При поиске сплита обсуждаются прирост критерия неоднородности, инкрементальный пересчёт метрики и гистограммирование непрерывных признаков для ускорения обучения.
  • Для несбалансированной классификации accuracy недостаточна: обсуждаются precision, recall, F-мера и ROC-AUC, зависящий от ранжирования скоров.
  • Выбор между MSE и MAE в регрессии следует связывать с ценой крупных ошибок, выбросами и тем, насколько важен длинный хвост целевой переменной.
  • Для прогнозирования нагрузки колл-центра нужны календарные признаки, лаги и агрегаты прошлых периодов, а также учёт акций, праздников и других внешних факторов.
  • Прогноз спроса должен переходить в операционное решение: распределение сотрудников по сменам и, как один из вариантов, стимулирование работы в пиковые часы.

Рекомендуем посмотреть