Вернуться в видеотеку

Собеседование Junior Data Scientist: вопросы и задача

Интервьюер проводит выпускнице техническое собеседование на позицию Junior Data Scientist. Они разбирают постановку задачи, модели классификации, признаки, метрики, статистическую проверку и задачу на Python.

Источник: Эльбрус Буткемп: школа программирования

Открыть на YouTube

Коротко о видео

Это открытое техническое собеседование выпускницы на позицию Junior Data Scientist. После знакомства интервьюер предлагает разобрать задачу классификации мошеннических операций: выбор начальной модели, признаки и метрики. Кандидатка отвечает на вопросы о логистической регрессии, деревьях решений, случайном лесе, бутстреп-выборках, регуляризации и кодировании категориальных признаков. Отдельный блок посвящён текстовым признакам, эмбеддингам, сравнению моделей, нулевой гипотезе, p-value и ограничениям ROC AUC при дисбалансе классов. В завершение кандидатка решает Python-задачу на группировку пар ключ—значение, обсуждает hashable-типы и оценивает сложность алгоритма. Интервьюер отмечает сильные стороны, неточности в статистике и направления для дальнейшей подготовки.

Затронутые темы

Что взять на заметку

  • Начать задачу классификации можно с логистической регрессии как интерпретируемой базовой модели.
  • Случайный лес строится из множества деревьев, обученных на выборках с повторениями.
  • Для номинальных категорий применяют отдельные признаки, а для текста рассматривают эмбеддинги и размерность получившихся признаков.
  • Сравнение моделей требует корректной тестовой выборки и статистической формулировки гипотез.
  • При сильном дисбалансе классов метрики нужно выбирать осознанно: одной ROC AUC может быть недостаточно.
  • Ключи словаря в Python должны быть hashable, поэтому изменяемые структуры нельзя использовать как ключи.

Рекомендуем посмотреть