Вернуться в видеотеку

Типичное собеседование #1. Позиция Junior Data Scientist. Accepted!

Тренировочное интервью на Junior Data Scientist с практическими задачами по Python и SQL, вопросами по ML, статистике и A/B-тестированию. Во второй части ведущие детально разбирают резюме кандидата и дают итоговый фидбек.

Источник: Aleron Миленькин

Открыть на YouTube

Таймлайн

Коротко о видео

Это тренировочное собеседование кандидата на Junior Data Scientist: ведущие проверяют Python, SQL, машинное обучение, статистику и затем разбирают резюме. Кандидат сообщает, что коммерческого опыта пока нет, но есть обучение и участие в хакатонах; интервьюеры дают развёрнутую обратную связь по его ответам. В финале они считают его теоретическую базу достаточной для Junior-позиции и рекомендуют усилить резюме конкретикой о проектах, образовании и навыках.

Затронутые темы

Что взять на заметку

  • Для задачи с переворотом двоичного представления числа используют `bin(n)`, убирают префикс `0b`, разворачивают строку и преобразуют её через `int(..., 2)`.
  • На Junior-уровне ожидают уверенное владение `SELECT`, `WHERE`, `INNER JOIN` и `LEFT JOIN`, включая понимание того, когда в правой таблице появятся `NULL` и как отфильтровать такие строки.
  • Построение ML-решения начинают с формулировки типа задачи и метрики: accuracy не подходит как единственная метрика для несбалансированной классификации; recall важнее при цене пропуска события, precision — при ограниченных или дорогих действиях.
  • Для отбора признаков обсуждаются корреляции, коэффициенты логистической регрессии с L1-регуляризацией, важности из деревьев и случайный шумовой признак как ориентир для отсечения слабых признаков; такие оценки нужно подтверждать качеством на валидации.
  • Категориальные признаки предлагают кодировать one-hot, ordinal или target encoding; для CatBoost категориальные столбцы передают отдельно, а не полагаются на произвольное числовое кодирование.
  • В A/B-тесте группы должны быть сопоставимы по важным признакам через стратификацию, а размер выборки и длительность эксперимента определяют расчётом мощности, а не интуитивно. p-value трактуют при условии справедливости нулевой гипотезы, а не как вероятность её истинности.
  • В резюме стоит явно указать целевую роль, статус и сроки образования, поднять GitHub и контакты наверх, перечислить конкретные технологии и описать хакатоны через решённые задачи и результат; уровень языка лучше обозначать по CEFR.

Рекомендуем посмотреть