Вернуться в видеотеку

Собеседование на Middle Data Scientist | #Нанято S1E01RU

Публичное интервью на Middle Data Scientist с разбором опыта кандидата и серией технических и продуктовых задач. В конце интервьюер разбирает сильные стороны ответов и зоны роста.

Источник: Флесс

Открыть на YouTube

Таймлайн

Коротко о видео

Показано учебное собеседование на позицию Middle Data Scientist: Алексей Чернобровов интервьюирует Анастасию Никулину и затем даёт развёрнутый фидбэк. Кандидатка рассказывает о сегментации клиентов МТС, задачах рекламного агентства, работе в Росбанке и учебном проекте по кластеризации комментариев YouTube с MLflow и Airflow. Техническая часть охватывает вероятность, SQL, линейные модели, отбор признаков, спектральную кластеризацию, валидацию, экономику churn-модели и A/B-тесты; по оценке интервьюера, техническая база сильная, а в продуктово-бизнесовых ответах не хватает уверенности и чёткости формулировок.

Затронутые темы

Что взять на заметку

  • Для сегментации клиентов недостаточно получить кластеры: нужно выделить различия сегментов, выбрать каналы воздействия и проверить, сохраняется ли поведение после перевода в новый канал.
  • Качество кластеризации стоит оценивать не только Silhouette score, но и размером и наполненностью кластеров, межкластерными расстояниями и содержательной интерпретируемостью тем или сегментов.
  • В задаче с двумя урнами выигрышная стратегия — положить один белый шар в одну урну, а остальные шары в другую; так вероятность достать белый шар выше базовых 1/2.
  • При поиске медианы в SQL без MEDIAN() нужен порядок значений, нумерация строк оконной функцией и отдельная обработка чётного и нечётного числа наблюдений.
  • Линейные модели полезны, когда критичны скорость онлайн-скоринга и объяснимость, например в кредитном скоринге; при сложных нелинейностях стоит сравнивать их с деревьями и бустингом.
  • Для сокращения числа признаков обсуждаются ранжирование важности, permutation importance и L1-регуляризация (Lasso), после которых результат следует проверять на реальном качестве модели.
  • При дисбалансе классов нужна стратификация фолдов, а для временных рядов обучение и проверка должны идти по времени без перемешивания будущих и прошлых данных.
  • В churn-задаче выбирать модель следует по денежной матрице последствий false positive и false negative; в A/B-тестах с множеством метрик нужна поправка на множественные проверки гипотез.

Рекомендуем посмотреть