Вернуться в видеотеку

100 Data Science вопросов мидлу! Парень c Физтеха проходит собеседование

Интенсивный разбор вопросов для Data Science-собеседования с опытным кандидатом. В ролике последовательно проверяют знания от Python и статистики до ансамблей, нейросетей и LLM-оптимизации.

Источник: Aleron Миленькин

Открыть на YouTube

Таймлайн

Коротко о видео

Это скоростное тренировочное собеседование по Data Science: Роман за 30 минут отвечает на вопросы по Python, SQL, статистике и машинному обучению. Основной блок охватывает метрики, A/B-тесты, рекомендательные системы, обучение моделей, регуляризацию и ансамбли. После истечения времени ведущие задают дополнительные вопросы о кластеризации, PCA, нейросетях и оптимизации языковых моделей; по подсчёту ведущего, кандидат ответил более чем на 75 вопросов.

Затронутые темы

Что взять на заметку

  • Повторить основы Python и pandas: принципы ООП, магические методы, super(), неизменяемость tuple, yield, loc/iloc, groupby().transform() и сводные таблицы.
  • Подготовить SQL-блок: агрегирующие, ранжирующие и оконные функции; различия CHAR/VARCHAR и DELETE/TRUNCATE.
  • Уметь объяснить MLE и MAP, p-value, нулевую гипотезу, множественное тестирование и поправку Бонферрони.
  • Для экспериментов важно уметь формировать сопоставимые группы, стратифицировать выборку и использовать исторические данные для снижения дисперсии.
  • Связывать метрику с бизнес-ценой ошибки: в anti-fraud, по ответу кандидата, важнее не пропускать подозрительные операции, чем избегать лишних проверок.
  • Различать bagging, boosting, stacking и blending; объяснять переобучение, валидацию, L1/L2-регуляризацию, bias–variance trade-off и раннюю остановку.
  • Освежить различия k-NN, k-means и Gaussian Mixture Model, PCA, ResNet, U-Net, исчезающие/взрывающиеся градиенты, дистилляцию и квантизацию.

Рекомендуем посмотреть