Вернуться в видеотеку

Техническое собеседование на Data Scientist

Учебное техническое mock-интервью для начинающего Data Scientist с практикой SQL и Python-задач, вопросами по ML, статистике и итоговым разбором решений.

Источник: Academica Courses

Открыть на YouTube

Таймлайн

Коротко о видео

Это учебное mock-интервью на позицию Data Scientist со студенткой Дианой: проверяют SQL, Python/pandas, визуализацию, статистику, машинное обучение и логику. В SQL она решает задачи с агрегациями, фильтрацией и JOIN, а в Python загружает CSV, создаёт признаки, строит графики и отфильтровывает выбросы по процентилям. По оценке интервьюера, она уверенно объясняет ход решения и открыто говорит о пробелах, но ей стоит усилить статистику, регуляризацию и более сложные SQL-конструкции.

Затронутые темы

Что взять на заметку

  • На интервью по SQL полезно проговаривать логику выполнения запроса: сначала источники данных и JOIN, затем фильтрация WHERE, после чего выбираются нужные поля и агрегации.
  • Нужно уметь решать базовые SQL-задачи: разницу между COUNT и COUNT(DISTINCT), среднее с фильтром по District и сумму населения через JOIN таблиц City и Country.
  • После pd.read_csv стоит сразу осмотреть данные через head() или describe(); в видео это отмечено как хорошая рабочая привычка.
  • Для графиков недостаточно построить histogram или scatter plot: следует добавлять подписи осей и заголовок, а вывод о корреляции обосновывать видом точек.
  • Стоит повторить меры центральной тенденции и разброса, доверительные интервалы, метрики классификации Accuracy и F1, а также типы регуляризации.
  • При удалении выбросов можно вычислить 1-й и 99-й процентили и отфильтровать DataFrame между ними; полезно вывести пороги и проверить результат.
  • В задаче о ровно одном орле при трёх бросках честной монеты в видео прозвучало 1/8, но это неверно: подходящих последовательностей три, поэтому вероятность равна 3/8.

Рекомендуем посмотреть