Вернуться в видеотекуКоротко о видео
Это учебное mock-интервью на позицию Junior Data Scientist: кандидат проходит секции по Python, A/B-тестам, работе с данными и ML-алгоритмам. Интервьюер разбирает изменяемость объектов и копирование словарей, дизайн эксперимента для рекомендательной системы, SQL и реализацию агрегации, а затем линейную регрессию, деревья и случайный лес. В финальной обратной связи интервьюер отмечает, что кандидату особенно стоит укрепить Python, оконные функции, практику A/B-тестов и базовые темы ML.
Затронутые темы
Что взять на заметку
- Подготовьте объяснение различий между изменяемыми и неизменяемыми объектами Python: list, dict и set изменяемы; присваивание сохраняет ссылку, а для независимого объекта нужна копия.
- Умейте на небольшом примере объяснить, как проверить идентичность объектов через id(), почему изменение dict внутри функции меняет исходный объект и когда нужны copy() или deepcopy().
- Для A/B-теста рекомендательной модели сформулируйте продуктовые метрики, например CTR и конверсию в покупку, способ рандомизации, размер выборки, MDE, уровень значимости и мощность.
- Для конверсионных метрик нужно уметь сравнивать доли; в обсуждении упоминаются chi-square и bootstrap, а выбор метода должен зависеть от постановки и данных.
- Повторите SQL: WHERE фильтрует строки до агрегации, HAVING — результаты агрегации; также нужны LEFT, INNER, FULL, CROSS JOIN и понимание их результата.
- Оконные функции названы ожидаемым минимумом для junior data analyst; полезно практиковать агрегаты с OVER, PARTITION BY, ORDER BY и рамками окна.
- По ML нужно последовательно объяснять loss, обновление весов градиентным спуском, регуляризацию, кросс-валидацию, построение дерева по энтропии и идею bagging в Random Forest.