Вернуться в видеотеку

#26 Junior Data Scientist | РЕАЛЬНОЕ СОБЕСЕДОВАНИЕ | Ответы

Разбор вопросов из записи собеседования Data Scientist с пояснениями автора по Python, ML-метрикам, нейросетям и подготовке данных для распознавания речи. В конце подводится заявленный итог интервью и рекламируется программа подготовки к офферу.

Источник: Вадим Новосёлов | Карьера в IT

Открыть на YouTube

Таймлайн

Коротко о видео

Автор разбирает запись, которую называет реальным собеседованием на позицию Data Scientist, и комментирует ответы кандидата, в том числе использование им заранее подготовленной «легенды». Основная часть посвящена Python, Pandas и NumPy, метрикам классификации и регрессии, дисбалансу классов, переобучению, архитектурам нейросетей и подготовке аудиоданных для ASR. В финале автор сообщает, что кандидат не прошёл это интервью из-за слабых знаний нейросетей, но, по его словам, позднее получил оффер на 300 000 ₽ в месяц; компания не названа.

Затронутые темы

Что взять на заметку

  • Повторить базовый Python для интервью: назначение декораторов, изменяемость list и неизменяемость tuple, а также различие между присваиванием ссылок и созданием копии объекта.
  • Потренироваться писать операции с данными в Pandas и NumPy; уметь объяснить, что .loc обращается по меткам индекса и столбцов, а .iloc — по их позициям.
  • Для классификации подготовить точные определения accuracy, precision, recall, F1/F-beta и ROC-AUC, а также связь метрик с дисбалансом классов и выбором порога вероятности.
  • Для регрессии знать MSE, MAE и R²; отдельно помнить ограничение R²: он не уменьшается при добавлении бесполезных признаков, поэтому им нельзя напрямую сравнивать модели с разным числом фичей.
  • Уметь объяснить переобучение как ухудшение качества на тестовых данных при слишком сильной подгонке под обучающую выборку. По поводу ресемплинга и весов классов автор высказывает собственную спорную позицию, поэтому на интервью лучше обосновывать выбор метода условиями задачи.
  • Освежить типы нейросетей: полносвязные, CNN, RNN/LSTM и Transformer с attention; для задач speech-to-text — очистку текста, шумоподавление и нормализацию аудио, а также ограничение: предобработка на обучении должна быть воспроизводима в продакшене.
  • Подготовиться к терминам из обработки аудио и текста, включая частоту дискретизации и N-граммы, а также к вопросам о Transformer и механизме attention.

Рекомендуем посмотреть