Вернуться в видеотеку

Собеседование Data Science: Артур Кузин/Sber Devices vs Сергей Колесников/Tinkoff | #Нанято S1E02RU

Двухчасовое взаимное мок-интервью по Data Science с упором на Computer Vision, ML-метрики, нейросети и production-практики. В конце разговор переходит к кейсу классификации чувствительных обращений чат-бота и карьерной мотивации.

Источник: Флесс

Открыть на YouTube

Таймлайн

Коротко о видео

Это записанное в формате мок-интервью взаимное собеседование Артура Кузина из Sber Devices и Сергея Колесникова из Tinkoff. После рассказов о переходе в Data Science они разбирают метрики классификации, AUC, деревья и бустинг, CNN, BatchNorm, регуляризацию, attention, детекцию и сегментацию. В финале обсуждают мониторинг и ускорение моделей, работу с малым числом sensitive cases в чат-боте, а также мотивацию и soft skills.

Затронутые темы

Что взять на заметку

  • Для несбалансированной бинарной классификации нельзя выбирать метрику без бизнес-контекста: обсуждаются precision, recall, F1, PR-AUC и ROC-AUC, а также цена ложноположительных и ложноотрицательных решений.
  • Пороги классификации можно подбирать по классам, начиная с наиболее критичных; это помогает достигать требуемого recall или precision без переобучения модели.
  • В мультиклассовых задачах стоит различать micro-, macro- и weighted-агрегации метрик: они по-разному скрывают или выявляют проблемы редких классов.
  • При fine-tuning с маленьким batch size BatchNorm может давать ненадёжную статистику; собеседники обсуждают SyncBatchNorm и вариант заморозить BatchNorm после инициализации.
  • Для CV-интервью полезно уметь объяснить форму выхода свёртки, число параметров, замену крупных ядер последовательностью 3×3 или разложенными свёртками, а также отличие anchor-based и anchor-free детекторов.
  • Мониторинг модели в продакшене можно строить по бизнес-сигналам, confidence и неопределённости, drift распределений и классификатору, который отличает онлайн-данные от train-данных.
  • Для ускорения инференса обсуждаются distillation, pruning, quantization, уменьшение входного разрешения и развёртывание через NVIDIA Triton; каждое изменение нужно проверять на отложенной метрике качества.

Рекомендуем посмотреть