Вернуться в каталог собеседований

#16 Собеседование Data Scientist на Госуслуги. Пора менять профессию))

Разбор интервью Data Scientist на проект Госуслуг: классификация текстов, метрики, TF-IDF, развёртывание модели и архитектуры нейросетей.

Вадим Новосёлов | Карьера в IT
  • Опубликовано на YouTube:
  • Просмотры на YouTube: 17,7 тыс.
  • Лайки на YouTube: 612
Открыть на YouTube

Таймлайн

Коротко о видео

На собеседовании по NLP кандидат обсуждает многоклассовую классификацию обращений, выбор метрик и признаки TF-IDF. Вторая часть проверяет уже инженерную сторону решения: асинхронность, сохранение модели, трансформеры и ускорение инференса.

Затронутые темы

Что взять на заметку

  • Для несбалансированной многоклассовой задачи нужно заранее выбрать способ усреднения метрик, а не ограничиваться общей accuracy.
  • TF-IDF превращает текст в признаки через частоту слова в документе и штраф за его распространённость по корпусу.
  • При сравнении CNN, RNN и трансформеров стоит связывать архитектуру с длиной контекста, параллельностью обучения и стоимостью инференса.

Рекомендуем посмотреть