#16 Собеседование Data Scientist на Госуслуги. Пора менять профессию))
Разбор интервью Data Scientist на проект Госуслуг: классификация текстов, метрики, TF-IDF, развёртывание модели и архитектуры нейросетей.
Вадим Новосёлов | Карьера в IT
Открыть на YouTube- Опубликовано на YouTube:
- Просмотры на YouTube: 17,7 тыс.
- Лайки на YouTube: 612
Таймлайн
Коротко о видео
На собеседовании по NLP кандидат обсуждает многоклассовую классификацию обращений, выбор метрик и признаки TF-IDF. Вторая часть проверяет уже инженерную сторону решения: асинхронность, сохранение модели, трансформеры и ускорение инференса.
Затронутые темы
Что взять на заметку
- Для несбалансированной многоклассовой задачи нужно заранее выбрать способ усреднения метрик, а не ограничиваться общей accuracy.
- TF-IDF превращает текст в признаки через частоту слова в документе и штраф за его распространённость по корпусу.
- При сравнении CNN, RNN и трансформеров стоит связывать архитектуру с длиной контекста, параллельностью обучения и стоимостью инференса.