---
title: Метод векторизации
seo:
  title: Метод векторизации — Data Scientist
  description: Тема «Метод векторизации» для собеседования Data Scientist. Основные методы векторизации текстовых данных.
---

[Все темы Data Scientist](/data-scientist)

## <strong>Основные методы векторизации текстовых данных.</strong> [#q-14bee738d69b816f8bb1f861b5e60fd9]

Основные методы векторизации текстовых данных&#58;

1. Мешок слов <code>&#40;Bag of Words&#41;</code>&#58; Представляет текст как набор изолированных слов без учета порядка или структуры предложения. Каждое уникальное слово в тексте становится признаком, а его частота встречаемости в документе — значением этого признака.

1. TF-IDF <code>&#40;Term Frequency&#45;Inverse Document Frequency&#41;</code>&#58; Учитывает не только частоту встречаемости слова в документе (TF), но и обратную частоту его встречаемости во всех документах коллекции (IDF). Это позволяет выделить наиболее информативные слова, учитывая их важность в контексте всей коллекции документов.

1. <code>Word Embeddings</code>&#58; Представляют слова в виде векторов
   непрерывного пространства, где семантически близкие слова имеют близкие
   векторные представления. Примеры включают Word2Vec, GloVe и FastText.

1. <code>Doc2Vec</code>&#58; Расширение Word2Vec, которое представляет не только
   отдельные слова, но и целые документы в виде векторов, сохраняя их
   семантическое содержание.

1. <code>N&#45;граммы</code>&#58; Включают в себя комбинации из нескольких
   последовательных слов или символов. Например, биграммы (2-граммы) содержат
   последовательности из двух слов, триграммы (3-граммы) — из трех и т.д.

:::note[Ссылки для изучения]

1. [Краткий обзор техник векторизации текста](https://habr.com/ru/articles/778048/)
   :::
