Метод векторизации
Основные методы векторизации текстовых данных.
Основные методы векторизации текстовых данных:
-
Мешок слов
(Bag of Words): Представляет текст как набор изолированных слов без учета порядка или структуры предложения. Каждое уникальное слово в тексте становится признаком, а его частота встречаемости в документе — значением этого признака. -
TF-IDF
(Term Frequency-Inverse Document Frequency): Учитывает не только частоту встречаемости слова в документе (TF), но и обратную частоту его встречаемости во всех документах коллекции (IDF). Это позволяет выделить наиболее информативные слова, учитывая их важность в контексте всей коллекции документов. -
Word Embeddings: Представляют слова в виде векторов непрерывного пространства, где семантически близкие слова имеют близкие векторные представления. Примеры включают Word2Vec, GloVe и FastText. -
Doc2Vec: Расширение Word2Vec, которое представляет не только отдельные слова, но и целые документы в виде векторов, сохраняя их семантическое содержание. -
N-граммы: Включают в себя комбинации из нескольких последовательных слов или символов. Например, биграммы (2-граммы) содержат последовательности из двух слов, триграммы (3-граммы) — из трех и т.д.