Datapedia
Machine Learning

TF-IDF

Técnica de representación de texto que pondera cada palabra según su frecuencia en un documento específico, mientras penaliza las palabras que aparecen en casi todos los documentos de una colección.

NLPRepresentación de texto

TF-IDF (Term Frequency - Inverse Document Frequency) combina dos ideas: cuántas veces aparece una palabra dentro de un documento específico (frecuencia del término), y qué tan rara o común es esa palabra en el conjunto completo de documentos (frecuencia inversa de documento), dando más peso a palabras distintivas y menos a palabras muy comunes como artículos o preposiciones.

Por qué mejora sobre la bolsa de palabras simple

Palabras como “el” o “de” aparecerían con mucha frecuencia en una bolsa de palabras simple sin aportar información distintiva sobre el contenido del documento. TF-IDF reduce automáticamente su peso, destacando en cambio palabras que son frecuentes en un documento específico pero poco comunes en el resto de la colección.