TF-IDF (Term Frequency - Inverse Document Frequency) combina dos ideas: cuántas veces aparece una palabra dentro de un documento específico (frecuencia del término), y qué tan rara o común es esa palabra en el conjunto completo de documentos (frecuencia inversa de documento), dando más peso a palabras distintivas y menos a palabras muy comunes como artículos o preposiciones.
Por qué mejora sobre la bolsa de palabras simple
Palabras como “el” o “de” aparecerían con mucha frecuencia en una bolsa de palabras simple sin aportar información distintiva sobre el contenido del documento. TF-IDF reduce automáticamente su peso, destacando en cambio palabras que son frecuentes en un documento específico pero poco comunes en el resto de la colección.
