La clasificación de texto entrena un modelo para asignar automáticamente una categoría a un documento —un correo, una reseña, un artículo de noticias— basándose en patrones aprendidos de ejemplos previamente etiquetados con sus categorías correctas.
Cómo se representa el texto para el modelo
Antes de entrenar un modelo, el texto debe convertirse en una representación numérica, ya sea mediante técnicas clásicas como bolsa de palabras o TF-IDF, o mediante embeddings más modernos generados por modelos de lenguaje, que capturan mejor el significado y contexto del texto.
