¿Qué es?
Un embedding es una representación numérica —un vector de números— de un dato como una palabra, una frase, una imagen o un usuario. La idea central es que elementos con significados o características similares terminan ubicados cerca unos de otros en ese espacio vectorial, aunque tenga cientos o miles de dimensiones.
Por ejemplo, en un buen espacio de embeddings de texto, las palabras “rey” y “reina” estarán más cerca entre sí que “rey” y “bicicleta”, porque el modelo capturó relaciones semánticas a partir de cómo se usan esas palabras en el lenguaje.
Cómo se generan
Los embeddings se obtienen entrenando redes neuronales sobre grandes volúmenes de datos. Durante el entrenamiento, el modelo ajusta los vectores para que la distancia entre ellos refleje relaciones útiles: similitud de significado, de estilo, de intención de búsqueda, etc.
Para qué se usan
- Búsqueda semántica: encontrar documentos relevantes por significado, no solo por coincidencia de palabras.
- Sistemas de recomendación: representar usuarios y productos en el mismo espacio para sugerir contenido similar.
- RAG (Retrieval-Augmented Generation): recuperar el contexto más relevante para alimentar a un modelo de lenguaje.
- Clasificación y clustering: agrupar datos similares sin necesidad de reglas manuales.
Bases de datos vectoriales
Como los embeddings solo son útiles si se pueden comparar y buscar rápido, existen bases de datos especializadas —bases de datos vectoriales— optimizadas para calcular similitud entre millones de vectores en milisegundos.
