El aprendizaje contrastivo entrena un modelo mostrándole pares de ejemplos similares (como dos fotos del mismo objeto desde ángulos distintos) y pares de ejemplos diferentes, ajustando sus representaciones internas para que los pares similares queden cerca entre sí en el espacio de embeddings, y los diferentes queden lejos.
Dónde se aplica
Es una técnica central para entrenar buenos embeddings sin necesitar etiquetas manuales detalladas, y es la base de varios modelos que relacionan imágenes con sus descripciones de texto correspondientes.
