Datapedia
Inteligencia Artificial

RLAIF (aprendizaje por refuerzo con retroalimentación de IA)

Variante de RLHF donde las evaluaciones de calidad de las respuestas las genera otro modelo de IA, en lugar de evaluadores humanos.

LLMAprendizaje por refuerzo

RLAIF reemplaza a los evaluadores humanos de RLHF por otro modelo de IA, entrenado o instruido para juzgar la calidad de las respuestas según ciertos criterios definidos. Esto reduce el costo y el tiempo que implica depender exclusivamente de evaluación humana para cada ejemplo.

Su compromiso principal

Si el modelo evaluador tiene sus propios sesgos o limitaciones, esos problemas pueden transferirse al modelo que se está entrenando, por lo que suele combinarse con supervisión humana en una fracción de los casos para mantener cierta calidad de control.