RLAIF reemplaza a los evaluadores humanos de RLHF por otro modelo de IA, entrenado o instruido para juzgar la calidad de las respuestas según ciertos criterios definidos. Esto reduce el costo y el tiempo que implica depender exclusivamente de evaluación humana para cada ejemplo.
Su compromiso principal
Si el modelo evaluador tiene sus propios sesgos o limitaciones, esos problemas pueden transferirse al modelo que se está entrenando, por lo que suele combinarse con supervisión humana en una fracción de los casos para mantener cierta calidad de control.
