Datapedia
Inteligencia Artificial

Modelo de recompensa

Modelo entrenado para predecir qué tan buena, según preferencias humanas, es una respuesta generada por otro modelo de IA.

LLMRLHF

Un modelo de recompensa se entrena a partir de comparaciones hechas por evaluadores humanos entre distintas respuestas de un modelo de lenguaje, aprendiendo a predecir qué respuesta preferiría una persona. Esa predicción se usa después como señal de recompensa para ajustar el modelo principal mediante aprendizaje por refuerzo.

Su rol en RLHF

Es la pieza que traduce el criterio humano, difícil de expresar como una fórmula matemática exacta, en una señal numérica que un algoritmo de optimización sí puede usar para mejorar progresivamente las respuestas de un modelo de lenguaje.