Datapedia
Inteligencia Artificial

RLHF (aprendizaje por refuerzo con feedback humano)

Técnica de entrenamiento que ajusta un modelo de lenguaje usando las preferencias de evaluadores humanos, para que sus respuestas sean más útiles y seguras.

LLMAprendizaje por refuerzo

RLHF combina aprendizaje por refuerzo con evaluaciones hechas por personas: humanos comparan distintas respuestas generadas por un modelo y eligen cuál prefieren, y esas preferencias se usan para entrenar una señal de recompensa que guía al modelo hacia respuestas más útiles, seguras y alineadas con lo que las personas realmente esperan.

Por qué se volvió un paso estándar

El preentrenamiento sobre texto general no garantiza que un modelo responda de forma útil, honesta o segura en una conversación. RLHF fue la técnica que permitió convertir modelos de lenguaje “crudos” en asistentes conversacionales considerablemente más alineados con las expectativas humanas.