RLHF combina aprendizaje por refuerzo con evaluaciones hechas por personas: humanos comparan distintas respuestas generadas por un modelo y eligen cuál prefieren, y esas preferencias se usan para entrenar una señal de recompensa que guía al modelo hacia respuestas más útiles, seguras y alineadas con lo que las personas realmente esperan.
Por qué se volvió un paso estándar
El preentrenamiento sobre texto general no garantiza que un modelo responda de forma útil, honesta o segura en una conversación. RLHF fue la técnica que permitió convertir modelos de lenguaje “crudos” en asistentes conversacionales considerablemente más alineados con las expectativas humanas.
