El ajuste por instrucciones entrena un modelo de lenguaje ya preentrenado usando pares de instrucción-respuesta (“resumí este texto” → resumen correspondiente), enseñándole específicamente a interpretar y seguir instrucciones formuladas en lenguaje natural, en lugar de solo continuar texto de forma general.
Su lugar en el proceso de entrenamiento
Suele aplicarse después del preentrenamiento general y antes (o junto con) el ajuste mediante RLHF, siendo uno de los pasos clave que transforma un modelo que “solo predice texto” en un asistente capaz de seguir órdenes específicas de forma útil.
