Datapedia
Inteligencia Artificial

Aprendizaje por refuerzo

Técnica de machine learning en la que un agente aprende a tomar decisiones mediante prueba y error, recibiendo recompensas o penalizaciones.

AgentesRecompensaToma de decisiones

Qué es

En el aprendizaje por refuerzo, un agente interactúa con un entorno tomando acciones y recibiendo una señal de recompensa (positiva o negativa) según el resultado de esas acciones. Con el tiempo, el agente ajusta su estrategia (política) para maximizar la recompensa acumulada.

Elementos clave

  • Agente: quien toma las decisiones.
  • Entorno: el sistema con el que interactúa.
  • Acción: lo que el agente puede hacer en cada momento.
  • Recompensa: la señal que indica qué tan buena fue una acción.
  • Política: la estrategia que el agente va aprendiendo para decidir qué hacer.

Dónde se aplica

Es la técnica detrás de sistemas que juegan videojuegos o juegos de mesa a nivel sobrehumano, de la robótica que aprende a moverse por prueba y error, y también de una etapa del entrenamiento de modelos de lenguaje conversacionales (RLHF, aprendizaje por refuerzo con feedback humano).