Datapedia
Inteligencia Artificial

Alineación de IA

Campo de investigación que busca asegurar que los sistemas de IA actúen de acuerdo con las intenciones y valores humanos, incluso a medida que se vuelven más capaces.

Seguridad de IAÉtica de IA

La alineación de IA estudia cómo diseñar y entrenar sistemas de inteligencia artificial que persigan objetivos consistentes con lo que sus creadores y usuarios realmente quieren, evitando comportamientos no deseados que podrían surgir de una especificación imperfecta de esos objetivos.

Un problema más sutil de lo que parece

Un modelo puede optimizar exactamente la señal de recompensa que se le indicó, y aun así producir resultados no deseados si esa señal no capturó bien la intención real detrás de ella, un fenómeno conocido como “especificación de recompensa deficiente” (reward hacking).