La interpretabilidad mecanicista intenta abrir la “caja negra” de una red neuronal a un nivel muy detallado, identificando qué hacen exactamente componentes específicos —neuronas individuales o grupos de ellas— y cómo se combinan para producir un comportamiento observado.
En qué se diferencia de la IA explicable en general
Mientras que la IA explicable en general busca dar explicaciones comprensibles para las personas sobre una decisión puntual, la interpretabilidad mecanicista busca un entendimiento mucho más profundo y técnico del funcionamiento interno del modelo, con el objetivo a largo plazo de poder predecir y controlar mejor su comportamiento.
