Qué es
Una red neuronal convolucional (CNN) es una arquitectura diseñada para procesar imágenes de forma eficiente. En vez de conectar cada píxel con cada neurona, aplica filtros (kernels) que recorren la imagen detectando patrones locales, como bordes, texturas o formas.
Cómo funciona
Las primeras capas de una CNN detectan patrones simples (bordes, colores), mientras que las capas más profundas combinan esos patrones simples para reconocer formas más complejas, hasta llegar a objetos completos. Esta jerarquía de capas es lo que le permite reconocer, por ejemplo, un rostro o un animal en una foto.
Por qué fueron un salto importante
Las CNN redujeron drásticamente la cantidad de parámetros necesarios comparadas con una red neuronal densa tradicional aplicada directamente a imágenes, y durante casi una década fueron el estándar de la visión por computadora, antes de que arquitecturas basadas en Transformers también empezaran a aplicarse a imágenes.
