Qué es
La visión por computadora busca que una máquina pueda “entender” el contenido de imágenes o videos: identificar objetos, personas, texto, escenas o anomalías, de forma similar a como lo hace el sistema visual humano, pero a partir de píxeles procesados numéricamente.
Tareas típicas
- Clasificación de imágenes: determinar qué hay en una imagen.
- Detección de objetos: ubicar y delimitar objetos específicos dentro de una imagen.
- Segmentación: identificar con precisión los píxeles que pertenecen a cada objeto.
- Reconocimiento facial y OCR: identificar personas o extraer texto de imágenes.
Cómo evolucionó
Durante años dependió de reglas y características diseñadas a mano. La llegada de las redes neuronales convolucionales cambió el campo por completo, permitiendo que el propio modelo aprenda qué características visuales son relevantes directamente de los datos.
