Datapedia
Machine Learning

K-Means

Algoritmo de clustering que agrupa observaciones en un número determinado de grupos (K), según su cercanía a un centro calculado para cada grupo.

ClusteringAprendizaje no supervisado

Qué es

K-Means es uno de los algoritmos de clustering más usados. Dado un número K de grupos a formar, el algoritmo ubica K centros iniciales, asigna cada observación al centro más cercano, recalcula la posición de cada centro como el promedio de sus observaciones asignadas, y repite este proceso hasta que los grupos se estabilizan.

Cómo elegir el número de grupos

El valor de K no lo determina el algoritmo por sí solo: hay que definirlo de antemano. Técnicas como el “método del codo”, que compara qué tan compactos quedan los grupos para distintos valores de K, ayudan a elegir un número razonable.

Sus limitaciones

Funciona mejor cuando los grupos tienen una forma aproximadamente esférica y un tamaño similar. Es sensible a la posición inicial de los centros y a la presencia de outliers, que pueden distorsionar significativamente los grupos resultantes.