Un n-grama es una secuencia de N elementos consecutivos de un texto: un unigrama es una sola palabra, un bigrama son dos palabras consecutivas, un trigrama son tres, y así sucesivamente. Representar texto mediante n-gramas, en lugar de palabras sueltas, permite capturar algo de contexto local, como distinguir “no me gusta” de simplemente contar “no”, “me” y “gusta” por separado.
Su lugar en la historia del NLP
Antes de los modelos de lenguaje modernos basados en Transformer, los modelos de n-gramas fueron durante mucho tiempo el enfoque estándar para predecir la siguiente palabra de un texto, estimando la probabilidad de cada palabra según las N-1 palabras anteriores observadas en grandes colecciones de texto.
