En visión por computador, un modelo bag-of-words representa una imagen mediante recuentos u ocurrencias de características visuales locales en lugar de tokens de palabras. Estas características visuales se agrupan en un vocabulario de palabras visuales, produciendo una representación similar a un histograma que puede apoyar la clasificación y recuperación de imágenes.
In computer vision, the bag-of-words model (BoW model) can be applied to image classification, by treating image features as words. In document classification, a bag of words is a sparse vector of occurrence counts of words; that is, a sparse histogram over the vocabulary. In computer vision, a bag of visual words is a vector of occurrence counts of a vocabulary of local image features.