Attention Mechanism — техника, позволяющая модели вычислять контекстно-зависимые веса для элементов входа и использовать эти веса при генерации выхода. В transformer-based системах attention часто реализуется в нескольких heads, чтобы модель могла параллельно учитывать разные отношения. Этот механизм поддерживает контекстно-зависимое понимание языка, генерацию и обучение представлений.
Machine learning-based attention is a mechanism mimicking cognitive attention. It calculates "soft" weights for each word, more precisely for its embedding, in the context window. It can do it either in parallel (such as in transformers) or sequentially (such as in recursive neural networks). "Soft" weights can change during each runtime, in contrast to "hard" weights, which are (pre-)trained and fine-tuned and remain frozen afterwards. Multiple attention heads are used in transformer-based large language models.