La arquitectura Transformer es un diseño de red neuronal basado en capas de atención, capas feed-forward e información posicional, en lugar de recurrencia o convolución como mecanismo principal de secuencia. Permite entrenamiento paralelo eficiente y se ha convertido en un diseño central para grandes modelos de lenguaje y otros modelos fundacionales.
Transformer architecture is a type of deep learning model designed to process sequences of data, eg text, by focusing on the relationship between different parts of the input. The transformers are fast, flexible, easily scalable and are highly efficient in understanding context, making them the foundation for generative systems.