La generación de texto a imagen es la creación de imágenes a partir de descripciones en lenguaje natural. La salida generada puede representar objetos, escenas, estilos o conceptos especificados en el prompt, sujeta al entrenamiento y las restricciones de seguridad del modelo.