Also known as: Multimodal Instruction tuned
Multimodal instruction-tuned описывает модель, обученную следовать пользовательским instructions across multiple data modalities, например text и images. Такая tuning помогает модели согласовывать multimodal inputs с task-oriented outputs в conversational или assistant-like setting.
An instruction-tuned model that can process input beyond text, such as images, video, and audio.