腾讯优图实验室

没有等来OpenAI开源GPT-4o，等来了开源版VITA

开源领域又传来好消息。大语言模型 (LLM) 经历了重大的演变，最近，我们也目睹了多模态大语言模型 (MLLM) 的蓬勃发展，它们表现出令人惊讶的多模态能力。特别是，GPT-4o 的出现显著推动了 MLLM 领域的发展。然而，与这些模型相对应的开源模型却明显不足。开源社区迫切需要进一步促进该领域的发展，这一点怎么强调也不为过。本文，来自腾讯优图实验室等机构的研究者提出了 VITA，这是第一个开源的多模态大语言模型 (MLLM)，它能够同时处理和分析视频、图像、文本和音频模态，同时具有先进的多模态交互体验。研究者以