LongVILA - AI在线

支持1024帧、准确率近100％，英伟达「LongVILA」开始发力长视频

现在，长上下文视觉语言模型（VLM）有了新的全栈解决方案 ——LongVILA，它集系统、模型训练与数据集开发于一体。现阶段，将模型的多模态理解与长上下文能力相结合是非常重要的，支持更多模态的基础模型可以接受更灵活的输入信号，以便人们可以以更多样化的方式与模型交互。而更长的上下文使模型处理的信息更多，例如长文档、长视频，这种能力同样为更多现实世界的应用程序提供了所需的功能。然而，目前面临的问题是一些工作已经启用了长上下文视觉语言模型（VLM），但通常是采用简化的方法，而不是提供一个全面的解决方案。全栈设计对于长上下