大型视觉语言模型
将多模态大模型稀疏化,3B模型MoE-LLaVA媲美LLaVA-1.5-7B
对于大型视觉语言模型(LVLM)而言,扩展模型可以有效提高模型性能。然而,扩大参数规模会显著增加训练和推理成本,因为计算中每个 token 都会激活所有模型参数。基于此,来自北京大学、中山大学等机构的研究者联合提出了一种新颖的 LVLM 训练策略 ——MoE-Tuning。MoE-Tuning 可以构建参数数量惊人但计算成本恒定的稀疏模型,并有效解决通常与多模态学习和模型稀疏性相关的性能下降问题。该研究还提出了一种基于 MoE 的新型稀疏 LVLM 架构 ——MoE-LLaVA 框架。该框架独特地在部署过程中通过路
1/31/2024 3:01:00 PM
机器之心
- 1
资讯热榜
标签云
人工智能
AIGC
OpenAI
AI绘画
ChatGPT
机器人
数据
谷歌
智能
学习
大模型
Midjourney
GPT
用户
AI创作
微软
图像
开源
Meta
技术
论文
Stable Diffusion
生成式
算法
蛋白质
芯片
马斯克
计算
神经网络
Gemini
AI设计
代码
Sora
研究
腾讯
3D
开发者
场景
GPU
伟达
预测
模态
英伟达
华为
AI
Transformer
机器学习
文本
驾驶
神器推荐
AI视频
深度学习
干货合集
LLaMA
算力
搜索
苹果
视频生成
2024
AI for Science
科技
百度
应用
AI应用场景
Copilot
具身智能
安全
写作
特斯拉
机器
视觉
字节跳动
AGI
语音
架构
英特尔
prompt
Claude
Anthropic
亚马逊