文本生成
大视觉语言模型基准数据集ReForm-Eval:新瓶装旧酒,给旧有的基准数据集换个形式就能用来评估新的大视觉语言模型
概要复旦DISC实验室推出了ReForm-Eval,一个用于综合评估大视觉语言模型的基准数据集。ReForm-Eval通过对已有的、不同任务形式的多模态基准数据集进行重构,构建了一个具有统一且适用于大模型评测形式的基准数据集。所构建的ReForm-Eval具有如下特点:构建了横跨8个评估维度,并为每个维度提供足量的评测数据(平均每个维度4000余条);具有统一的评测问题形式(包括单选题和文本生成问题);方便易用,评测方法可靠高效,且无需依赖ChatGPT等外部服务;高效地利用了现存的数据资源,无需额外的人工标注,并
10/20/2023 10:59:00 AM
FudanDISC
- 1
资讯热榜
DeepSeek R1 简易指南:架构、本地部署和硬件要求
DeepSeek 全面指南:95% 的人都不知道的九个技巧
硅基流动×华为云联合推出基于昇腾云的DeepSeek R1&V3推理服务
冲击DeepSeek R1,谷歌发布新一代Gemini全型号刷榜,编程、物理模拟能力炸裂
DeepSeek V3 和 R1 模型完成海光 DCU 国产化适配并正式上线
DeepSeek开源多模态模型Janus-Pro的ComfyUI使用教程,文中附模型和工作流下载
不到140块!李飞飞团队超低成本复刻DeepSeek R1推理!16张H100只训练了26分钟,与R1训练方法不同!
香橙派发布 AI Studio Pro 算力卡华为昇腾开发板,13606 元起
标签云
人工智能
AIGC
OpenAI
AI绘画
ChatGPT
机器人
数据
谷歌
智能
学习
Midjourney
大模型
GPT
用户
AI创作
微软
图像
开源
Meta
技术
论文
Stable Diffusion
生成式
算法
蛋白质
马斯克
芯片
AI
计算
Gemini
神经网络
AI设计
代码
研究
Sora
腾讯
DeepSeek
3D
开发者
场景
GPU
伟达
预测
英伟达
模态
华为
Transformer
机器学习
文本
驾驶
神器推荐
AI视频
深度学习
干货合集
搜索
LLaMA
算力
AI for Science
苹果
视频生成
2024
科技
百度
Copilot
应用
AI应用场景
安全
具身智能
写作
特斯拉
机器
字节跳动
模型
视觉
语音
Anthropic
AGI
架构
prompt
英特尔