余数
贾佳亚团队联手剑桥清华等共推评测新范式 一秒侦破大模型“高分低能”
颠覆过往大模型评测标准,最新、最全、最权威的测评数据集MR-Ben来了!这是继今年4月发布堪称GPT-4 DALL- E-3的王炸产品超强视觉语言模型Mini-Gemini后,港中文贾佳亚团队再次提出的极具代表性的作品。在MR-Ben的“监督”下,大模型不仅要像学生那样会答题,还要像老师那样会阅卷,真实的推理能力无所遁形。MR-Ben细致地评测了不少国内外一线的开源和闭源模型,如GPT4-Turbo、Cluade3.5-Sonnet、Mistral-Large、Zhipu-GLM4、Moonshot-v1、Yi
7/18/2024 3:38:00 PM
新闻助手
- 1
资讯热榜
标签云
人工智能
AIGC
OpenAI
AI绘画
ChatGPT
机器人
数据
谷歌
智能
学习
大模型
Midjourney
GPT
用户
AI创作
微软
图像
开源
Meta
技术
论文
Stable Diffusion
生成式
算法
蛋白质
芯片
马斯克
计算
神经网络
Gemini
AI设计
代码
Sora
研究
腾讯
3D
开发者
场景
GPU
伟达
预测
模态
英伟达
华为
AI
Transformer
机器学习
文本
驾驶
神器推荐
AI视频
深度学习
干货合集
LLaMA
算力
搜索
苹果
视频生成
2024
AI for Science
科技
百度
应用
AI应用场景
Copilot
具身智能
安全
写作
特斯拉
机器
视觉
字节跳动
AGI
语音
架构
英特尔
prompt
Claude
Anthropic
亚马逊