PRM
阿里云通义开源最强过程奖励PRM模型,7B尺寸比GPT-4o更能发现推理错误
1月16日,阿里云通义开源全新的数学推理过程奖励模型Qwen2.5-Math-PRM,72B及7B尺寸模型性能均大幅超越同类开源过程奖励模型;在识别推理错误步骤能力上,Qwen2.5-Math-PRM以7B的小尺寸就超越了GPT-4o。 同时,通义团队还开源首个步骤级的评估标准 ProcessBench,填补了大模型推理过程错误评估的空白。 在当前大模型推理过程中,不时存在逻辑错误或编造看似合理的推理步骤,如何准确识破过程谬误并减少它,对增强大模型推理能力、提升推理可信度尤为关键。
1/16/2025 3:02:00 PM
新闻助手
- 1
资讯热榜
标签云
人工智能
AIGC
OpenAI
AI绘画
ChatGPT
机器人
数据
谷歌
智能
学习
大模型
Midjourney
GPT
用户
AI创作
微软
图像
开源
Meta
技术
论文
Stable Diffusion
生成式
算法
蛋白质
芯片
马斯克
计算
神经网络
Gemini
AI设计
代码
Sora
研究
腾讯
3D
开发者
场景
GPU
伟达
预测
模态
英伟达
华为
AI
Transformer
机器学习
文本
驾驶
神器推荐
AI视频
深度学习
干货合集
LLaMA
算力
搜索
苹果
视频生成
2024
AI for Science
科技
百度
应用
AI应用场景
Copilot
具身智能
安全
写作
特斯拉
机器
视觉
字节跳动
AGI
语音
架构
英特尔
prompt
Claude
DeepSeek
Anthropic