大规模强化学习

腾讯混元自研深度思考模型「T1」正式发布

近日,腾讯正式推出了其自研的深度思考模型——混元T1正式版。 混元T1正式版在大规模强化学习的基础上,针对数学、逻辑推理、科学和代码等理科难题进行了专项优化,从而实现了推理能力的显著提升。 在常见benchmark上,如大语言模型评估增强数据集MMLU-PRO中,混元T1取得了87.2分的优异成绩,仅次于顶尖模型o1。
  • 1