中美 AI 挑战东京大学入学考试：双双合格，英语优异，数学欠佳

大学入学共通考试和二次考试合计的理科得分（满分 550 分）中，o1 获得了 374 分，R1 获得了 369 分，两者均超过了东大在 3 月 10 日公布的理科 3 类合格最低分数线（368.7 分）。

据日经新闻 4 月 5 日报道，日本经济新闻与民间企业、大型补习班的联合研究发现，中美两国新型生成式 AI 已具备通过日本最难关东京大学理科 3 类入学考试的“学力”。两个模型在考察语言能力的英语中取得高分，但在数学中多次出现论证错误等问题。

此次测试让美国 OpenAI 的“o1”和中国 AI 初创公司 DeepSeek 的“R1”两个基础模型解答 2025 年度的东大入学考试题。AI 初创公司 Life Prompt（东京・新宿）输出了答案，并由大型预备学校河合塾的讲师进行评分。

大学入学共通考试和二次考试合计的理科得分（AI在线注：满分 550 分）中，o1 获得了 374 分，R1 获得了 369 分，两者均超过了东大在 3 月 10 日公布的理科 3 类合格最低分数线（368.7 分）。

R1 在理科 1 类和理科 2 类的共通考试中未达到合格最低分数线，但在其他科类中，与 o1 一起包括文科在内都“合格”了。

在二次考试中，得分率较高的是英语，o1 和 R1 的得分率均超过了 75%。河合塾负责英语的久恒秀雄讲师表示：“几乎没有单词和语法的错误，远远超过了东大考生的平均水平。”

数学方面，虽然最终答案正确的问题较多，但在图形和论证问题上多次出现论述错误和说明不足的情况。理科数学中，o1 在 120 分满分中得了 38 分，R1 得了 49 分。负责数学的香坂季京讲师指出：“这比合格者的平均分要低很多。”

自 2011 年开始的“机器人能否进入东京大学（东 Robo）”项目的负责人、国立信息学研究所的新井纪子教授对此次考试结果评价道：“这是 AI 成长的一个重要里程碑。不过，AI 有时会给出相当糟糕的答案，需要能够正确判断并熟练使用 AI 输出的人才。”

OpenAI首席研究官：DeepSeek独立发现了o1的一些核心思路，奥特曼、LeCun纷纷置评

成本打下来了，需求更多才对？春节这几天，国内外 AI 圈都被 DeepSeek 刷了屏。英伟达的股市震荡更是让全世界看得目瞪口呆（参见《英伟达市值蒸发近 6000 亿美元，而 DeepSeek 刚刚又开源新模型》）。

1/29/2025 6:43:00 PM

机器之心

经过一系列测试 —— 从创意写作到复杂的教学，DeepSeek-R1 的综合实力完全能和 OpenAI 的付费「精英」们掰手腕。原来用对方法，性价比路线也能玩转 AI 竞技场！ DeepSeek 发布其开放权重的 R1 推理模型仅一周时间，多次震惊海内外。

1/30/2025 7:51:00 PM

机器之心

奥特曼兑现了承诺。 DeepSeek 带来的压力已经传递给了每一个科技公司。最近一段时间，很多生成式 AI 产品正在加速更新技术。

2/7/2025 1:32:00 PM

机器之心

资讯热榜

标签云

顶部