苹果 AI 研究：“猕猴桃”简单算术考倒 o1 和 Llama 等 20 多个最先进模型

《洛杉矶时报》昨日（11 月 1 日）发布博文，报道称苹果研究团队测试了 20 个最先进的 AI 模型，发现在有干扰项存在的情况下，它们处理简单的算术问题时表现不佳，甚至不如小学生。苹果公司用以下这道简单的算术题测试 20 多个最先进的 AI 模型，AI在线附上题目如下：Oliver 在星期五采摘了 44 个猕猴桃、然后他在星期六采摘了 58 个猕猴桃，星期日采摘的数量是星期五的两倍，不过其中有 5 个猕猴桃的块头要比平均值要小，请问 Oliver 这三天共摘了多少个猕猴桃？正确答案是 190 个，计算公式为 44（星期五） 58（星期六） 88（44*2，星期日）。

《洛杉矶时报》昨日（11 月 1 日）发布博文，报道称苹果研究团队测试了 20 个最先进的 AI 模型，发现在有干扰项存在的情况下，它们处理简单的算术问题时表现不佳，甚至不如小学生。

苹果公司用以下这道简单的算术题测试 20 多个最先进的 AI 模型，AI在线附上题目如下：

Oliver 在星期五采摘了 44 个猕猴桃、然后他在星期六采摘了 58 个猕猴桃，星期日采摘的数量是星期五的两倍，不过其中有 5 个猕猴桃的块头要比平均值要小，请问 Oliver 这三天共摘了多少个猕猴桃？

正确答案是 190 个，计算公式为 44（星期五）+58（星期六）+88（44*2，星期日）。

不过测试的 20 多个最先进 AI 模型无法排除干扰项，通常不理解猕猴桃的大小和数量无关，大部分的结果是 185 个。

苹果 AI 研究：“猕猴桃”简单算术考倒 o1 和 Llama 等 20 多个最先进模型

苹果团队发现，当问题包含看似相关但实际上无关的信息时，AI 模型的表现急剧下降。对此研究认为，AI 模型主要依赖于训练数据中的语言模式，而非真正理解数学概念。

苹果的研究表明，目前的 AI 模型“无法进行真正的逻辑推理”。这一发现提醒我们，尽管 AI 在某些任务上表现出色，但其智能并不如表面看起来那样可靠。

苹果 AI 研究：“猕猴桃”简单算术考倒 o1 和 Llama 等 20 多个最先进模型

苹果团队指出，简单地扩展数据或计算能力并不能根本解决这个问题，苹果的论文并非旨在削弱对 AI 能力的热情，而是提供一种理性的认知。

{{userData.name}}已认证

苹果 AI 研究：“猕猴桃”简单算术考倒 o1 和 Llama 等 20 多个最先进模型

克服奖励欺骗：Meta 发布全新后训练方式 CGPO 编程水平直升 5%，打破 RLHF 瓶颈

迪士尼成立新 AI 部门，探索人工智能、混合现实等新型技术的潜力

刚刚，AI颠覆物理模拟：一句话精准仿真，学术圈半壁江山联手耗时24个月研究成果

历时2年，华人团队力作，震撼开源生成式物理引擎Genesis，可模拟世界万物

细节表现超Sora，网友：真正的国产之光！MiniMax视频模型再上新

2024年AI 编程现在可以做到什么程度？

超越所有SOTA！最新UniScene：视频点云Occ三大生成任务全部暴力提升~

腾讯基于 RAG 和 Agent 技术的混元大模型业务落地实践

抢跑OpenAI！谷歌Gemini 2.0震撼登场：全面转向Agent，多模态输入输出，免费随便玩

实测来了！Kimi发布k1视觉思考模型，实力颠覆K12教育赛道，涌现能力强得可怕，免费可用！网友：国产之光！