挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

又一个媲美 GPT-4 的大模型出现了?本周四,美国 AI 守业公司 Inflection AI 正式发布新一代大语言模型 Inflection-2.5。据介绍,Inflection-2.5 将强大的 LLM 才能与 Inflection 标志性的「同理心微调」结合在一起,兼具高情商与高智商,可联网获取事实信息,其机能可与 GPT-4、Gemini 等领先大模型相媲美。Inflection-2.5 现已向所有 Pi 用户开放,在 PC 端、iOS 和安卓 App 上均是免费可用。ps. 机器之心也简单尝试了下,觉得

又一个媲美 GPT-4 的大模型出现了?

本周四,美国 AI 守业公司 Inflection AI 正式发布新一代大语言模型 Inflection-2.5。

据介绍,Inflection-2.5 将强大的 LLM 才能与 Inflection 标志性的「同理心微调」结合在一起,兼具高情商与高智商,可联网获取事实信息,其机能可与 GPT-4、Gemini 等领先大模型相媲美。

Inflection-2.5 现已向所有 Pi 用户开放,在 PC 端、iOS 和安卓 App 上均是免费可用。ps. 机器之心也简单尝试了下,觉得确实还只是「逼近」(不如)GPT-4,感兴趣的读者可以自行体验下。

挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

链接:https://pi.ai/talk

值得注意的是,Inflection-2.5 实现了接近 GPT-4 的机能,而训练过程却仅利用 GPT-4 40% 的算力。

Inflection AI 表示,新一代大模型在编码和数学等智商领域取得了特别的进步。这转化为对关键行业基准的具体改进,确保 Pi 始终处于技术前沿。Pi 现在还融入了世界一流的实时网络搜索功能,以确保用户获得高质量的突发新闻和最新信息。

Inflection-2.5 vs GPT-4

Inflection-1 训练利用的 FLOP 约为 GPT-4 的 4%,在各种「IQ 导向」型任务中,其平均机能约为 GPT-4 水平的 72%。现在,Inflection-2.5 尽管只利用 GPT-4 40% 的 FLOP 来进行训练,但其平均机能却达到了 GPT-4 的 94% 以上。以下图所示,Inflection-2.5 的机能取得了全面的显著提升,其中 STEM 领域知识的改进最大。

挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

Inflection-2.5 在两项不同 STEM 考试 —— 匈牙利数学考试、物理学钻研生入学考试(GRE)—— 的成绩以下:

挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

以下表所示,该钻研还在 MMLU 基准、GPQA Diamond 基准上评价了 Inflection-2.5。MMLU 基准涵盖 STEM、人文、社会科学等领域的 57 个学科,能够有效地尝试 LLM 的综合知识才能,而 GPQA Diamond 基准是一个极其困难的专家级基准。

挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

在 BIG-Bench-Hard 基准上,Inflection-2.5 比 Inflection-1 机能提高了 10% 以上,并且可与 GPT-4 相媲美。BIG-Bench-Hard 基准主要涵盖大型语言模型难以解决的问题。

挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

该钻研还在 MT-Bench 基准上进行了评价。然而,钻研团队意识到该基准在推理、数学和编码类别中有很大一部分(近 25%)的样本示例具有不正确的参考解决方案或前提有缺陷。因此,该钻研更正了这些示例,并再次进行评价实验,结果以下表所示:

挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

在 GSM8k 和 MATH 基准上的评价结果表明,Inflection-2.5 在数学和编码才能方面比 Inflection-1 有显著改进:

挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

为了进一步尝试 Inflection-2.5 的编码才能,该钻研在 MBPP+ 和 HumanEval+ 两个编码基准上进行了评价实验,结果以下表所示:

挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

钻研团队在 HellaSwag 和 ARC-C、以及各种模型常识和科学基准上评价了 Inflection-2.5。从下图结果来看,Inflection-2.5 在这些基准上实现了强劲机能。

挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

此外,以上所有评价都是利用现在支持 Pi 的模型完成的。但也需要注意,由于网络检索(以上基准没有利用网络检索)、few-shot 提示的结构以及其他生产方面的影响,用户体验可能略有差异。

总的来说,Inflection-2.5 保持了 Pi「走心」的特性和极高的安全标准,成为了一个更全面的有用模型。

最近一段时间,大语言模型的技术竞争进入了白热化阶段,在众多科技公司中,Mistral AI(Mistral  Large)、Anthropic(Claude 3)脱颖而出,提出的新技术实现了与 GPT-4、Gemini Ultra 接近的才能。昨天出现的 Inflection-2.5,似乎也要加入第一梯队的行列。

作为硅谷明星守业公司,Inflection AI 的来头不小,它成立与 2022 年,三位联合创始人分别是原 DeepMind 联合创始人 Mustafa Suleyman、Linkedln 联合创始人 Reid Hoffman,还有前 DeepMind 首席科学家 Karen Simonyan。

挑战OpenAI的新模型免费上线,40%计算量机能逼近GPT-4

去年 6 月,Inflection AI 宣布获得 13 亿美元融资,由微软、英伟达以及 Reid Hoffman、比尔・盖茨、谷歌前 CEO 埃里克・施密特领投。目前,Inflection AI 已成为全球第四大生成式 AI 守业公司。

参考链接:

https://inflection.ai/inflection-2-5

给TA打赏
共{{data.count}}人
人已打赏
应用

田渊栋等人新作:突破内存瓶颈,让一块4090预训练7B大模型

2024-3-8 14:56:00

应用

驱动产学研深度融合,「现在高新视频智能技巧主题翻新联合体 」在快手揭牌

2024-3-8 15:04:00

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
今日签到
搜索