联想问天WA7785a G3服务器创纪录!单机运行671B DeepSeek大模型吞吐量高达6708token/s!

联想今日宣布,旗下首款 AMD AI 大模型训练服务器——联想问天 WA7785a G3在单机部署671B(满血版) DeepSeek 大模型时,实现了高达6708token/s 的极限吞吐量,再次刷新了单台服务器运行超大规模模型性能的纪录。 据介绍,此次性能突破得益于联想万全异构智算平台的强大支持。 联想通过访存优化、显存优化、创新的 PCIe5.0全互联架构以及精选 SGLang 框架中的最优算子等一系列创新技术手段,对大模型从预训练、后训练到推理的全流程进行了持续优化。

联想今日宣布,旗下首款 AMD AI 大模型训练服务器——联想问天 WA7785a G3在单机部署671B(满血版) DeepSeek 大模型时,实现了高达6708token/s 的极限吞吐量,再次刷新了单台服务器运行超大规模模型性能的纪录。

据介绍,此次性能突破得益于联想万全异构智算平台的强大支持。联想通过访存优化、显存优化、创新的 PCIe5.0全互联架构以及精选 SGLang 框架中的最优算子等一系列创新技术手段,对大模型从预训练、后训练到推理的全流程进行了持续优化。实测结果显示,在单台部署 DeepSeek671B 大模型的联想问天 WA7785a G3服务器上,最高吞吐量达到了惊人的6708token/s。

GPU 芯片 (5)

图源备注:图片由AI生成,图片授权服务商Midjourney

在模拟问题对话场景(上下文序列长度128/1K)时,该服务器最高可支持158的并发数,TPOT(Time Per Output Token)为93毫秒,TTFT(Time To First Token)为2.01秒;而在模拟代码生成场景(上下文序列长度512/4K)时,并发数可达140,TPOT 为100毫秒,TTFT 为5.53秒。联想方面表示,这一性能表现意味着单台联想问天 WA7785a G3服务器即可支撑1500人规模企业的正常使用,是继联想问天 WA7780G3服务器单机部署满血版 DeepSeek 大模型总吞吐量突破2500token/s 之后,在单机部署该大模型推理性能上的又一次重大飞跃。

联想方面强调,此次技术突破是联想中国基础设施业务群、联想研究院 ICI 实验室和 AMD 联合设计、协同调优、共同实现的成果。同时,这并非最终结果,联想与 AMD 仍在持续探索深度调优的新方法,以期实现更高的性能突破。

相关资讯

联想黄山:「超智融合」成算力新趋势,联想打造异构智算平台

9 月 24 日至 26 日,第20届CCF全国高性能计算学术年会(CCF HPC China 2024)在武汉市中国光谷科技会展中心正式开幕。 本次大会上,联想以“异构智算 稳定高效”为主题,携“一横五纵”算力基础设施战略、联想万全异构智算平台、联想AI解决方案、联想科学计算整体解决方案参展。 面对人工智能的浪潮,作为全球领先的科学计算解决方案提供商,联想以“一横五纵”战略框架,构建布局完整、稳定高效的AI基础设施,为企业智能化转型打造坚实可靠的智算底座。

启明星辰成功整合DeepSeek大模型,安全智能化再升级

近日,启明星辰在其官方微信上宣布,已完成 “安星” 智能体与 DeepSeek 大模型的全面对接。 这一整合标志着启明星辰在信息安全领域迈出了重要一步,特别是在安全运营、威胁检测、威胁情报和数据安全等多个业务场景中的应用。 启明星辰作为中国领先的信息安全解决方案提供商,一直致力于提升安全防护能力。

联想第三财季营收大增,全球首家部署DeepSeek大模型端侧AI PC

联想集团发布2024财年第三季度财报显示,公司实现营收1351亿元人民币,同比增长20%;净利润49.8亿元人民币,同比增长106%。 在交出亮眼业绩单的同时,联想还宣布了重要的AI战略进展。 作为全球首家,联想将在AI PC端侧本地部署DeepSeek大模型。