千亿规模参数，阿里云通义千问进化到2.0：性能超GPT-3.5，加速追逐GPT-4

10 月 31 日，阿里云正式发布千亿级参数大模型通义千问 2.0。在 10 个权威测评中，通义千问 2.0 综合性能超过 GPT-3.5，正在加速追逐 GPT-4。当天，通义千问 APP 在各大手机利用市场正式上线，所有人都可通过 APP 直接体验最新模型才能。过去 6 个月，通义千问 2.0 在性能上取得巨大飞跃，相比 4 月发布的 1.0 版本，通义千问 2.0 在复杂指令明白、文学创作、通用数学、知识记忆、幻觉抵御等才能上均有显著提升。目前，通义千问的综合性能已经超过 GPT-3.5，加速追逐 GPT-4。

10 月 31 日，阿里云正式发布千亿级参数大模型通义千问 2.0。在 10 个权威测评中，通义千问 2.0 综合性能超过 GPT-3.5，正在加速追逐 GPT-4。当天，通义千问 APP 在各大手机利用市场正式上线，所有人都可通过 APP 直接体验最新模型才能。

过去 6 个月，通义千问 2.0 在性能上取得巨大飞跃，相比 4 月发布的 1.0 版本，通义千问 2.0 在复杂指令明白、文学创作、通用数学、知识记忆、幻觉抵御等才能上均有显著提升。目前，通义千问的综合性能已经超过 GPT-3.5，加速追逐 GPT-4。

通义千问 2.0 综合性能超过 GPT-3.5，正在加速追逐 GPT-4

在 MMLU、C-Eval、GSM8K、HumanEval、MATH 等 10 个主流 Benchmark 测评集上，通义千问 2.0 的得分整体超越 Meta 的 Llama-2-70B，相比 OpenAI 的 Chat-3.5 是九胜一负，相比 GPT-4 则是四胜六负，与 GPT-4 的差距进一步缩小。

中英文明白才能是大语言模型的基本功。英语任务方面，通义千问 2.0 在 MMLU 基准的得分是 82.5，仅次于 GPT-4，通过大幅增加参数量，通义千问 2.0 能更好地明白和处理复杂的语言结构和概念；华文任务方面，通义千问 2.0 以明显优势在 C-Eval 基准获得最高得分，这是由于模型在训练中学习了更多华文语料，进一步强化了华文明白和表达才能。

在数学推理、代码明白等领域，通义千问 2.0 进步明显。在推理基准尝试 GSM8K 中，通义千问排名第二，展示了强大的计算和逻辑推理才能；在 HumanEval 尝试中，通义千问得分紧跟 GPT-4 和 GPT-3.5，该尝试主要衡量大模型明白和执行代码片段的才能，这一才能是大模型利用于编程辅助、自动代码修复等场景的基础。

千亿规模参数，阿里云通义千问进化到2.0：性能超GPT-3.5，加速追逐GPT-4

通义千问 2.0 发布

通义千问更成熟了，也更好用了。通义千问 2.0 在指令遵循、工具使用、精细化创作等方面作了技术优化，能够更好地被下游利用场景集成。通义大模型官网上线了多模态和插件功能，支持图片输入、文档解析等细分任务。

与此同时，基于通义大模型训练的 8 大行业模型组团上线，他们分别是通义灵码 – 智能编码帮忙、通义智文 – AI 阅读帮忙、通义听悟 – 工作学习 AI 帮忙、通义星尘 – 个性化角色创作平台、通义点金 – 智能投研帮忙、通义晓蜜 – 智能客服、通义仁心 – 个人专属健康帮忙、通义法睿 – AI 法律顾问。8 大行业模型面向当下最受欢迎的多个垂直场景，使用领域数据进行专门训练。用户可以在官网直接体验模型功能，开发者可以通过网页嵌入、API/SDK 调用等方式，将模型才能集成到自己的大模型利用和服务中。

千亿规模参数，阿里云通义千问进化到2.0：性能超GPT-3.5，加速追逐GPT-4