零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了

2024 年，大模型领域的一个趋势越来越清晰：重视优化，面向运用。在去年的百模大战中，科技巨头、创业力量你追我赶，将大模型技术卷到了一个新的高度。有了强大的模型之后，更重要的是将这些才能输出到现实中的运用场景，提升用户感受、构建生态。正因此，大模型厂商们或是开源，或是推出模型 API，都是希望让成果为开发者所用，以此为基础设施构建起繁荣的大模型生态。国内的大模型独角兽公司零一万物，也在今天正式发布了 Yi 大模型 API 封闭平台。零一万物 API 封闭平台链接： API 封闭平台提供以下模型：Yi-34B-Cha

2024 年，大模型领域的一个趋势越来越清晰：重视优化，面向运用。

在去年的百模大战中，科技巨头、创业力量你追我赶，将大模型技术卷到了一个新的高度。有了强大的模型之后，更重要的是将这些才能输出到现实中的运用场景，提升用户感受、构建生态。

正因此，大模型厂商们或是开源，或是推出模型 API，都是希望让成果为开发者所用，以此为基础设施构建起繁荣的大模型生态。

国内的大模型独角兽公司零一万物，也在今天正式发布了 Yi 大模型 API 封闭平台。

零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了

零一万物 API 封闭平台链接：https://platform.lingyiwanwu.com/

此次 API 封闭平台提供以下模型：

Yi-34B-Chat-0205：支撑通用聊天、问答、对话、写作、翻译等功能。

Yi-34B-Chat-200K：200K 上下文，多文档阅读懂得、超长知识库构建小能手。

Yi-VL-Plus: 多模态模型，支撑文本、视觉多模态输入，华文图表感受超过 GPT-4V。

实际上，在半个月前，零一万物已经启动了 Yi-34B-Chat-0205 和 Yi-34B-Chat-200K 两个模型的邀测，很多开发者早就上手感受过一波了。

我们围观了一下，发现了几个亮点：

首先，200K 上下文确实强。就拿专业书翻译这件事来说吧，前 HuggingFace 员工、Transformer 核心贡献者 Stas Bekman 写过一本名为《机器学习工程》的电子书。调用 Yi-34B-Chat-200K 之后，知乎知名技术作者「苏洋」一天之内就完成了长达 264 页的书籍翻译工作。

零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了

图源：使用零一万物 200K 模型和 Dify 快速搭建模型运用 https://zhuanlan.zhihu.com/p/686774859

其次，在 Yi-34B-Chat-0205、Yi-34B-Chat-200K 之外，零一万物封闭平台此次同期上新全新的多模态大模型 Yi-VL-Plus。

Yi-VL-Plus 支撑文本、视觉多模态输入，面向实际场景大幅增强。多位用户反馈：「华文感受超过 GPT-4V。」

零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了

GPT-4V 连招牌都没看明白。

此外，零一万物 Yi 大模型 API 封闭平台和 OpenAI API 是兼容的，迁移方案时的感受应该也非常丝滑。

当然，Yi 大模型 API 到底能不能与 GPT-4 Turbo、Gemini 1.5、Claude 3 这些模型的表现一较高下，还需要更多开发者一起考察。

Yi 大模型 API 名额目前限量封闭，零一万物会为新用户免费赠送 60 元，感兴趣的开发者不妨申请感受一下。

200K 上下文的大模型，有多能打？

在此前的内测中，最令人印象深刻的不外乎具有超长上下文窗口的 Yi-34B-Chat-200K。

对于大模型的落地运用，上下文窗口是一项非常关键的因素。过去一年里，各家大模型的上下文窗口都在飞速扩展：OpenAI 把 GPT-4 的 32K 直接提到 GPT-4 Turbo 的 128K。谷歌的 Gemini 1.0 还是 32K，Gemini 1.5 Pro 马上就升级到了 100 万 Token。

前不久，Claude 3 将大模型 API 的上下文长度纪录一下提到了 200K，还宣称有才能封闭 100 万 Token 的上下文输入（尽管目前仅限特定客户）。

要完成更复杂的现实使命，模型需要能够处理长篇的上下文。更广阔的上下文窗口能显著提升模型的懂得深度，在生成内容或解答问题时实现更高的准确性和相关性。这是因为模型能够「回忆」并参照较长的文本历史，面对长文章、书籍的章节、复杂对话或其他需长期累积上下文的情境时，这种才能格外关键。

Yi-34B-Chat-200K 能够处理大约 30 万个中英文字符。我们可以拿文学类书籍来类比，32K 就像是一篇 2 万字的短篇小说（比如《潜伏》原著），128K 大概是一部中篇小说的体量（比如《人间失格》），而 200K 则相当于《呼啸山庄》、《百年孤独》、《骆驼祥子》这类长篇著作了。

以下是 Yi-34B-Chat-200K 对经典文学作品《呼啸山庄》的归纳总结，这部作品华文字数约 30 万字，人物关系错综复杂，但 Yi-34B-Chat-200K 仍能精准地梳理和总结出人物之间的关系。

零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了

从行业运用的角度看，Yi-34B-Chat-200K 适合用于多篇文档内容懂得、海量数据分析挖掘和跨领域知识融合等，为各行各业运用提供了便利。金融分析师可以用它快速阅读报告并预测市场趋势、律师可以用它精准解读法律条文、科研人员可以用它高效提取论文要点等，运用场景非常广泛。

有开发者对比了 Yi-34B-Chat-200K 和某同类模型，从下图我们能看出，对于「请在 18 万字报告中找到地缘政治风险」这一 Prompt，Yi-34B-Chat-200K 给出了正确答案「英国脱欧导致索尼总部搬迁，导致索尼欧洲业务连续性受影响」，而另外一个模型则表示「无地缘政治风险」，未能完成使命。

零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了

在另一项使命中，开发者要求某个大模型帮忙「撰写文献综述」，结果，交上来的活只干了一半：

零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了

切换到 Yi-34B-Chat-200K 之后，刚才卡住的使命马上成功执行，篇幅控制、翻译准确度、标注格式都符合要求。

零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了

实验数据进一步印证了开发者内测过程中的直观感受：在零一万物针对其进行的「大海捞针」测试中，Yi-34B-Chat-200K 的性能提高了 10.5%，从 89.3% 提升到 99.8%。

零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了

拼华文感受，这次赢的显然是 Yi-VL-Plus

大语言模型的持续进步往往也会为多模态大模型注入新的发展生机，尤其近几个月以来，多模态领域迎来「井喷」，大家的目光再次聚焦到了多模态大模型的发展上来。

谷歌 Gemini 原生多模态、Anthropic Claude 3 首次支撑多模态才能，随之而来的是，多模态大模型对图像（包括其上文字）、表格、图表、公式的辨认、懂得才能已经在整体上了一个新台阶。自然而然，这对其他大模型厂商提出了更高的多模态才能需求。

对于零一万物来说，这既是挑战，也是机遇。自成立以来，零一万物在大模型多模态才能上的探索一直在推进，尤其华文场景表现亮眼。

1 月 22 日，零一万物 Yi-VL 多模态语言大模型正式开源，包括 Yi-VL-34B 和 Yi-VL-6B 两个版本，其中 34B 版本在针对华文打造的 CMMMU 数据集上的准确率紧随 GPT-4V 之后，在开源多模态模型中处于领先位置。

现在，Yi-VL-Plus 多模态模型在原有 Yi-VL 基础上迎来全方位升级，进一步提高了图片分辨率，支撑 1024*1024 分辨率输入，不仅对图片华文字、符号的辨认、懂得和概括才能得到前所未有的加强，在部分华文场景的实际感受更是超越了 GPT-4V。眼见为实，我们来详细对比一下开篇提到的这个图文对话示例。

可以看到，Yi-VL-Plus 的回答言简意赅，准确无误，验证了它对图片华文字超强的辨认才能；而 GPT-4V 看似回答了一大堆内容，实则废话连篇，除了「羊肉汤烩面」这个招牌之外，它给出的食物显然是基于一般常识推理出来的，并不是它准确看到的。二者高下立判。

零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了

在更准确地搞定一般华文场景的图片辨认之外，此次 Yi-VL-Plus 的一大特点是大幅增强了对实际生产力场景的支撑，既提高了图表（Charts）、表格（Table）、信息图表（Inforgraphics）、屏幕截图（Screenshot）华文字和数字 OCR 的辨认准确性，让模型「看得准」；又支撑了复杂的图表懂得、信息提取、问答以及推理，让模型「答得透」。

我们同样发现，在这些偏生产力场景的使命中， Yi-VL-Plus 的实际感受依然要比 GPT-4V 更好。

我们来看下面这个华文「财务报表数据提取」使命，Yi-VL-Plus 没有被不同部门的数据所迷惑，精确无误定位并提取到了销售部门各个季度的数据；而 GPT-4V 显然被复杂的表格和柱状图数据难倒了，给出的数据中出现多达三处错误。

零一万物API正式上线：支撑输入30万汉字，看不懂《百年孤独》的人有救了