DeepSeek 推出 NSA 技术：加速长上下文训练与推理

2025-02-18 08:33

在人工智能领域，DeepSeek 团队于近日发布了最新研究成果，推出了一种名为 NSA（Native Sparse Attention）的创新稀疏注意力机制。这项技术的核心目标是提升长上下文训练和推理的速度，特别是针对现代硬件进行了优化，使得训练和推理的效率大幅提升。 NSA 技术的推出，为人工智能模型的训练带来了显著的变化。

在人工智能领域，DeepSeek 团队于近日发布了最新研究成果，推出了一种名为 NSA（Native Sparse Attention）的创新稀疏注意力机制。这项技术的核心目标是提升长上下文训练和推理的速度，特别是针对现代硬件进行了优化，使得训练和推理的效率大幅提升。

NSA 技术的推出，为人工智能模型的训练带来了显著的变化。首先，它通过一系列针对现代计算硬件特性的设计优化，显著提升了推理速度，并有效降低了预训练的成本。更重要的是，在提升速度和降低成本的同时，NSA 仍然保持了高水平的模型性能，确保了模型在多种任务中的表现不受影响。

DeepSeek 团队在其研究中采用了一种分层的稀疏策略，将注意力机制划分为三个分支:压缩、选择和滑动窗口。这种设计使得模型能够同时捕捉全局上下文和局部细节，从而提高了模型对长文本的处理能力。此外，NSA 在内存访问和计算调度方面的优化，使得长上下文训练的计算延迟和资源消耗得以大幅降低。

在一系列通用基准测试中，NSA 展示了其优异的性能。特别是在长上下文任务和基于指令的推理上，NSA 的表现甚至与完全注意力模型相当，部分情况下更胜一筹。这一技术的发布，标志着 AI 训练和推理技术的又一次飞跃，将为未来的人工智能发展带来新的动力。

NSA 论文（https://arxiv.org/pdf/2502.11089v1）。

划重点:
🌟 NSA 技术的推出显著提升了长上下文训练和推理的速度，并降低了预训练成本。
🛠️ 采用分层稀疏策略，将注意力机制分为压缩、选择和滑动窗口，增强了模型对长文本的处理能力。
📈 在多项基准测试中，NSA 表现优异，部分情况下超过了传统的完全注意力模型。

刚刚！DeepSeek梁文锋亲自挂名，公开新注意力架构NSA

DeepSeek 新论文来了！相关消息刚刚发布到 𝕏 就吸引了大量用户点赞、转发、评论三连。据介绍，DeepSeek 的这篇新论文提出了一种新的注意力机制 ——NSA。

2/18/2025 5:30:00 PM

机器之心

OpenAI首席研究官：DeepSeek独立发现了o1的一些核心思路，奥特曼、LeCun纷纷置评

成本打下来了，需求更多才对？春节这几天，国内外 AI 圈都被 DeepSeek 刷了屏。英伟达的股市震荡更是让全世界看得目瞪口呆（参见《英伟达市值蒸发近 6000 亿美元，而 DeepSeek 刚刚又开源新模型》）。

1/29/2025 6:43:00 PM

机器之心

“新神登场”，消息称 DeepSeek R2 模型有望 5 月前发布

据路透社报道，三位知情人士透露，DeepSeek 正在加速推出其 R2 人工智能模型，该公司最初计划在五月推出，但目前正在努力尽快推出。

2/25/2025 8:18:29 PM

归泷（实习）

资讯热榜

基于 Spring AI + MCP + DeepSeek-R1-7B 构建企业级智能 Agent 工具调用系统 OpenAI开源超Agent:Codex CLI,五小时内破 5000 颗星 OpenAI 发布“智能体构建实战指南”实用性文档（附文档资源） OpenAI发布34页智能体实践指南：从网络搜索到代码编写 ChatGPT重磅更新：新增图像库功能，可查看自己用GPT生成的所有图片 Figma 推 AI 革命：开发智能应用制作器与网站创建工具 Midjourney图像编辑器迎来重大更新：全新UI、图层功能与智能工具上线别再只玩ChatGPT了！OpenAI悄悄发布《构建 Agent 实战指南》手把手教你打造智能体

标签云

人工智能 OpenAI AIGC AI ChatGPT DeepSeek AI绘画数据机器人谷歌模型大模型 Midjourney 智能用户学习开源 GPT 微软 Meta AI创作图像技术论文 Stable Diffusion 马斯克 Gemini 算法蛋白质生成式芯片代码英伟达腾讯神经网络计算研究 Sora Anthropic AI for Science 3D AI设计机器学习 GPU 开发者场景华为预测人形机器人伟达 Transformer 苹果百度深度学习 AI视频模态 xAI 字节跳动驾驶文本搜索 Claude 大语言模型具身智能 Copilot 神器推荐 LLaMA 算力安全应用视频生成视觉科技亚马逊大型语言模型干货合集特斯拉 2024 AGI 训练

顶部

​DeepSeek 推出 NSA 技术：加速长上下文训练与推理

相关资讯

刚刚！DeepSeek梁文锋亲自挂名，公开新注意力架构NSA

OpenAI首席研究官：DeepSeek独立发现了o1的一些核心思路，奥特曼、LeCun纷纷置评

“新神登场”，消息称 DeepSeek R2 模型有望 5 月前发布

DeepSeek 推出 NSA 技术：加速长上下文训练与推理