RNN

Transformer 的三大优化技术！！

Transformer 是一种基于自注意力（Self-Attention）机制的深度学习模型，最早由 Vaswani 等人在 2017 年的论文《Attention Is All You Need》中提出。与传统的循环神经网络（RNN）和长短期记忆网络（LSTM）不同，Transformer 丢弃了递归计算结构，而是通过自注意力机制并行处理输入序列，从而大大提高了计算效率。 Transformer 广泛用于自然语言处理（NLP）和计算机视觉（CV）领域，如机器翻译、文本生成、文本分类、目标检测等。

2/20/2025 12:28:59 AM

程序员小寒

终于把 LSTM 算法搞懂了！！！

今天给大家分享一个强大的算法模型，LSTMLSTM（长短期记忆网络）是一种特殊类型的循环神经网络（RNN），它能够有效地解决传统 RNN 在处理长序列时遇到的梯度消失和梯度爆炸问题。 LSTM 的核心思想是通过多个门控机制来控制信息的流动，这些门控机制可以选择性地保留或丢弃输入数据，从而帮助网络捕捉长时间跨度的依赖关系。 LSTM的工作原理LSTM 的核心思想是通过引入记忆单元来存储信息，并使用三个主要的门（输入门、遗忘门、输出门）来决定哪些信息应该保留，哪些信息应该遗忘，以及哪些信息应该更新。

12/3/2024 8:16:57 AM

程序员小寒

终于把 Seq2Seq 算法搞懂了！！

Seq2Seq（Sequence-to-Sequence）模型是一种用于处理序列数据的神经网络架构，广泛应用于自然语言处理（NLP）任务，如机器翻译、文本生成、对话系统等。它通过编码器-解码器架构将输入序列（如一个句子）映射到输出序列（另一个句子或序列）。图片模型结构Seq2Seq 模型由两个主要部分组成。

11/14/2024 12:16:46 AM

程序员小寒

最小化的递归神经网络RNN为Transformer提供了快速高效的替代方案

译者 | 李睿审校 | 重楼Transformer如今已经成为大型语言模型（LLM）和其他序列处理应用程序的主要架构。然而，它们固有的二次方计算复杂性成为了将Transformer扩展至超长序列时的巨大障碍，显著增加了成本。这引发了人们对具有线性复杂性和恒定内存需求的架构的兴趣。

11/11/2024 8:11:49 AM

李睿

Bengio等人新作：注意力可被视为RNN，新模型媲美Transformer，但超级省内存

序列建模的进展具有极大的影响力，因为它们在广泛的应用中发挥着重要作用，包括强化学习（例如，机器人和自动驾驶）、时间序列分类（例如，金融欺诈检测和医学诊断）等。在过去的几年里，Transformer 的出现标志着序列建模中的一个重大突破，这主要得益于 Transformer 提供了一种能够利用 GPU 并行处理的高性能架构。然而，Transformer 在推理时计算开销很大，主要在于内存和计算需求呈二次扩展，从而限制了其在低资源环境中的应用（例如，移动和嵌入式设备）。尽管可以采用 KV 缓存等技术提高推理效率，但 T

5/25/2024 6:19:00 PM

机器之心

资讯热榜

上海AI实验室开源InternVL3系列多模态大型语言模型 Haisnap横空出世，小白用户也能轻松打造AI应用「交交」媲美GPT-4o！上海交大推出口语对话情感大模型，首个纯学术界自研！ OpenAI开源超Agent:Codex CLI,五小时内破 5000 颗星 ChatGPT重磅更新：新增图像库功能，可查看自己用GPT生成的所有图片本地部署DeepSeek+DiFy平台构建智能体应用 OPPO 小布助手网页版上线，接入满血版 DeepSeek kimi开源视觉语言模型 Kimi-VL 与 Kimi-VL-Thinking，多项基准超越 GPT-4o

标签云

人工智能 OpenAI AIGC AI ChatGPT DeepSeek AI绘画数据机器人谷歌模型大模型 Midjourney 智能用户学习开源 GPT 微软 Meta AI创作图像技术论文 Stable Diffusion 马斯克 Gemini 算法蛋白质生成式芯片代码英伟达腾讯神经网络计算研究 Sora AI for Science 3D Anthropic AI设计机器学习 GPU 开发者场景华为预测伟达 Transformer 百度苹果深度学习 AI视频模态人形机器人 xAI 驾驶字节跳动文本搜索大语言模型 Claude Copilot 具身智能神器推荐 LLaMA 算力安全应用视频生成科技视觉亚马逊干货合集 2024 AGI 特斯拉训练大型语言模型