ReMax
在RTX 4090被限制的时代下,让大模型使用RLHF更高效的方法来了
该论文介绍了一种名为 ReMax 的新算法,专为基于人类反馈的强化学习(RLHF)而设计。ReMax 在计算效率(约减少 50% 的 GPU 内存和 2 倍的训练速度提升)和实现简易性(6 行代码)上超越了最常用的算法 PPO,且性能没有损失。论文链接::李子牛,许天,张雨舜,俞扬,孙若愚,罗智泉机构:香港中文大学(深圳),深圳市大数据研究院,南京大学,南栖仙策开源代码:,所有图片来自于论文。背景今年,以 ChatGPT 为首的大语言模型(Large Language Models, LLMs) 在各个方面大放光彩
10/20/2023 3:18:00 PM
机器之心
- 1
资讯热榜
DeepSeek+Drawio一键生成20多种图表,90%都不知道的技巧(附保姆级教程)
Manus 内测启动:Monica 团队推出“通用 AI 代理”引发热议
阿里新开源推理大模型QwQ-32B,性能媲美DeepSeek-R1、显存需求更小
大模型系列:DeepSeek大模型与应用场景介绍
OmniParser V2 在 Windows 系统上的详细安装与运行指南
Ollama的配置修改与接口调用
Windsurf Wave 4版本发布:AI编程工具再升级 更智能、更高效
使用 VLLM 部署 DeepSeek:基于 Ubuntu 22.04 + RTX 4090 + Docker 的完整指南
标签云
人工智能
OpenAI
AIGC
AI
ChatGPT
AI绘画
DeepSeek
数据
机器人
谷歌
大模型
Midjourney
智能
模型
用户
学习
GPT
开源
微软
AI创作
图像
Meta
技术
论文
Stable Diffusion
马斯克
算法
生成式
蛋白质
芯片
Gemini
代码
神经网络
计算
腾讯
研究
Sora
AI设计
3D
开发者
GPU
AI for Science
英伟达
机器学习
场景
预测
华为
伟达
Transformer
Anthropic
模态
深度学习
百度
驾驶
文本
AI视频
苹果
搜索
神器推荐
算力
LLaMA
科技
Copilot
xAI
视频生成
安全
应用
干货合集
字节跳动
2024
人形机器人
具身智能
特斯拉
亚马逊
视觉
语音
Claude
大语言模型
AI应用场景
AGI