DriveVLM
清华叉院、理想提出DriveVLM,视觉大语言模型提升自动驾驶能力
在自动驾驶领域,研究人员也在朝着 GPT/Sora 等大模型方向进行探索。与生成式 AI 相比,自动驾驶也是近期 AI 最活跃的研究和开发领域之一。要想构建完全的自动驾驶系统,人们面临的主要挑战是 AI 的场景理解,这会涉及到复杂、不可预测的场景,例如恶劣天气、复杂的道路布局和不可预见的人类行为。现有的自动驾驶系统通常包括 3D 感知、运动预测和规划组成部分。具体来说,3D 感知仅限于检测和跟踪熟悉的物体,忽略了罕见物体及其属性, 运动预测和规划则关注物体的轨迹动作,通常会忽略物体和车辆之间的决策级交互。自动驾驶需
2/23/2024 10:56:00 AM
机器之心
- 1
资讯热榜
DeepSeek R1 简易指南:架构、本地部署和硬件要求
DeepSeek 全面指南:95% 的人都不知道的九个技巧
硅基流动×华为云联合推出基于昇腾云的DeepSeek R1&V3推理服务
冲击DeepSeek R1,谷歌发布新一代Gemini全型号刷榜,编程、物理模拟能力炸裂
DeepSeek V3 和 R1 模型完成海光 DCU 国产化适配并正式上线
香橙派发布 AI Studio Pro 算力卡华为昇腾开发板,13606 元起
谷歌 Gemini 2.0 Flash 系列 AI 模型登场,编程和推理性能迈上新台阶
OpenAI 小钢炮 o3-mini 推理模型登场:性能提升 24%,首次向免费 ChatGPT AI 用户开放
标签云
人工智能
AIGC
OpenAI
AI绘画
ChatGPT
机器人
数据
谷歌
智能
学习
大模型
Midjourney
GPT
用户
AI创作
微软
图像
开源
Meta
技术
论文
Stable Diffusion
生成式
算法
蛋白质
芯片
马斯克
计算
Gemini
神经网络
AI设计
代码
AI
研究
Sora
腾讯
3D
开发者
场景
GPU
伟达
预测
模态
英伟达
华为
Transformer
机器学习
文本
驾驶
神器推荐
AI视频
深度学习
DeepSeek
干货合集
搜索
LLaMA
算力
AI for Science
苹果
视频生成
2024
百度
科技
应用
Copilot
AI应用场景
安全
具身智能
写作
特斯拉
机器
字节跳动
视觉
AGI
语音
prompt
架构
英特尔
模型
Anthropic