自动驾驶
全自动驾驶真的来了!花6万4才能用!马斯克急忙上线阉割版!AI提醒驾驶员别走神,网友实测翻车:秒变移动路障;李想:在实战中分高下
出品 | 51CTO技术栈(微信号:blog51cto)千呼万唤,特斯拉FSD真的来了! 特斯拉已开始在中国向车主分批次推送FSD的软件更新了,版本号2024.45.32.12,与北美版一致。 不过,马斯克急急慌慌入华的FSD,槽点好像真的有点多。
港理工OccProphet:纯视觉Occ SOTA!速度提升至2.6倍,内存占用减少60%
本文分享一篇由香港理工大学最近公开的发表于ICLR2025的论文『OccProphet: Pushing Efficiency Frontier of Camera-Only 4D Occupancy Forecasting with Observer-Forecaster-Refiner Framework』。 作者在文中提出了一个轻量级的观察器-预报器-细化器框架OccProphet来实现高效的未来4D占用预测。 OccProphet在nuScenes、 Lyft-Level5和nuScenes-Occupancy等多个数据集上取得最先进的4D占用预测性能,成本减少近80%!
北航&滴滴!自动驾驶汽车的运动预测:综述
论文链接::综述。 近年来,自动驾驶领域吸引了越来越多的关注。 准确预测各种交通参与者的未来行为对于自动驾驶汽车(AVs)的决策是至关重要的。
全面超越OccWorld!Occ-LLM:Occ世界模型再度问鼎SOTA
写在前面&出发点大语言模型(LLMs)在机器人和自动驾驶领域取得了重大进展。 本研究提出了首个基于占用的大语言模型(Occ-LLM),这是将大语言模型与一种重要表示方式相结合的开创性尝试。 为了有效地将占用信息编码为大语言模型的输入,并解决与占用相关的类别不平衡问题,研究提出了运动分离变分自编码器(MS-VAE)。
新基准!威斯康星大学开源Ultra-AV:统一自动驾驶纵向轨迹数据集
摘要自动驾驶车辆在交通运输领域展现出巨大潜力,而理解其纵向驾驶行为是实现安全高效自动驾驶的关键。 现有的开源AV轨迹数据集在数据精炼、可靠性和完整性方面存在不足,从而限制了有效的性能度量分析和模型开发。 本研究针对这些挑战,构建了一个(Ultra-AV),用于分析自动驾驶汽车的微观纵向驾驶行为。
检测&OCC双SOTA!Doracamom实现首个LV多模态融合的统一多任务感知算法框架~
写在前面&笔者的个人理解自动驾驶技术是现代交通革命的前沿,备受关注。 自动驾驶系统通常包括环境感知、轨迹预测和规划控制等组件,以实现自动驾驶功能。 准确的 3D 感知是自动驾驶系统的基础,主要侧重于 3D目标检测和语义占用预测任务。
ICLR 2025 | Diffusion Planner: 基于扩散模型的自动驾驶规划算法,nuPlan SOTA!
本文介绍了清华大学联合毫末智行、自动化所、港中文、上海交大、上海人工智能实验室的发表于ICLR 2025的最新研究成果《Diffusion-based Planning for Autonomous Driving with Flexible Guidance》。 该算法创新性地设计了基于 Diffusion Transformer 的自动驾驶规划模型架构,高效处理复杂场景输入,并联合建模周车运动预测与自车规划中的多模态驾驶行为,充分发挥扩散模型在闭环规划中的潜力,解决了现有基于学习的规划方法对后处理的严重依赖问题。 此外,借助扩散模型的引导机制,模型在部署阶段能够灵活适应不同的驾驶需求,提高泛化能力与实用性。
关于自动驾驶,尤其是端到端自动驾驶:到底有哪些可能的量产技术路线?
0.1 什么是端到端? 首先定义端到端,当然有很多说法。 我觉得,起码说相对于分阶段而言,规划不只是根据感知和预测的结果,而是其隐特征。
利用人工智能提升航空安全
人工智能在航空安全中的整合变得越来越重要,特别是随着空中交通的增长、人为错误问题的不断出现以及对飞行员需求的增加。 虽然航空旅行仍然是最安全的交通方式之一,但最近发生的悲剧事件和众多紧急事件凸显了采取更先进安全措施的必要性。 上周美国一架陆军UH-60黑鹰直升机与一架美国航空公司客机在华盛顿特区里根国家机场着陆后不久在空中发生致命碰撞,震惊了航空业。
Meta 首席 AI 科学家杨立昆最新观点:现有技术难以支撑家用机器人和自动驾驶汽车
要让AI理解并与物理世界互动,仍需重大技术突破。AI要赶上人类或动物,还需要很长的路要走。他表示,当前的AI在“操控语言”方面表现出色,但对物理世界的理解仍十分有限。
轨迹预测新基准!清华开源Ultra-AV:统一自动驾驶纵向轨迹数据集
摘要自动驾驶车辆在交通运输领域展现出巨大潜力,而理解其纵向驾驶行为是实现安全高效自动驾驶的关键。 现有的开源AV轨迹数据集在数据精炼、可靠性和完整性方面存在不足,从而限制了有效的性能度量分析和模型开发。 本研究针对这些挑战,构建了一个(Ultra-AV),用于分析自动驾驶汽车的微观纵向驾驶行为。
世界模型会是L3自动驾驶的唯一解吗?2025 技术展望~
三维空间占有率(3D Occupancy)预测的目的是预测三维空间中的每个体素是否被占有,如果被占有,则对应的体素将被标记。 3D Semantic Occupancy是在三维空间内同时编码占用状态和语义信息,成为描述自动驾驶 3D 场景的一种极具吸引力的表示方式。 而自动驾驶世界模型(World Model)具备对真实物理世界的理解能力,基于一些历史信息/状态,能够预测未来时刻的场景变化甚至agents的状态变化。
SafeDrive:大语言模型实现知识驱动和数据驱动的风险-敏感决策
24年12月来自USC、U Wisconsin、U Michigan、清华大学和香港大学的论文“SafeDrive: Knowledge- and Data-Driven Risk-Sensitive Decision-Making for Autonomous Vehicles with Large Language Models”。 自动驾驶汽车 (AV) 的最新进展利用大语言模型 (LLM) 在正常驾驶场景中表现良好。 然而,确保动态、高风险环境中的安全并管理,对安全至关重要的长尾事件仍然是一项重大挑战。
顶刊JFR最新ROLO-SLAM开源:专为复杂地形下地面车辆的位姿漂移问题进设计
本文经3D视觉之心公众号授权转载,转载请联系出处。 解决垂直方向漂移定位在自动驾驶背景下至关重要。 它是安全高效导航的基础模块,使车辆能够准确地确定其在环境中的位置。
解放人工标注!理想多模态框架UniPLV:开放3D场景理解新SOTA
写在前面 & 笔者的个人理解开放世界的3D场景理解旨在从点云等3D数据中识别和区分开放世界的对象和类别,而无需人工标注。 这对于真实世界的应用,如自动驾驶和虚拟现实等至关重要。 传统的依赖人工标注的闭集识别方法无法满足开放世界识别的挑战,尤其3D语义标注,非常耗费人力和物力。
InfiniCube:来自英伟达的高保真度高可控大规模动态3D驾驶场景生成方法
本文经3D视觉之心公众号授权转载,转载请联系出处。 InfiniCube: Unbounded and Controllable Dynamic 3D Driving Scene Generation with World-Guided Video Models介绍:: 是由英伟达主导开发的一种新型3D生成方法,用于生成无界且可控制的动态3D驾驶场景。 InfiniCube 通过结合高清地图、车辆边界框和文本描述,利用最新的3D表示和视频模型技术,实现了大规模动态场景的生成。
当人工智能遇上市政债券市场:聊聊算法交易与AI预测
算法交易时至今日,“算法交易”一词已经被广泛使用。 但其真实含义却往往众说纷纭。 没关系,下面咱们就来捋捋这个概念的具体细节。
世界模型再进化!DrivingWorld:通过视频GPT构建自动驾驶世界模型(港科技&地平线)
写在前面 & 笔者的个人理解最近自回归(AR)生成模型的成功,如自然语言处理中的GPT系列,促使人们努力在视觉任务中复制这一成功。 一些工作试图通过构建能够生成逼真的未来视频序列和预测自车状态的基于视频的世界模型,将这种方法扩展到自动驾驶。 然而,先前的工作往往产生不令人满意的结果,因为经典的GPT框架旨在处理1D上下文信息,如文本,并且缺乏对视频生成所必需的空间和时间动态进行建模的固有能力。