读论文 Ch.2
文章目录
本周着重于端到端、安全性等概念。下一周准备开始精读外文。
下周要求
论文来源
下周精读两篇外文,在 IEEE Xplore 上查找,筛选 2025-2026 年 Early Access Articles 和 Journals,选择 IEEE Transactions on … 上的论文进行阅读。
侧重选取安全性、机器学习、端到端等方向论文,尽可能前瞻、新颖。
可查询了解一下无人机规划算法的历史。
阅读重点
阅读论文时,重点看论文的写作原因、创新点以及采用的算法和其中的细节。
概念
端到端
在深度强化学习(DRL)中,端到端指智能体用一个深度神经网络(或一组联合训练的深度网络),直接从原始观测映射到动作或控制指令,并用强化学习目标联合优化整个映射,而不需要人工设计感知、状态估计、特征提取、规划、控制等中间模块。
“端到端”中的一端为原始输入,另一端为最终输出。中间的数据处理让机器自主学习。
安全性
- 协同与碰撞安全
- 防碰撞算法验证
- 编队保持与重构
- 地理围栏合规
- 安全距离量化
- 通信与同络安全
- 系统可靠性与容错
- 环境与物理安全
YOLO
YOLO 是一个实时计算机视觉模型系列,支持目标检测、实例分割、语义分割、深度估计、分类、姿态估计、旋转边界框和跟踪。其核心思想是将目标检测视为一个回归问题,通过单次前向传播直接从图像预测边界框和类别,实现端到端的实时检测。
DETR
基于 Transformer 的端到端集合预测。将 Transformer 架构引入目标检测,将检测视为集合预测问题。
YOLO是回归(直接预测坐标),基于纯 CNN(最新版本引入混合架构);DETR 是集合预测(通过查询和匹配输出集合),基于 Transformer 编码器-解码器。
基于深度强化学习的旋翼无人机敏捷飞行控制与运动规划
国内外研究现状与分析
无人机运动规划
基于学习的端到端无人机运动规划方法
将无人机的状态观测信息直接映射到底层控制指令,提高了响应速度。
基于强化学习的于人机运动规划方法通常将轨迹规划与底控制耦合在一起看作一个最优控制问题,通过输入无人机状态、环境约束等观测信息,直接计算输出无人机的底层控制指令,实现具备实时响应的运动规划与控制目的,也能够更加充分地利用无人机的物理飞行极限,达到更为敏捷的飞行效果。
- Pi 等通过不断优化深度神经网络、实现了无人机从悬停状态起飞并快速栖息于垂直墙面上的敏捷飞行目的。
- Lin 等将模仿学习与强化学习结合起来优化得到了一个端到端的运动规划策略。
- Song 等通过纯粹的强化学习算法训练得到了能够在极短时间内穿越窗户的端到端无人机运动规划策略。
- Xiao 等利用课程学习在只有稀疏奖励的情况下,训练出了用于无人机狭窄间隙穿越的端到端控制策略。
- Sun 等考虑了随机位姿的狭窄间隙,并利用好奇心机制加快了策略的探索与收敛速度。
基于学习的无人机运动规划方法能够通过观测无人机及周围环境等状态信息,实时动态地调节无人机的底层控制指令,具备响应速度快、敏捷性强等优势。但相关方法中大多在复杂飞行任务的实施过程中依赖额外的传统无人机底层控制器来驱动无人机完成整个飞行任务。
无人机飞行控制的安全性研究
对安全性要求极高的无人机系统来说,其执行飞行任务的成功与否还要叹决于控制策略能否在复杂的真实环境中安全地控制无人机以避免与环境中的其他物体发生碰撞等危险行为的发生,尤其是在空间受限的场景下执行复杂飞行任务。
安全性的研究思路主要是在现有的无人机飞行控制策略进行进一步地检验与修正,以达到输出安全控制量。
面向无人机航拍场景的端到端目标检测算法研究
国内外研究现状
目前通用目标检测领域的三个研究方向:
- 基于锚框
- 基于关键点
- 端到端的目标检测模型。
面向无人机航拍场景的目标检测任务中五种常用改进策略:
- 多尺度特征融合
- 区域划分
- 多任务协同学习
- 数据增强
- 模型轻量化
通用目标检测研究现状
前期:基于人工设计特征的传统目标检测算法。
后期:基于深度学习的目标检测算法。
基于锚框的目标检测算法的中心思想是在训练前预设与真实框匹配的锚框,通过回归的方法学习目标相对于锚框的偏移量,最终生成基于锚框修正后的预测框。该算法又细分为两阶段目标检测器和单阶段目标检测器。两阶段目标检测器首先在图像上生成若干个可能包含目标物体的候选区域,用来剔除大量冗余的背景信息,再通过系列神经网络完成类别判定与位置回归。单阶段目标检测器则是将分类与回归任务整合到同一阶段内完成,直接建立目标与锚框的映射关系,降低模型的复杂性并提高检测速度。
- R-CNN
- Faster R-CNN
- SSD
- YOLO9000
基于关键点的目标检测算法将目标框的预测视作系列点的定位,摆脱了手工生成锚框的繁琐过程,避免了大量包含背景信息的冗余锚框给训练带来的正负样本失衡的问题,提高了模型的泛化性。
- CornerNet-Lite
- CentripetalNet
- FCOS
基于锚框和基于关键点的目标检测算法都需要非极大值抑制处理,无法实现真正意义上的端到端目标检测。
下面是研究人员在基于关键点的目标检测算法上提出进一步的改进。
- DeFCN
- Sparse R-CNN
- 将分类信息融入标签匹配规则中
Transformer 结构逐渐形成了端到端目标检测的新流派。
- DETR
- Deformable DETR 即可变形 Transformer
- DINO
基于锚框的目标检测算法能够依据先验锚框实现快速的回归定位,但是其缺少在不同数据集上的良好的泛化能力,较大程度地依赖设计者的工程经验;基于关键点的目标检测算法没有繁复的锚框生成过程,也避免了锚框设置不合理所引起的误检或漏检,但容易忽视被遮挡的目标,并且其依旧需要非极大值抑制处理来删除同一目标的重复预测; 端到端的目标检测模型虽然能彻底摆脱对手工设计组件的依赖,但检测精度与检测速度相较前两种方法还有较大的提升空间,特别是 DETR 类目标检测模型,计算量较大。
无人机航拍场景目标检测研究现状
- 多尺度特征融合
- 区域划分
- 多任务协同学习
- 数据增强
- 模型轻量化
多尺度特征融合
能够更加有效地捕获浅层细节信息与深层语义信息。
- UAV-YOLO
- SCRDet
- 对特征融合结构添加额外的像素重组模块
- ECascade-RCNN
区域划分
引导网络学习对待不同区域采取不同粒度的检测手段是一种较好的优化思路。
- ClusDet
- GLSAN
- DOD
多任务协同学习
将航拍图像结合无人机应用场景下特定的先验知识,实现多任务协同学习。能够以较小的代价获取较大的性能提升。
数据增强
用数据增强的方法来弥补无人机航拍图像数据集在数量及质量上的欠缺。
- “复制-粘贴”的补丁式数据增强方法
- 自适应重采样增强策略
- 添加噪声信息
模型轻量化
设计配套目标检测算法时要严格考虑参数量的限制。对训练好的模型剪枝是一种较好的模型轻量化方法。
面向无人机集群的智能自主协同飞控技术研究
国内外研究现状
无人机集群协同编队控制研究
编队方法:
- 一致性算法的控制
- 基于人工势场法的控制
- 基于领导-跟随模型的控制
- 基于虚拟结构法的控制
- 基于行为规则的控制
- 基于强化学习的控制
领导-跟随模型
设定一架或多架飞机作为领导者,其他无人机作为跟随者来实现集群控制的模型。
- PID
- 自适应反馈线性化法
- 鲁棒控制方法
- 极值搜索控制方法
- 滑膜变结构控制方法
失去领导者时无法维持编队,且跟随者之间信息传递会产生延迟,队形难以精确保持。
虚拟结构法
一种全局化的控制方法。把无人机集群抽象成一个具有特定形状和运动特性的虚拟结构,再进行运动学和动力学的分析。依赖于高复杂的计算和通信能力。
人工势场法
将无人机看作带有电荷的粒子,障碍物和目标分别看作“斥力“和“引力”源,通过无人机的感知和计算形成一种自然的避障和保持队形的方法。可能陷入极小值点而被困在某个位置。
基于行为规则的控制方法
模拟生物群体行为,为每个无人机设置一些简单的行为规划,来实现集体的复杂行为。缺乏全局信息。
基于群体智能算法的无人机控制方法
从自然界生物群体行为中获取灵感,如蚁群算法、人工鱼群算法。
基于强化学习的无人机集群编队控制方法
利用强化学习(RL)的自适应和智能决策能力,通过学习环境与任务的反馈,逐渐优化编队控制策略。
多智能体系统通信策略研究现状
略。
论文研究内容及创新
主要研究内容
无人机集群的队形控制保持、无人机集群间的通信机制、无人机集群飞行避碰避障、无人机集群编队重构。
基于改良人工势场的控制算法的实验结果引出了使用智能的方式来控制无人机集群的协同飞行。最终选择使用多智能体强化学习来完成无人机集群的智能协同飞行控制。
创新点
使用分布式决策与控制。
视觉感知的无人机端到端目标跟踪控制技术
深度强化学习(DRL)通过智能体和环境之间的交互过程在线生成自适应策略,在无人机运动领域表现良好。
实现无人机的连续动作控制:
- 深度确定性策略梯度(DDPG)算法
- 新深度强化学习方法和鲁棒深度确定性策略梯度
论文研究内容
提出改进的视觉感知的端到端深最强化学习算法。
- 设计基于奖励驱动深度强化学习策略的端到端视觉感知-运动决策控制模型。
- 为提高无人机跟踪控制模型的泛化能力,引入基于迁移学习的训练方法。
基于多智能体强化学习的无人机全覆盖巡逻任务研究
选题背景与研究意义
路径规划算法被划分为全局规划与局部规划。
全局规划依靠静态环境信息生成最优路径。
- A*
- Dijkstra
局部规划算法能更好地实时避开障碍物。
- 人工势场法
- RRT
智能优化算法
- 遗传算法
- 蚁群算法
深度强化学习靠端到端的环境交互与奖励机制来推动策略优化,能够自主适应动态环境并协调好多目标约束。
深度 Q 网络(DQN)和近端优化(PPO)在简单场景里已经表现出了路径规划的潜力,但在高维栅格地图中还是存在状态特征提取能力不足、探索策略容易陷入刻板僵化等问题。
国内外相关研究工作进展
路径规划算法的研究现状
传统算法
- 图搜索算法
- Dijkstra 算法
- A* 算法
- 采样算法
- RRT(快速扩展随机树)
- PRM(概率路线图)
智能算法
- 启发式优化算法
- 遗传算法
- 粒子群算法
- 机器去学习驱动算法
- 深度强化学习
- 图神经网络
- 自然启发式算法
- 蚁群算法
- 模拟退火
人工势场法针对规划环境创建一个综合势场,经由计算每个时刻当前位置在该场中的梯度,可以得到施加在移动体上的合力。
基于模型的路径规划方法可以做到实时优化和预测未来状态,从而让动态系统能够根据当前状态和目标条件,生成一条最优的轨迹。
遗传算法模拟自然选择和遗传学原理,在初始化时,会先随机生成一个包含多个个体的初始种群,每个个体的基因表示为问题的一个可能解。算法利用适应度函数评估每个个体的好坏,适应度值越高,表示个体的解越接近问题的最优解。
粒子群算法模拟鸟群觅食行为,是一种基于群体智能的全局优化算法。该算法会随机生成一组粒子,每个粒子可表示问题的一个可能解,给予每个粒子初始速度后,依靠适应度函数考量各个粒子的性能,并记录保存个体最优解和全局最优解。在迭代过程中,每个粒子按照自身历史最优以及整个群体的最优信息更新速度和位置,从而持续不断探索解空间,逐步趋向最优解。
模拟退火算法则受到了物理学中金属退火过程的启发,经由模拟粒子在温度变化时逐渐找寻能量最低的状态的情况,来求解最优解。
强化学习算法的研究现状
- Q 学习算法
- 深度 Q 网络(DQN)
- Double DQN
- Prioritized Experience Replay
- Dueling Network Architecture
- PPO 算法
如TSP、遗传算法、蚁群改进等传统方法在进行路径规划时,其结果极易受环境结构和局部最优的影响。但深度强化学习可以从高维的环境信息里学到合适的策略。
面向无人机航拍图像的端到端检测算法
直接使用自然图像的检测算法往往不能取得很好的效果。
将 CBAM 以及 Transformer 集成进 YOLOv5 网络,使得模型可以在高密度场景下定位小目标。
基于 YOLOv5 的应用无人机检测海洋中目标的算法,该算法在主干中融合 Transformer 提高小物体和遮挡物体的检测精度。
在主干和 Neck 的连接处添加反卷积,缓解了 FPN 初始阶段的特征信息丢失。
YOLO 系列算法依赖于手工设计的后处理步骤。
基于 Transformer 架构提出 DETR 目标检测算法,通过将目标检测视为直接预测问题,摆脱了对 NMS 等手工设计组件的依赖。
首个实时端到端检测的 DETR 模型 RT-DETR 解决了 DETR 的实时性问题。
本文提出一种改进的 YOLOv8-DETR 混合模型架构,旨在结合 YOLOv8 高效特征提取的优点和 RT-DETR 解码器能直接预测目标框位置和种类的优势,实现实时的端到端目标检测,并提高对小目标的检测能力。
动态三维空间下的无人机时空轨迹规划研究
国内外研究现状及分析
静态场景下无人机轨迹规划处理效果较好,动态场景避障仍有欠缺。
动态环境下规划趋势是从“无预测”转向“带运动预测和不确定性估计”,规划维度也从状态空间转向状态-时间空间,进行时空联合规划
现有动态环境轨迹规划:
- 反应式规划;
- 基于概率优化的规划;
- 基于几何约束与代价函数优化的规划;
- 基于深度强化学习的规划。
动态物体状态估计与预测研究现状
物体运动可预知
多智能体无人机集群飞行等场景,规划问题较为简单。
基本符合物理模型且存在一定的不确定性
适用于大多数动态场景。
- Yu 等对空中下落小球建模,并在线评估参数进行轨迹预测。
- Lu 等用轻量级 RGBD 相机实现小型动态障碍物快速感知和运动预测。
- alanga 等、He 等采用事件相机进行静态和动态障碍物感知。
- Zhu 等假设障碍物未来运动方向和速度不变,规划器对运动模式要求低,能应对多种障碍物,但预测可能存在误差。
- Wang 等基于 RGBD 图像进行动态感知,引入 Re-Free 策略消除移动物体暂时静止造成的错误占用;用移动椭球体建模动态对象,结合卡尔曼滤波预测未来运动状态,可解决遮挡问题。
- Xu 等提出 DPMPC-Planner,基于 MPC 避障,在滑窗时段内预测行人障碍位置和方差传播。
- Liu 等使用 EKF 预测行人轨迹,并将预测结果作为 MPC 输入。
- Xu 等使用 RGB-D 相机进行轻量级 3D 动态障碍物检测与跟踪,提升检测范围和动态障碍物识别能力,并用于四旋翼实时避障。
- Chen 等提出基于采样和粒子的预测方法 DSP-map。
物体运动过于复杂,涉及交互决策和随机变量
- 基于人类行为模型的分析方法
- 基于机器学习的方法
- 可信度意识算法
动态环境轨迹规划研究
反应式规划
代表方法:
- 速度障碍法(VO)
- 人工势场法(APF)
局限:
- 只关注当前障碍物信息和自身状态;
- 没有长远预测和交互;
- 轨迹易振荡。
基于概率优化的规划
考虑不确定性,将机器人和动态障碍物位置表示为概率分布,建立碰撞模型,以碰撞概率判断危险大小。
- 机会约束方法
- 集合有界方法
代表性工作:
- Zhu 等将机会约束引入动态环境避障,明确考虑每个机器人与障碍物之间的碰撞概率,建立机会约束非线性 MPC 问题,建立碰撞概率近似紧界,使公式能实时处理和求解。
- Fridovich-Keil 等将可信度意识算法与FaSTrack框架结合。
- Liu 等人将动态障碍及外部干扰等不确定性整合到一个机会约束中,假定机器人和障碍物形状为椭球形,计算无人机高斯分布前向可达集与障碍物状态之间的碰撞概率,通过阈值限制保证安全。
基于几何约束与代价函数优化的规划
- 前端:路径搜索,将空间抽象为地图,获得初步路径;
- 后端:定制代价函数,对前端路径平滑和优化,使其符合运动学等要求。
前端搜索空间:
- 占据栅格地图
- ESDF 地图
- 时间-状态空间
- 自定义节点图
路径搜索方式:
- 基于采样
- 基于图搜索
- 加入机器人动力学约束
后端代价函数取决于地图形式。为加快优化,常见做法是基于障碍物外形将无碰撞空间分割成凸多面体,即“飞行走廊”,在飞行走廊中进行分段优化,将问题通过硬约束转换为凸优化问题。也有方法通过软约束,增加惩罚项将约束软化。
- EGO-Planner 针对静态场景,避免使用 ESDF 造成的冗余计算,显著减少算法运行时间。
- 改进 EGO-Planner,可选择从障碍物两侧飞过、选择最优路径、去中心化,但在动态环境下容易陷入局部最小值。
- 将 EGO-Planner 应用于动态场景,提出动态避障动力学搜索方法。
- 改进 MINCO 方法和 MADER 方法
- 在线重规划框架
动态障碍物处理:
- 研究者将动态障碍物未来一段时间内的轨迹并集组成完整凸包障碍,称为“胶囊”,进行碰撞检测。
- 考虑未来一段时间无人机运动轨迹,设计时空胶囊约束。
- 用于无人机的三维分散异步轨迹规划器。将未来时间窗口内轨迹划分成不同时间段,对每段时间区间的障碍物轨迹使用最小外接多边形构建“胶囊”,对无人机轨迹使用 MINVO 基表示成最小外部多面体,将每个多面体的分离平面作为优化问题决策变量,实现在静态障碍物、动态障碍物和其他智能体环境中生成无碰撞轨迹。
- 对每个移动障碍物构建一段时间内的轨迹胶囊,再建立边界框。
- 利用高效点云分割策略区分静态和动态目标,快速准确预测运动,进行动态混乱环境中的轨迹优化。
- 基于预测图定义碰撞风险,构建风险感知时空安全走廊。
- 针对相机视场和动态物体等速模型的不确定性,对飞行轨迹进行主动偏航角规划。
全身安全性约束:
- 上述方法多将无人机本体视作质点进行碰撞检测。
- 对穿越尺寸限制更严空间的规划任务,需要利用无人机机体尺寸信息进行约束。
- 针对全驱动无人机将微分平坦量拓展到六维度,并对六旋翼倾转无人机进行全身约束。
- 针对可变形四旋翼进行全身约束。
结合概率与计算机图形的方法:
- 利用基于有向无环图 DAG 构建状态-时间驾驶空间,利用改进 A* 高效搜索时空轨迹。
- 利用状态-时间空间定义状态-时间图,并在对偶图上进行路径搜索,充分利用障碍物动态信息。
- DPMPC-Planner
该方向的问题:
- 动态环境特性要求前端搜索空间和后端优化空间具备快速更新能力,或者未来移动物体状态已知,或者进行保守性预测。
- 空间-时间规划方法由于进行未来一段时间的碰撞预测,在匀速运动场景和随机运动场景都有较好效果。
- 但当障碍物密度增多或不确定性增加时,预测的障碍物路径可能填满机器人面前空间,阻碍前进方向,机器人会减速停下等待,即“冻结机器人”问题。
基于深度强化学习的规划
工业界自动驾驶领域采用搭建神经网络进行端到端训练,已获得较好效果并成为趋势。无人机三维避障领域也有类似研究:
- Chen 等将端到端深度强化学习方法和基于改进动态窗口法的传统避障方法对比,最终提出一种基于动态窗口法的动态避障算法。
- Song 等提出学习神经网络策略的方法,在混乱环境中实现感知能力,并基于此实现最短时间飞行。
- Bhattacharya 等将事件相机搭载在无人机平台,使用深度学习训练反应式静态障碍物避障策略;之后首次利用视觉信息 Transformer 进行端到端的基于视觉的四旋翼飞行器控制。
目前无人机动态避障领域没有采用直接端到端的方法。
本文主要研究内容
- 基于静态地图的全局初始轨迹生成
- 局部动态三维避障轨迹重规划
- 基于有限状态机的实时轨迹规划跟踪系统
- 仿真与实物验证
文章作者 Simon Young
上次更新 2026-09-17