基于循环神经网络学习的高速飞行器集群在动态事件触发通信下的预定时间安全鲁棒协作编队控制

RNN Learning-Based Prescribed-Time Safe and Robust Cooperative Group Formation Control for High-Speed Flight Vehicle Swarm Under Dynamic Event-Triggered Communication

12 架高速飞行器要先组成一个整体编队,再拆成多个小队执行任务;在未知气动扰动 + 未建模/参数不确定 + 执行器乘性/加性故障 + 机间碰撞风险的情况下,于用户指定的时刻精确成队并全程不碰撞完成任务。

用动态事件触发的分布式预设时间估计器(DP-TE-TE)重构虚拟领航者(VLV)的凸包信息;用约束跟随理论把"避碰"和"编队跟踪"两个目标都翻译成等式约束,合成一个约束跟随误差;再用 RNN 在线学习补偿那个复合未知非线性 $\Delta_i$,最后合成控制律 P-TSRCGFCS。

仿真结果:3 个 VLV + 12 架 HSFV,$t=10$ s 精确构成正十二边形、$t=20$ s 拓扑重构分 3 组、$t=30$ s 各组再次精确成队;全程机间距离 $>2r$。

痛点及解决方法

现阶段

  • 大多为单一编队
  • 分布式架构下故障会级联传播,部分工作忽略机间碰撞
  • APF(人工势场法)、CBF、约束跟随各有缺陷

解决措施

  • 分组编队
  • 同时做容错和避碰
  • 约束跟随同时检测半径

贡献

  1. DP-TE-TE:首次同时做到「事件触发通信 + 有向拓扑 + 预设时间收敛 + 触发条件不依赖连续通信」。
  2. 检测半径 $R_a$ + 潜在碰撞集的避碰设计:省算力、符合"机载探测距离有限"的物理现实。
  3. P-TSRCGFCS:指定时刻收敛 + 避碰与容错保证安全 + 对扰动和参数不确定鲁棒。

正文

系统模型

原始六状态模型

状态 $V,\gamma$(航迹角)$,\psi$(航向角)$,x,y,z$,输入是三轴过载 $n_x,n_y,n_z$,另有六个未知有界气动扰动。

文中规定 $y$ 轴是垂直方向,并非常见的 $z$ 轴朝上。

$\varpi_i$ 各分量是未知但有界的气流扰动。

执行器故障: $$ u_{i,f}=\mathcal{N} _{i,u}u_i+b _{i,u} $$

$\mathcal{N}_ {i,u}$ 表示控制增益衰减,例如某个轴的实际输出只有指令的一部分;$b_{i,u}$ 表示额外的偏置故障。健康时可近似为 $\mathcal{N}_ {i,u}=I,\ b_ {i,u}=0$。

$$ \dot p_i(t)=v_i(t),\qquad \dot v_i(t)=\Gamma_i(t)u_i(t)+\varpi_i(t) $$

$$ \Gamma_i(t)=\begin{bmatrix} \cos\gamma_i\cos\psi_i & -\sin\gamma_i\cos\psi_i & -\sin\psi_i\\ \sin\gamma_i & \cos\gamma_i & 0\\ \cos\gamma_i\sin\psi_i & -\sin\gamma_i\sin\psi_i & \cos\psi_i \end{bmatrix} $$

矩阵 $\Gamma_i$ 是由 $\gamma_i,\chi_i$ 组成的坐标变换矩阵,负责把三个方向的过载输入映射到惯性坐标系的加速度;$\varpi_i$ 则把原有扰动及其导数汇总起来。$\Gamma_i(t)$ 可逆。常数 $-g$ 被塞进了 $\varpi_i$ 的第二个分量,重力项被当作"扰动"一并处理(RNN 会学掉它)。

不确定性

$$ \Gamma_i=\Gamma_{i,n}+\Gamma_{i,\Delta} $$ 其中 $\Gamma_{i,n}$ 是标称模型,$\Gamma_{i,\Delta}$ 是模型误差。

将上式整理得 $$ \dot\upsilon_i=\Gamma_{i,n}u_i+\Delta_i $$

把风扰、模型不确定性和执行器故障并入 $\Delta_i$。这是后续 RNN 要估计和补偿的对象。

虚拟领航者与分组

VLV

假定领航者输入的一阶导有界,把虚拟领航器近似成二阶积分器: $$ \dot p_{k,l}=\upsilon_{k,l},\qquad \dot\upsilon_{k,l}=u_{k,l} $$

期望轨迹

每架飞机的期望位置 $$ p_{i,d}=\delta_i^p+\sum_k\varrho_kp_{k,l}, \qquad \sum_k\varrho_k=1 $$

第二项是所属小组领航器位置的加权组合;多个领航器时,它给出这些领航器凸包中的参考位置,只有一个领航器时就是该领航器的位置。$\varrho_k$为权重,$\delta_i^p(t)$ 是飞机相对参考点的期望编队偏移。

安全条件

$$ ||p_i-p_l||>2r,\qquad i\ne l $$ 两架飞机看作半径为 $r$ 的安全球,因此球面不相交要求中心距离大于 $2r$。

RNN 在线学习

包含输入层、隐藏层和输出层。

输入层接收选定的系统特征 $\xi_i$,供网络判断当前工况。

隐藏层将当前输入与上一时刻的隐藏节点输出结合,再经过 sigmoid 函数处理。循环连接让网络利用历史信息,拟合随时间变化的未知影响。

输出层对隐藏层特征加权,输出三维向量 $\hat\Delta_i=\hat W_i^T\hat H_{i,O}$,分别估计三个方向的未知加速度影响,供控制器补偿。

隐藏层中每个隐藏节点把当前输入和上一时刻自身输出相加 $$ h_{i,\ell}(t)=\sum_j\alpha_{i,j\ell}\xi_{i,j}(t) +\beta_{i,\ell}h_{i,\ell}^{o}(t-1), \quad h_{i,\ell}^{o}=\frac{1}{1+e^{-h_{i,\ell}}} $$ $\alpha$ 是输入到隐藏层的权重,$\beta$ 是循环权重。上一时刻的输出让网络具有记忆,适合拟合随时间变化的未知动力学。 网络输出是 $$ \hat\Delta_i=\hat W_i^T\hat H_{i,O} $$ 即用输出权重 $\hat W_i$ 把隐藏层特征组合成三轴未知加速度的估计。仿真中使用 6 个输入、30 个隐藏节点和 3 个输出。

对真实隐藏层输出在当前权重估计附近做一阶泰勒展开 $$ \tilde H_{i,O}=\Phi_{i,\alpha}\tilde\alpha_i+ \Phi_{i,\beta}\tilde\beta_i+\epsilon_{i,H}\varPhi\Delta\Theta $$ $\tilde\alpha,\tilde\beta$ 是权重估计误差;$\Phi$ 是隐藏层输出对权重的灵敏度;$\epsilon_{i,H}$ 是高阶余项。它的作用是把“权重错了多少”转成“隐藏层输出会错多少”的近似关系。

将真实 RNN 输出拆成估计输出、权重误差带来的偏差,以及残余逼近误差: $$ \Delta_i^*=\hat\Delta_i+\tilde\Delta_i $$ 这是自适应学习律的基础:控制器用 $\hat\Delta_i$ 补偿模型,剩余误差由鲁棒项覆盖。

若某个 Lyapunov 量 $V$ 的导数满足 $$ \dot V\le -\vartheta\sigma(t)\tilde V+z(t) $$ 其中 $\sigma(t)=1/(T-t)$,而 $z(t)$ 有界,那么 $V$ 保持有界,$\tilde V$ 在 $T$ 前趋于零。越接近指定时间,收敛系数越大,系统被施加越来越强的收敛作用。

约束分析

先定义潜在碰撞邻居集合,再定义 $$ \zeta^a_{iv}=\rho_a\ln\left(||p_i-p_v||^2-4r^2\right) $$ 括号内的量 $S_{iv}=||p_i-p_v||^2-4r^2$ 是用来构造碰撞运动约束的距离函数,在安全边界上等于零;当距离接近 $2r$ 时,$\ln S_{iv}$ 会变得很负。

求一阶、二阶导数。令相对位置 $d=p_i-p_v$、相对速度 $w=\upsilon_i-\upsilon_v$,则 $$ \dot\zeta^a_{iv}=2\rho_a\frac{d^Tw}{||d||^2-4r^2} $$ 它取决于相对位置和相对速度在连线方向上的投影;二阶导数还包含相对加速度和相对速度大小。由此可以把“距离如何变化”转成对飞机速度、加速度的约束。

把这些导数整理成系数 $\Lambda^a_{iv}, b^a_{iv}, c^a_{iv}$。这些系数不是新的物理状态,而是把关于 $p_i,\upsilon_i,\dot\upsilon_i$ 的表达式写成线性约束所需的整理项。

对单个邻居写成 $$ \Lambda^a_{iv}\dot p_i=b^a_{iv},\qquad \Lambda^a_{iv}\ddot p_i=c^a_{iv} $$ 它等价于让碰撞函数的一阶、二阶变化率满足论文构造的约束条件。将所有探测范围内的邻居约束叠起来。论文的想法是:飞机一旦进入探测范围,就通过约束相对运动,避免继续逼近危险距离。

定义编队位置误差 $$ \zeta_i^e=p_i-p_{i,d} $$

式 (20) 为了指定收敛速度设计误差约束: $$ \dot\zeta_i^e+\sigma_e(t)\zeta_i^e=0 $$ 取 $\sigma_e(t)=1/(T_e-t)$ 时,理想解是 $$ \zeta_i^e(t)=\zeta_i^e(0)\frac{T_e-t}{T_e},\quad 0\le t<T_e, $$ 所以误差在 $T_e$ 到达零;之后改用常数 $\varsigma_e$,让零误差保持不变。

对上式求导,得到二阶误差约束。分别由式 (20) 对时间求一阶、二阶导数得到: $$ \dot\zeta_i^e=\upsilon_i-\upsilon_{i,d}. $$ 这里 $\upsilon_{i,d}$ 是期望轨迹速度,包含偏移速度和领航器速度的加权和。

把这些关系回代,得到分别规定需要的飞机速度和加速度。误差动态先给出理想上飞机运动策略,控制器再负责实现它。

定义跟踪约束的系数 $\Lambda_i^e,b_i^e,c_i^e$,其中 $\Lambda_i^e=I$。

将碰撞约束和跟踪约束上下堆叠: $$ \Lambda_i\dot p_i=b_i,\qquad \Lambda_i\ddot p_i=c_i. $$ 最后定义 $$ \theta_i=\Lambda_i\dot p_i-b_i $$ 作为“约束跟随误差”。如果 $\theta_i$ 变小,飞机就越来越符合碰撞和轨迹两类要求。碰撞邻居越多,约束行数越多;因此实际控制会遇到多个约束同时满足的问题。

主要结果

建立分布式预设时间估计器后,每架飞机分别估计参考位置、速度、输入: $$ \dot{\hat p}_ {i,l}=-(\kappa_p+\sigma_p)\bar\phi_ {i,p}+\hat\upsilon_{i,l}, $$ 速度和输入通道也有对应方程。 $\bar\phi$ 是本机估计与邻居估计、领航器真实信息之间的加权差;差异越大,校正越强。 $\kappa$ 提供常规收敛作用,$\sigma(t)$ 把收敛时间指定为 $T_p,T_\upsilon,T_u$。时间设为 $T_p>T_\upsilon>T_u$,是为了先估准位置,再估准速度和输入。

输入估计方程另有 $-\rho_e f(\bar\phi_{i,u})$。$f$ 是归一化方向函数,作用类似有界的符号校正项,用来应对领航器输入变化率有界但未知的情况。

动态事件触发规则:当位置、速度或输入任一通道的 $\mu_{i,\iota}(t)$ 达到动态阈值 $\eta_{i,\iota}(t)$,就广播新估计。 $\mu$ 同时考虑本机自上次广播以来的变化误差,以及估计邻域误差;$\eta$ 按微分方程动态调整。这样可以减少持续通信。论文的定理声称在其假设下事件间隔不会无限趋近于零。

主要控制律可以分成三部分理解:

  1. $(\Lambda_i\Gamma_{i,n})^+(\hat c_i-\Lambda_i\hat\Delta_i)$:用伪逆把期望约束加速度转换成控制输入,并减去 RNN 估计的未知影响。
  2. $-(\Lambda_i\Gamma_{i,n})^+P_i^{-1}\theta_i$:反馈修正约束误差,误差越大,修正越强。
  3. 最后的符号鲁棒项:对 RNN 估计不准、未知扰动等提供额外抗扰作用。

$(\cdot)^+$ 是 Moore–Penrose 伪逆。因为把碰撞约束和三维跟踪约束堆叠后,方程可能多于三个,输入未必能让所有约束精确满足;伪逆给出最小二乘意义下的输入。$P_i$ 是正定增益矩阵,决定不同约束误差的权重。

RNN 自适应律分别更新输出权重 $\hat W_i$、输入权重 $\hat\alpha_i$ 和循环权重 $\hat\beta_i$。右端都包含约束误差 $\theta_i$ 及相应网络灵敏度,属于梯度型在线学习:如果当前估计误差持续影响约束,就沿能减小误差的方向调整网络参数。

结论

论文给出的理论保证有前提:通信图满足指定连通性条件,扰动和领航器输入变化率有界,RNN 逼近误差有界,并且控制增益按定理条件选取。仿真用 12 架 HSFV 和 3 个虚拟领航器,报告了编队误差在指定时刻归零、两机距离大于 $2r=100$ 米,以及估计器和事件触发的运行结果。

有两个阅读时值得留意的边界:第一,碰撞约束只对探测半径内的邻机建立,所以安全结论依赖探测和控制能及时工作;第二,约束堆叠后可能超定,伪逆本身不能保证彼此冲突的约束都精确满足,论文的结论依赖其稳定性假设。另一个建模细节是扰动项出现了原始扰动的时间导数,实际应用通常还需要足够的平滑性或额外假设。