摘要:
为了提高自主水下航行器(AUV)的遍历路径规划能力, 文中提出了一种基于改进的蒙豪森深度Q网络(AMDQN)的AUV遍历路径规划算法。首先建立贴合实际场景的遍历规划环境, 利用射线覆盖方法代替传统矩形栅格式建模, 以此提升环境建模精度, 同时约束AUV的可选动作集, 限制其机动能力。在上述环境下对算法各组件进行设计: 状态空间方面, 将模糊的全局环境信息、以AUV为中心的高精度局部环境信息, 以及AUV自身位置信息进行融合, 对环境进行系统化描述; 奖励函数方面, 引入了规则惩罚项与边缘指导机制, 使AUV能够沿环境边缘稳定航行, 提高覆盖率; 参数更新方面, 在DQN算法的基础上设计自适应温度参数更新策略, 同时结合多步奖励与竞争网络架构缓解训练方差; 在训练过程中, 对全连接层参数执行软重置操作, 以缓解局部最优现象。仿真实验结果证明, 相较于传统方法和未改进的强化学习算法, 文中所提算法环境适应性更强, 同时能实现更高的遍历覆盖率。
庞舟岐, 林晓波, 耿士程, 等. 基于AMDQN的AUV遍历路径规划方法[J]. 水下无人系统学报, 2026, 34(4): 687-700. doi: 10.11993/j.issn.2096-3920.2026-0028.