研究
围绕多无人机协同搜索、围捕与复杂环境自主决策。
Emergent Cooperative Strategies for Pursuit-Evasion in Cluttered Environments: A Knowledge-Enhanced Multi-Agent Deep Reinforcement Learning Approach
复杂障碍环境中的追逃涌现协作策略:一种知识增强的多智能体深度强化学习方法
2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) · 17138–17145 · DOI 10.1109/IROS60139.2025.11246236
面向复杂障碍与有限感知条件下的多智能体追逃,提出基于团队回报的 KE-MATD3,并将改进人工势场的启发式知识作为软一致性约束注入策略优化,以缓解协作学习中的信用分配与局部最优问题。
- 将协同围捕建模为去中心化部分可观测决策过程,以共享团队回报促进有限感知智能体形成协作。
- 利用改进人工势场构造知识一致性损失,在训练阶段提供软引导,同时保留强化学习的自主探索能力。
- 通过多随机种子仿真、不同障碍密度下的泛化测试,以及 5 架 Crazyflie 与 20 个障碍物的实机实验验证方法。
Multi-Agent RL · Pursuit-Evasion · Knowledge Guidance · Crazyflie
论文页面 ↗
Multi-UAV Collaborative Pursuit Method via Hierarchical Reinforcement Learning
基于分层强化学习的多无人机协同围捕方法
控制理论与应用 · 42(1): 96–108 · DOI 10.7641/CTA.2024.30439
将复杂障碍环境中的多无人机围捕分解为避障与避碰子策略,并通过带切换惩罚的稀疏回报学习高层策略切换。
- 分层学习导航避障与导航避碰技能,降低整体围捕策略的学习难度。
- 高层模块自主组合底层技能,避免依赖人工定义的切换规则。
- 数值仿真与软件在环实验验证了围捕成功率、碰撞率与任务适应性。
Hierarchical RL · Multi-UAV · Obstacle Avoidance · SITL
论文页面 ↗