机器人

北大核心,JST,EI,CSCD,WJCI

国内刊号:21-1137/TP

国际刊号:1002-0446

机器人杂志2024年第6期:稀疏奖励场景下基于适应性状态近似的多智能体强化学习

发布日期:

作者:方宝富, 余婷婷, 王浩, 王在俊

关键词:强化学习, 稀疏奖励, 状态相似, 内在奖励

稀疏奖励是多智能体强化学习的主要挑战之一,现有算法难以在稀疏奖励场景下有效训练智能体团队,并且容易导致其探索效率低下。为解决此类问题,本文提出基于适应性状态近似的多智能体强化学习算法。受人类在奖励稀缺情况下学习的启发,通过考虑智能体状态之间的相似性,自适应地从经验池中获取近似状态,并将其添加到候选状态集,利用候选状态集中的探索信息促进策略训练。此外,算法还将该近似状态与当前局部状态之间的距离作为智能体的内在奖励,引导智能体在最大化联合状态动作值的同时更有效地探索未知环境,快速找到最优策略。实验结果表明,本文算法在不同稀疏奖励程度的多智能体追捕场景中表现优于现有强化学习方法,具备鲁棒性和有效性,能够加快智能体的学习速度。

来源:2024年第6期

《机器人》期刊编辑部

查看机器人杂志2024年第6期

声明

严正声明:本站非期刊官网,非中介代理。

本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。

联系我们

  • 地址:沈阳市浑南区创新路135号
  • 电话:024-23970050
  • E-mail:jqr@sia.cn

咨询工作人员