国内刊号:31-1267/N
国际刊号:0253-374X
发布日期:
作者:张骁雄,丁松,彭锐,伍国华,刘忠
单位:1.国防科技大学 第六十三研究所,江苏 南京 210007;2.国防科技大学 大数据与决策实验室, 湖南 长沙 410073;3.浙江财经大学 经济学院,浙江 杭州 310018;4.北京工业大学 经济与管理学院,北京 100124;5.中南大学 交通运输工程学院,湖南 长沙 410075
关键词:资源分配,攻防博弈,伪装目标,强化学习,Q-learning
基金:国家自然科学基金(72471236); 北京市科技新星资助项目(Z191100001119100); 中国科协(特殊领域)青年人才托举工程项目(2021-JCJQ-QT-050)
针对资源受限下的攻防博弈资源分配问题,提出一种基于强化学习的多阶段攻防资源分配对策模型。防守者考虑如何在多阶段攻防中有效分配资源部署伪装目标以及加强真实目标防护,而多个进攻者考虑如何合作在多阶段攻防中有效分配资源识别伪装目标以及攻击真实目标。在各阶段以真实目标发挥期望效益为奖励准则,设计基于强化学习Q-learning算法的资源分配模型,生成整个周期内的攻防双方最优资源分配策略。示例研究验证了所提模型算法的有效性,能为多阶段攻防博弈资源分配提供辅助决策。
来源:2025年第6期
《同济大学学报(自然科学版)》期刊编辑部