首页 > AI前沿 > Robust Adversarial Reinforcement Learning with Risk Sensitivity and Critic Consistency Regularization

Robust Adversarial Reinforcement Learning with Risk Sensitivity and Critic Consistency Regularization

arXiv机器学习 2026-09-23 18:37 4 阅读 查看原文

背景介绍

Reinforcement learning (RL) 在序列决策中取得了强大的性能,但在动态不确定性和分布变化下仍然很脆弱。Robust Adversarial Reinforcement Learning (RARL) 通过最坏情况扰动来提高鲁棒性,但现有的方法通常遭受不稳定优化和降级的价值估计问题。

问题分析

特别是在以下方面:过度激进的对手可能将智能体驱使到无信息的失败状态,而对抗性扰动放大了双批评之间的不一致,并引入了偏差的价值目标。

解决方案

我们提出一个统一的框架,RACER (Risk-sensitive robust Adversarial critic ConsistEncy-regularized Reinforcement learning),从风险敏感的角度重新审视对抗性 RL。

首先,我们引入一个状态依赖的对抗性目标,该目标自适应地调节扰动强度,抑制有害干扰同时保留有信息性的探索。

其次,我们提出批评一致性正则化以减少 Q 值估计器之间的一致性并稳定学习。

实验结果

在具有挑战性的连续控制基准测试上进行的综合实验表明,与强大的鲁棒 RL 基准相比,RACER 一致地提高了性能、鲁棒性和训练稳定性。