SAC 和 FlashSAC

本文建议使用白色背景观看。 SAC SAC: Soft Actor Critic,结合了DDPG的双Q函数降低over estimation bias, 以off-policy的方式,将最大熵加入到策略学习和Q函数学习的目标中,打破了传统的只看reward的唯一目标方式。数据存储在replay buffer中,使用经验回放的方式进行训练。SAC的目标是最大化期望奖励和策略熵的加权和: $$ \pi^* = \arg \max_{\pi} \mathbb{E} \left[ \sum_{t=0}^\infty \gamma^t \left( R(s_t, a_t, s_{t+1}) + \alpha H(\pi(\cdot | s_t)) \right) \right] $$ 其中, $$ [ H(P) = \underset{x \sim P}{\mathbb{E}} [-\log P(x)] ] $$ 所以动作价值函数就变为: $$ Q^{\pi}(s, a) = \mathbb{E} _{\tau \sim \pi} [ \sum _{t=0}^{\infty} \gamma^t R(s_t, a_t, s _{t+1}) + \alpha \sum _{t=1}^{\infty} \gamma^t H(\pi(\cdot|s_t)) \bigg| s_0 = s, a_0 = a] $$ ...

2026年7月23日 · 59 分钟 · Yang