<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>具身智能 on Yang's Blog</title><link>https://warden2018.github.io/tags/%E5%85%B7%E8%BA%AB%E6%99%BA%E8%83%BD/</link><description>Recent content in 具身智能 on Yang's Blog</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Thu, 23 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://warden2018.github.io/tags/%E5%85%B7%E8%BA%AB%E6%99%BA%E8%83%BD/index.xml" rel="self" type="application/rss+xml"/><item><title>SAC 和 FlashSAC</title><link>https://warden2018.github.io/posts/2026-07-23-flashsac/</link><pubDate>Thu, 23 Jul 2026 00:00:00 +0000</pubDate><guid>https://warden2018.github.io/posts/2026-07-23-flashsac/</guid><description>&lt;p&gt;本文建议使用白色背景观看。&lt;/p&gt;
&lt;h2 id="sac"&gt;SAC&lt;/h2&gt;
&lt;p&gt;SAC: Soft Actor Critic，结合了DDPG的双Q函数降低over estimation bias, 以off-policy的方式，将最大熵加入到策略学习和Q函数学习的目标中，打破了传统的只看reward的唯一目标方式。数据存储在replay buffer中，使用经验回放的方式进行训练。SAC的目标是最大化期望奖励和策略熵的加权和：&lt;/p&gt;
&lt;p&gt;$$
\pi^* = \arg \max_{\pi} \mathbb{E} \left[ \sum_{t=0}^\infty \gamma^t \left( R(s_t, a_t, s_{t+1}) + \alpha H(\pi(\cdot | s_t)) \right) \right]
$$&lt;/p&gt;
&lt;p&gt;其中，
$$
[
H(P) = \underset{x \sim P}{\mathbb{E}} [-\log P(x)]
]
$$&lt;/p&gt;
&lt;p&gt;所以动作价值函数就变为：&lt;/p&gt;
&lt;p&gt;$$
Q^{\pi}(s, a) = \mathbb{E} _{\tau \sim \pi} [ \sum _{t=0}^{\infty} \gamma^t R(s_t, a_t, s _{t+1}) + \alpha \sum _{t=1}^{\infty} \gamma^t H(\pi(\cdot|s_t)) \bigg| s_0 = s, a_0 = a]
$$&lt;/p&gt;</description></item></channel></rss>