-ValueBased04-ActionValue估算:Deep Q-learning02(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】)
RL-赵-(八)-Value-Based04:Deep Q-learning(DQN)【两网络:固定T,更新M,定期将M的参数赋给T】【经验池】【目标:最优化网络参数⮕使得通过网络计算出的q是最优的】1、技巧01:Two Networks(两个网络)第一个技巧: 使用了两个网络,一个是main network, 另一个是target network。为什么要使用两个网络呢? 在数学上来说因为计算梯度的时候会非常的复杂,所以先去固定一个,然后再去计算另一个,这样就需要两个网络来实现。具体实现的细节:令w ww和w T w_TwT分别表示mean network和target network的参数,它们初始化的时候是一样的。在每个iteration中,从 replay buffer【这里边包含了很多的experience的sample】 中 draw —个 mini-batch 样本{ ( s , a , r , s ′ ) } \{(s,a,r,s^{\prime})\}{(s,a,r,s′)}网络的输入包括 states ss和 actiona aa, 输出y = q ^ ( s , a , w ) y = \hat{q}(s, a, w)y=q^(s,a,w)。y ^ \hat{y}y^的目标值是y T ≐ r + γ max a ∈ A ( s ′ ) q ^ ( s ′ , a , w T ) y_T\doteq r+\gamma\max_{a\in\mathcal{A}(s^{\prime})}\hat{q}(s^{\prime},a,w_T)yT≐r+γmaxa∈A(s′)q^(s′,a,wT)。然后为了更新Main Network 我们直接基于the mini-batch