Temporal Difference (TD) Learning
上节已经提到了如果我们有DQN,那么agent就知道每一步动作如何做了,那么DQN如何训练那?这里面使用TD算法。
简略分析:
是的估计
是的估计
所以:
Deep Reinforcement Learning :
Prediction :
TD Target :
Loss :
Gradient Desent : ,做梯度下降是为了让loss减少
Temporal Difference (TD) Learning
上节已经提到了如果我们有DQN,那么agent就知道每一步动作如何做了,那么DQN如何训练那?这里面使用TD算法。
简略分析:
是的估计
是的估计
所以:
Deep Reinforcement Learning :
Prediction :
TD Target :
Loss :
Gradient Desent : ,做梯度下降是为了让loss减少
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:/a/647553.html
如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!