-
2020年研究生华为杯,数学建模竞赛C题.rar下载
资源介绍
那我们讲一下它的 algorithm。假设我们 learn 了一个 Q-function,Q-function 就是 input s 跟 a,output 就是 Q^{\pi}(s,a)Q
π
(s,a)。那接下来,我们要 learn 一个 actor,这个 actor 的工作就是解这个 arg max 的 problem。这个 actor 的工作就是 input 一个 state s,希望可以 output 一个 action a。这个 action a 被丢到 Q-function 以后,它可以让 Q^{\pi}(s,a)Q
π
(s,a) 的值越大越好。那实际上在 train 的
- 上一篇: 一款小程序线上点餐源代码
- 下一篇: 第14届中国研究生数模竞赛一等奖论文(每道题的前2名).rar