@rooboo 在 [强化学习 / SAC] DAgger 初始化后 SAC 双足机器人长期学习出小碎步,如何设计奖励诱导大步态? 中发帖

[output] 
如题,强化学习出现前期不太不稳,收敛后学习出小碎步前进,如何设计引导奖励函数可以避免这些问题。
 
 
Back to Top