深度学习 学习率调度 PyTorch 模型训练 优化策略AI学习率调度踩坑记录按教程设置0.001,开始训练,盯着loss曲线等它下降,然后隔几轮降低学习率。 醉月思📁 技术实践📅 2021-03-15
强化学习 Q-Learning PPO PyTorch 算法实践把Q-Learning换到PPO时踩过的坑Agent在环境里试错,跟人在公司里摸鱼本质上是一回事——都在寻找最优策略,只不过一个靠探索利用,一个靠踩红线与打擦边球。 醉月思📁 学习笔记📅 2021-02-15