指尖魔法屋
  • 文章
  • 分类
  • 标签
  • 时间轴
  • 关于
  • 联系
  • 🔍

强化学习

RLHF 人类反馈 强化学习
AI人类反馈强化学习实践笔记
在这次实践之前,我的模型训练经验主要停留在监督学习阶段:准备数据、训练、评估。
醉月思 醉月思
📁 技术实践
📅 2023-11-11
强化学习 RL 策略优化
关于AI强化学习的几点记录
关于AI强化学习的几点记录一旦进项目,好看的架构图就没那么管用了。
醉月思 醉月思
📁 技术实践
📅 2022-10-14
强化学习 Q-Learning PPO PyTorch 算法实践
把Q-Learning换到PPO时踩过的坑
Agent在环境里试错,跟人在公司里摸鱼本质上是一回事——都在寻找最优策略,只不过一个靠探索利用,一个靠踩红线与打擦边球。
醉月思 醉月思
📁 学习笔记
📅 2021-02-15
Copyright © 2017-2026 指尖魔法屋. All rights reserved POWERED BY thinkBlog · v6.1.0 关于 · 联系 · 隐私政策 · Cookie 政策 本站已顽强运行:加载中...
粤ICP备17055617号