DPO 直接偏好优化 对齐从RLHF走到DPO:AI直接偏好优化笔记最开始尝试了传统的 RLHF(强化学习人类反馈),但过程太痛苦了——需要训练三个模型,显存要80G,训练时间一… 醉月思📁 技术实践📅 2024-09-25