奖励模型 RewardModel PPO把评分换到优化时踩过的坑在实际项目中,我对 reward model 有这几个具体需求: 1. **能打分**:给定 (prompt, response) 对,输出一… 醉月思📁 技术实践📅 2024-04-14
数据处理 数据清洗 数据标注 质量控制从清洗走到标注:AI数据处理笔记最近一个月折腾了一堆 NLP 数据,从 JSON 格式的对话记录到用户评论文本,再到一些半结构化的标注数据。 醉月思📁 技术实践📅 2024-04-08
AI Agent LangChain AutoGPT 任务规划 工具调用从LangChain走到AutoGPT:AI Agent开发笔记那时候 AI Agent 还没现在这么火,LangChain 也刚到 0.1 版本,我还在想这玩意儿是不是只是又一层封装。 醉月思📁 技术实践📅 2024-04-02