项目介绍 本项目是基于 verl 的二次开发,旨在增强原有框架的灵活性和性能,主要针对 reward 模型的调用和管理方式进行了优化。 如何在 verl 中自定义奖励模型(2025-04-15) 2025.上半年 自定义奖励模型实践 verl Agent 训练踩坑经历(2026-05-02) 2025.08~2025.12 评论场景下的 Agent SFT 与 RL 训练实践 Star History