北大团队开源强化学习数据策略框架 DataFlex-RL 登 HuggingFace 日榜第二
2 小时前
针对大模型强化学习后训练中动态数据策略接入难、不同策略效果难以公平对比的痛点,北大 DCAI 团队等联合发布开源框架 DataFlex-RL。该框架复用 verl 训练流程,将数据选择、样本重加权、领域配比调整三类动态数据策略做成可配置组件,共享训练过程中已产生的奖励、优势等信号,实现打分与执行解耦,无需反复修改训练器即可在同一 RLVR / GRPO 流程中灵活切换、验证不同数据策略。研究团队完成 591 次覆盖多类模型与数学、逻辑、科学任务的实验,验证了各类数据策略的实际效果。该框架是此前开源项目 DataFlex 向强化学习训练环节的延伸,二者互补覆盖从数据准备到强化学习更新的全流程数据调度需求。
体验专业版特色功能,拓展更丰富、更全面的相关内容。