我这边用同一份训练数据,在同样的配置下,分别用verl和trinity跑了几遍结果,发现trinity的收敛结果和verl的收敛结果一直有很大gap(~10pp),从tensorboard上看ppo_kl和pg_clipfrac和verl的差别很大。请教下可能是什么原因导致的吗?两个框架的data shuffle都设置成false了,看了下第一个batch的rollout的reward分布也基本是一致的。 <img width="495" height="399" alt="Image" src="https://github.com/user-attachments/assets/89d44e08-ba78-4139-b85c-f2f5df9dd952" /> <img width="495" height="399" alt="Image" src="https://github.com/user-attachments/assets/d4b3bb2a-726e-478e-a62c-fc69580ade69" />
我这边用同一份训练数据,在同样的配置下,分别用verl和trinity跑了几遍结果,发现trinity的收敛结果和verl的收敛结果一直有很大gap(~10pp),从tensorboard上看ppo_kl和pg_clipfrac和verl的差别很大。请教下可能是什么原因导致的吗?两个框架的data shuffle都设置成false了,看了下第一个batch的rollout的reward分布也基本是一致的。