Skip to content

GRPO训练的PPO_KL和PG_clipfrac曲线和verl同样数据同样设置下差别很大,最终收敛结果也和verl训练差距很大 #426

Description

@chongzi1990

我这边用同一份训练数据,在同样的配置下,分别用verl和trinity跑了几遍结果,发现trinity的收敛结果和verl的收敛结果一直有很大gap(~10pp),从tensorboard上看ppo_kl和pg_clipfrac和verl的差别很大。请教下可能是什么原因导致的吗?两个框架的data shuffle都设置成false了,看了下第一个batch的rollout的reward分布也基本是一致的。

Image Image

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions