diff --git a/fairscale/nn/data_parallel/fully_sharded_data_parallel.py b/fairscale/nn/data_parallel/fully_sharded_data_parallel.py index e1e294148..1b1b16d30 100644 --- a/fairscale/nn/data_parallel/fully_sharded_data_parallel.py +++ b/fairscale/nn/data_parallel/fully_sharded_data_parallel.py @@ -688,7 +688,7 @@ def _cast_buffers( @property def params_with_grad(self) -> List[Parameter]: """[p for p in self.parameters() if p.grad is not None]""" - return [p for p in self.parameters() if (p.grad is not None or p.main_grad is not None)] + return [p for p in self.parameters() if (p.requires_grad and (p.grad is not None or p.main_grad is not None))] @torch.no_grad() def clip_grad_norm_(