discounted_rewards = torch.FloatTensor(discounted_rewards).to(device) discounted_rewards = (discounted_rewards - discounted_rewards.mean()) / (discounted_rewards.std() + 1e-9)