policy_loss = [] for log_prob, Gt in zip(log_probs, discounted_rewards): policy_loss.append(-log_prob * Gt)