for episode in range(num_episodes): state, _ = self.env.reset() done = False total_reward = 0 log_probs = [] rewards = []