def objective(self, trial, n_episodes=100): lr = trial.suggest_loguniform('lr', 1e-5, 1e-1) gamma = trial.suggest_uniform('gamma', 0.9, 0.999) optimizer = optim.Adam(self.policy_network.parameters(), lr=lr) trainer = REINFORCE(self.env, self.policy_network, optimizer, self.model_path, gamma=gamma) reward = trainer.train(n_episodes, save_model=False, save_video=False) return reward