for prompt in batch: rollouts = [play_game(model, prompt) for _ in range(group_size)] rewards = [total_reward(r.final_state) for r in rollouts] advantage = rewards - mean(rewards) # relative to the group update_model(model, rollouts, advantage)