generated_response = lm.generate( input_ids=inputs["input_ids"], attention_mask=inputs["attention_mask"], max_new_tokens=max_new_tokens, # The max number of tokens to generate do_sample=True, # Probabilistic sampling top_p=0.95, # Nucleus sampling num_return_sequences=G, # Number of sequences per question temperature=1, # Increase randomness eos_token_id=eos_token_id, pad_token_id=eos_token_id, )