from trl import DPOTrainer trainer = DPOTrainer( model, ref_model=None, # set to none since we use peft peft_config=peft_config, args=args, train_dataset=train_dataset, eval_dataset=eval_dataset, tokenizer=tokenizer, max_length=max_seq_length, max_prompt_length=prompt_length, beta=dpo_args["beta"], loss_type=dpo_args["loss_type"], )