from trl import DPOConfig training_args = DPOConfig( output_dir="smolvlm-instruct-trl-dpo-rlaif-v", bf16=True, gradient_checkpointing=True, per_device_train_batch_size=1, per_device_eval_batch_size=1, gradient_accumulation_steps=32, num_train_epochs=5, dataset_num_proc=8, # tokenization will use 8 processes dataloader_num_workers=8, # data loading will use 8 workers logging_steps=10, report_to="tensorboard", push_to_hub=True, save_strategy="steps", save_steps=10, save_total_limit=1, eval_steps=10, # Steps interval for evaluation eval_strategy="steps", )