import torch from peft import AutoPeftModelForCausalLM from transformers import AutoTokenizer peft_model_id = "./llama-3-70b-hf-no-robot" # Load Model with PEFT adapter model = AutoPeftModelForCausalLM.from_pretrained( peft_model_id, torch_dtype=torch.float16, quantization_config= {"load_in_4bit": True}, device_map="auto" ) tokenizer = AutoTokenizer.from_pretrained(peft_model_id)