from transformers import BitsAndBytesConfig # load model in model as 4-bit nf4_config = BitsAndBytesConfig( load_in_4bit=True, bnb_4bit_quant_type="nf4", bnb_4bit_compute_dtype = torch.bfloat16, bnb_4bit_use_double_quant=True ) model_nf4 = AutoModelForSequenceClassification.from_pretrained(model_id, device_map=device, quantization_config=nf4_config)