import torch from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig # Hugging Face model id model_id = "cognitivecomputations/dolphin-2.1-mistral-7b" # replace with your model id # BitsAndBytesConfig int-4 config bnb_config = BitsAndBytesConfig( load_in_4bit=True, bnb_4bit_use_double_quant=True, bnb_4bit_quant_type="nf4", bnb_4bit_compute_dtype=torch.bfloat16 ) # Load model and tokenizer model = AutoModelForCausalLM.from_pretrained( model_id, device_map="auto", use_cache=False, attn_implementation="flash_attention_2", torch_dtype=torch.bfloat16, quantization_config=bnb_config ) tokenizer = AutoTokenizer.from_pretrained(model_id) tokenizer.pad_token = tokenizer.eos_token tokenizer.padding_side = 'left' # to prevent errors with FA tokenizer.truncation_side = 'left' # to prevent cutting off last generation