import torch from transformers import AutoModelForCausalLM, AutoTokenizer, pipeline # Hugging Face model id model_id = "philschmid/llama-2-7b-instruction-generator" tokenizer = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto", torch_dtype=torch.float16) # we load the model in fp16 on purpose pipe = pipeline("text-generation", model=model, tokenizer=tokenizer)