import torch vanilla_res = generate_helper(pipe) print(f"Latency: {vanilla_res['latency']}") print(f"GPU memory: {torch.cuda.memory_allocated() / 1024**3:.2f} GB") print(f"Generated Instruction: {vanilla_res['text']}") # Latency: 37.49ms/token # GPU memory: 12.62 GB # Generated Instruction: Write a request for PTO letter to my boss