chat = llm.predict({ "inputs":tok.apply_chat_template(messages,tokenize=False,add_generation_prompt=True), # convert messages to model input "parameters":payload }) print(chat[0]["generated_text"])