# pass image and text classes to processor inputs = processor(text=text_classes, images=image, return_tensors="pt", padding=True) # pass inputs to CLIP outputs = model(**inputs) # note: "**" unpacks dictionary items