# Step 1: Load dataset and model tokenizer dataset = load_dataset('imdb') tokenizer = AutoTokenizer.from_pretrained('bert-base-uncased')