from random import randint # add utils method to path for loading dataset import sys sys.path.append("./scripts/utils") # make sure you change this to the correct path from pack_dataset import pack_dataset # template dataset to add prompt to each sample def template_dataset(sample): sample["text"] = f"{format_dolly(sample)}{tokenizer.eos_token}" return sample # apply prompt template per sample dataset = dataset.map(template_dataset, remove_columns=list(dataset.features)) # print random sample print(dataset[randint(0, len(dataset))]["text"]) # tokenize dataset dataset = dataset.map( lambda sample: tokenizer(sample["text"]), batched=True, remove_columns=list(dataset.features) ) # chunk dataset lm_dataset = pack_dataset(dataset, chunk_length=2048) # We use 2048 as the maximum length for packing