def __init__(self, csv_file, tokenizer, max_length=None, pad_token_id=50256): self.data = pd.read_csv(csv_file) self.encoded_texts = [tokenizer.encode(text) for text in self.data["Text"]] self.max_length = max_length or max(map(len, self.encoded_texts)) self.encoded_texts = [tokens[:self.max_length] for tokens in self.encoded_texts] self.encoded_texts = [ tokens + [pad_token_id] * (self.max_length - len(tokens)) for tokens in self.encoded_texts ] __ __