# Load data and tokenize examplesn_samples = 1024data = load_dataset("allenai/c4", data_files="en/c4-train.00001-of-01024.json.gz", split=f"train[:{n_samples*5}]")tokenized_data = tokenizer("nn".join(data['text']), return_tensors='pt')# Format tokenized examplesexamples_ids = []for _ in range(n_samples): i = random.randint(0, tokenized_data.input_ids.shape[1] - tokenizer.model_max_length - 1) j = i + tokenizer.model_max_length input_ids = tokenized_data.input_ids[:, i:j] attention_mask = torch.ones_like(input_ids) examples_ids.append({'input_ids': input_ids, 'attention_mask': attention_mask})