BertTokenizer( name_or_path='bert-base-uncased', vocab_size=30522, model_max_length=512, is_fast=False, padding_side='right', truncation_side='right', special_tokens={ 'unk_token': '[UNK]', 'sep_token': '[SEP]', 'pad_token': '[PAD]', 'cls_token': '[CLS]', 'mask_token': '[MASK]'}, clean_up_tokenization_spaces=True), added_tokens_decoder={ 0: AddedToken( "[PAD]", rstrip=False, lstrip=False, single_word=False, normalized=False, special=True), 100: AddedToken( "[UNK]", rstrip=False, lstrip=False, single_word=False, normalized=False, special=True), 101: AddedToken( "[CLS]", rstrip=False, lstrip=False, single_word=False, normalized=False, special=True), 102: AddedToken( "[SEP]", rstrip=False, lstrip=False, single_word=False, normalized=False, special=True), 103: AddedToken( "[MASK]", rstrip=False, lstrip=False, single_word=False, normalized=False, special=True), }