(
self,
vocab_file,
do_lower_case=True,
do_basic_tokenize=True,
never_split=None,
unk_token="[UNK]",
sep_token="[SEP]",
pad_token="[PAD]",
cls_token="[CLS]",
mask_token="[MASK]",
tokenize_chinese_chars=True,
**kwargs
)
| 159 | max_model_input_sizes = PRETRAINED_POSITIONAL_EMBEDDINGS_SIZES |
| 160 | |
| 161 | def __init__( |
| 162 | self, |
| 163 | vocab_file, |
| 164 | do_lower_case=True, |
| 165 | do_basic_tokenize=True, |
| 166 | never_split=None, |
| 167 | unk_token="[UNK]", |
| 168 | sep_token="[SEP]", |
| 169 | pad_token="[PAD]", |
| 170 | cls_token="[CLS]", |
| 171 | mask_token="[MASK]", |
| 172 | tokenize_chinese_chars=True, |
| 173 | **kwargs |
| 174 | ): |
| 175 | super().__init__( |
| 176 | unk_token=unk_token, |
| 177 | sep_token=sep_token, |
| 178 | pad_token=pad_token, |
| 179 | cls_token=cls_token, |
| 180 | mask_token=mask_token, |
| 181 | **kwargs, |
| 182 | ) |
| 183 | |
| 184 | if not os.path.isfile(vocab_file): |
| 185 | raise ValueError( |
| 186 | "Can't find a vocabulary file at path '{}'. To load the vocabulary from a Google pretrained " |
| 187 | "model use `tokenizer = BertTokenizer.from_pretrained(PRETRAINED_MODEL_NAME)`".format(vocab_file) |
| 188 | ) |
| 189 | self.vocab = load_vocab(vocab_file) |
| 190 | self.ids_to_tokens = collections.OrderedDict([(ids, tok) for tok, ids in self.vocab.items()]) |
| 191 | self.do_basic_tokenize = do_basic_tokenize |
| 192 | if do_basic_tokenize: |
| 193 | self.basic_tokenizer = BasicTokenizer( |
| 194 | do_lower_case=do_lower_case, never_split=never_split, tokenize_chinese_chars=tokenize_chinese_chars |
| 195 | ) |
| 196 | self.wordpiece_tokenizer = WordpieceTokenizer(vocab=self.vocab, unk_token=self.unk_token) |
| 197 | |
| 198 | @property |
| 199 | def vocab_size(self): |
nothing calls this directly
no test coverage detected