MCPcopy Create free account
hub / github.com/SooLab/CGFormer / __init__

Method __init__

bert/tokenization_bert.py:161–196  ·  view source on GitHub ↗
(
        self,
        vocab_file,
        do_lower_case=True,
        do_basic_tokenize=True,
        never_split=None,
        unk_token="[UNK]",
        sep_token="[SEP]",
        pad_token="[PAD]",
        cls_token="[CLS]",
        mask_token="[MASK]",
        tokenize_chinese_chars=True,
        **kwargs
    )

Source from the content-addressed store, hash-verified

159 max_model_input_sizes = PRETRAINED_POSITIONAL_EMBEDDINGS_SIZES
160
161 def __init__(
162 self,
163 vocab_file,
164 do_lower_case=True,
165 do_basic_tokenize=True,
166 never_split=None,
167 unk_token="[UNK]",
168 sep_token="[SEP]",
169 pad_token="[PAD]",
170 cls_token="[CLS]",
171 mask_token="[MASK]",
172 tokenize_chinese_chars=True,
173 **kwargs
174 ):
175 super().__init__(
176 unk_token=unk_token,
177 sep_token=sep_token,
178 pad_token=pad_token,
179 cls_token=cls_token,
180 mask_token=mask_token,
181 **kwargs,
182 )
183
184 if not os.path.isfile(vocab_file):
185 raise ValueError(
186 "Can't find a vocabulary file at path '{}'. To load the vocabulary from a Google pretrained "
187 "model use `tokenizer = BertTokenizer.from_pretrained(PRETRAINED_MODEL_NAME)`".format(vocab_file)
188 )
189 self.vocab = load_vocab(vocab_file)
190 self.ids_to_tokens = collections.OrderedDict([(ids, tok) for tok, ids in self.vocab.items()])
191 self.do_basic_tokenize = do_basic_tokenize
192 if do_basic_tokenize:
193 self.basic_tokenizer = BasicTokenizer(
194 do_lower_case=do_lower_case, never_split=never_split, tokenize_chinese_chars=tokenize_chinese_chars
195 )
196 self.wordpiece_tokenizer = WordpieceTokenizer(vocab=self.vocab, unk_token=self.unk_token)
197
198 @property
199 def vocab_size(self):

Callers

nothing calls this directly

Calls 4

load_vocabFunction · 0.85
BasicTokenizerClass · 0.85
WordpieceTokenizerClass · 0.85
itemsMethod · 0.80

Tested by

no test coverage detected