MCPcopy Create free account
hub / github.com/brightmart/text_classification / FullTokenizer

Class FullTokenizer

a00_Bert/tokenization.py:110–131  ·  view source on GitHub ↗

Runs end-to-end tokenziation.

Source from the content-addressed store, hash-verified

108
109
110class FullTokenizer(object):
111 """Runs end-to-end tokenziation."""
112
113 def __init__(self, vocab_file, do_lower_case=True):
114 self.vocab = load_vocab(vocab_file)
115 self.inv_vocab = {v: k for k, v in self.vocab.items()}
116 self.basic_tokenizer = BasicTokenizer(do_lower_case=do_lower_case)
117 self.wordpiece_tokenizer = WordpieceTokenizer(vocab=self.vocab)
118
119 def tokenize(self, text):
120 split_tokens = []
121 for token in self.basic_tokenizer.tokenize(text):
122 for sub_token in self.wordpiece_tokenizer.tokenize(token):
123 split_tokens.append(sub_token)
124
125 return split_tokens
126
127 def convert_tokens_to_ids(self, tokens):
128 return convert_by_vocab(self.vocab, tokens)
129
130 def convert_ids_to_tokens(self, ids):
131 return convert_by_vocab(self.inv_vocab, ids)
132
133
134class BasicTokenizer(object):

Callers

nothing calls this directly

Calls

no outgoing calls

Tested by

no test coverage detected