Runs end-to-end tokenziation.
| 108 | |
| 109 | |
| 110 | class FullTokenizer(object): |
| 111 | """Runs end-to-end tokenziation.""" |
| 112 | |
| 113 | def __init__(self, vocab_file, do_lower_case=True): |
| 114 | self.vocab = load_vocab(vocab_file) |
| 115 | self.inv_vocab = {v: k for k, v in self.vocab.items()} |
| 116 | self.basic_tokenizer = BasicTokenizer(do_lower_case=do_lower_case) |
| 117 | self.wordpiece_tokenizer = WordpieceTokenizer(vocab=self.vocab) |
| 118 | |
| 119 | def tokenize(self, text): |
| 120 | split_tokens = [] |
| 121 | for token in self.basic_tokenizer.tokenize(text): |
| 122 | for sub_token in self.wordpiece_tokenizer.tokenize(token): |
| 123 | split_tokens.append(sub_token) |
| 124 | |
| 125 | return split_tokens |
| 126 | |
| 127 | def convert_tokens_to_ids(self, tokens): |
| 128 | return convert_by_vocab(self.vocab, tokens) |
| 129 | |
| 130 | def convert_ids_to_tokens(self, ids): |
| 131 | return convert_by_vocab(self.inv_vocab, ids) |
| 132 | |
| 133 | |
| 134 | class BasicTokenizer(object): |
nothing calls this directly
no outgoing calls
no test coverage detected