MCPcopy Create free account
hub / github.com/zai-org/CodeGeeX / build_tokenizer

Function build_tokenizer

codegeex/megatron/tokenizer/tokenizer.py:71–95  ·  view source on GitHub ↗

Initialize tokenizer.

(args)

Source from the content-addressed store, hash-verified

69
70
71def build_tokenizer(args):
72 """Initialize tokenizer."""
73 if "tokenizer_path" in args and args.tokenizer_path is not None:
74 # build huggingface tokenizer
75 tokenizer = build_hgf_tokenizer(args)
76 args.padded_vocab_size = _vocab_size_with_padding(tokenizer.vocab_size, args)
77 return tokenizer
78
79 if args.rank == 0:
80 print("> building {} tokenizer ...".format(args.tokenizer_type), flush=True)
81
82 # Select and instantiate the tokenizer.
83 assert args.vocab_file is not None
84 if args.tokenizer_type == "GPT2BPETokenizer":
85 assert args.merge_file is not None
86 tokenizer = _GPT2BPETokenizer(args.vocab_file, args.merge_file)
87 else:
88 raise NotImplementedError(
89 "{} tokenizer is not " "implemented.".format(args.tokenizer_type)
90 )
91
92 # Add vocab size.
93 args.padded_vocab_size = _vocab_size_with_padding(tokenizer.vocab_size, args)
94
95 return tokenizer
96
97
98def _vocab_size_with_padding(orig_vocab_size, args):

Callers 1

_build_tokenizerFunction · 0.90

Calls 3

build_hgf_tokenizerFunction · 0.85
_vocab_size_with_paddingFunction · 0.85
_GPT2BPETokenizerClass · 0.85

Tested by

no test coverage detected