MCPcopy Create free account
hub / github.com/AI-Hypercomputer/maxtext / train_tokenizer

Function train_tokenizer

src/MaxText/train_tokenizer.py:123–140  ·  view source on GitHub ↗

tokenizer training function

(
    dataset: tf.data.Dataset,
    *,
    vocab_path: str,
    vocab_size: int,
    max_corpus_chars: int,
    data_keys: tuple[str] = ("text",),
)

Source from the content-addressed store, hash-verified

121
122
123def train_tokenizer(
124 dataset: tf.data.Dataset,
125 *,
126 vocab_path: str,
127 vocab_size: int,
128 max_corpus_chars: int,
129 data_keys: tuple[str] = ("text",),
130):
131 """tokenizer training function"""
132 logging.info("SentencePiece vocab not found, building one from data.")
133 vocab_path = _train_sentencepiece(
134 dataset,
135 vocab_size=vocab_size,
136 maxchars=max_corpus_chars,
137 model_path=vocab_path,
138 data_keys=data_keys,
139 )
140 logging.info("Model saved at %s", vocab_path)
141
142
143def main(argv):

Callers 1

mainFunction · 0.85

Calls 1

_train_sentencepieceFunction · 0.85

Tested by

no test coverage detected