tokenizer training function
(
dataset: tf.data.Dataset,
*,
vocab_path: str,
vocab_size: int,
max_corpus_chars: int,
data_keys: tuple[str] = ("text",),
)
| 121 | |
| 122 | |
| 123 | def train_tokenizer( |
| 124 | dataset: tf.data.Dataset, |
| 125 | *, |
| 126 | vocab_path: str, |
| 127 | vocab_size: int, |
| 128 | max_corpus_chars: int, |
| 129 | data_keys: tuple[str] = ("text",), |
| 130 | ): |
| 131 | """tokenizer training function""" |
| 132 | logging.info("SentencePiece vocab not found, building one from data.") |
| 133 | vocab_path = _train_sentencepiece( |
| 134 | dataset, |
| 135 | vocab_size=vocab_size, |
| 136 | maxchars=max_corpus_chars, |
| 137 | model_path=vocab_path, |
| 138 | data_keys=data_keys, |
| 139 | ) |
| 140 | logging.info("Model saved at %s", vocab_path) |
| 141 | |
| 142 | |
| 143 | def main(argv): |
no test coverage detected