| 23 | from loguru import logger |
| 24 | |
| 25 | def parse_args(): |
| 26 | parser = argparse.ArgumentParser(description="Finetune a transformers model on a causal language modeling task") |
| 27 | parser.add_argument( |
| 28 | "--dataset_name", |
| 29 | type=str, |
| 30 | default=None, |
| 31 | help="Path to dataset files", |
| 32 | ) |
| 33 | parser.add_argument( |
| 34 | "--dataset_config_name", |
| 35 | type=str, |
| 36 | default=None, |
| 37 | help="Path to dataset files", |
| 38 | ) |
| 39 | parser.add_argument( |
| 40 | "--tokenizer_path", |
| 41 | type=str, |
| 42 | default=None, |
| 43 | help="Path to the tokenizer.", |
| 44 | ) |
| 45 | parser.add_argument( |
| 46 | "--block_size", |
| 47 | type=int, |
| 48 | default=1024, |
| 49 | ) |
| 50 | parser.add_argument( |
| 51 | "--num_proc", |
| 52 | type=int, |
| 53 | default=32, |
| 54 | ) |
| 55 | parser.add_argument( |
| 56 | "--stride", |
| 57 | type=int, |
| 58 | default=512, |
| 59 | ) |
| 60 | parser.add_argument( |
| 61 | "--padding_index", |
| 62 | type=int, |
| 63 | default=-100, |
| 64 | ) |
| 65 | parser.add_argument( |
| 66 | "--output_dir", |
| 67 | type=str, |
| 68 | default=None, |
| 69 | ) |
| 70 | |
| 71 | args = parser.parse_args() |
| 72 | return args |
| 73 | |
| 74 | # Input should be a dataset dict object , with text column name being 'text' |
| 75 | def tokenize_and_group_text(raw_datasets, tokenizer, block_size, stride, padding_index, num_process): |