MCPcopy Create free account
hub / github.com/LUMIA-Group/MemoryDecoder / parse_args

Function parse_args

utils/preprocess_dataset.py:25–72  ·  view source on GitHub ↗
()

Source from the content-addressed store, hash-verified

23from loguru import logger
24
25def parse_args():
26 parser = argparse.ArgumentParser(description="Finetune a transformers model on a causal language modeling task")
27 parser.add_argument(
28 "--dataset_name",
29 type=str,
30 default=None,
31 help="Path to dataset files",
32 )
33 parser.add_argument(
34 "--dataset_config_name",
35 type=str,
36 default=None,
37 help="Path to dataset files",
38 )
39 parser.add_argument(
40 "--tokenizer_path",
41 type=str,
42 default=None,
43 help="Path to the tokenizer.",
44 )
45 parser.add_argument(
46 "--block_size",
47 type=int,
48 default=1024,
49 )
50 parser.add_argument(
51 "--num_proc",
52 type=int,
53 default=32,
54 )
55 parser.add_argument(
56 "--stride",
57 type=int,
58 default=512,
59 )
60 parser.add_argument(
61 "--padding_index",
62 type=int,
63 default=-100,
64 )
65 parser.add_argument(
66 "--output_dir",
67 type=str,
68 default=None,
69 )
70
71 args = parser.parse_args()
72 return args
73
74# Input should be a dataset dict object , with text column name being 'text'
75def tokenize_and_group_text(raw_datasets, tokenizer, block_size, stride, padding_index, num_process):

Callers 1

mainFunction · 0.70

Calls

no outgoing calls

Tested by

no test coverage detected