MCPcopy Create free account
hub / github.com/THUDM/LongWriter / make_supervised_data_module

Function make_supervised_data_module

train/main.py:88–100  ·  view source on GitHub ↗
(data_args)

Source from the content-addressed store, hash-verified

86 )
87
88def make_supervised_data_module(data_args) -> Dict:
89 print("loading data...")
90 if data_args.batch_method == "naive":
91 train_dataset = LMDataset(data_args.train_file)
92 data_collator = DataCollatorForLMDataset()
93 elif data_args.batch_method == "pack":
94 train_dataset = LMPackDataset(data_args.train_file)
95 data_collator = DataCollatorForLMPackDataset()
96 elif data_args.batch_method == "sort":
97 train_dataset = LMSortDataset(data_args.train_file)
98 data_collator = DataCollatorForLMDataset()
99 print("finish loading data")
100 return dict(train_dataset=train_dataset, data_collator=data_collator)
101
102def train():
103 parser = transformers.HfArgumentParser((ModelArguments, DataArguments, TrainingArguments))

Callers 1

trainFunction · 0.85

Calls 5

LMDatasetClass · 0.90
LMPackDatasetClass · 0.90
LMSortDatasetClass · 0.90

Tested by

no test coverage detected