(path)
| 143 | |
| 144 | @staticmethod |
| 145 | def load(path): |
| 146 | path = get_data_path(path) |
| 147 | if environ.get('DATASET_SOURCE') == 'ModelScope': |
| 148 | from modelscope import MsDataset |
| 149 | dataset = DatasetDict() |
| 150 | for split in ['train', 'validation']: |
| 151 | ms_dataset = MsDataset.load(path, split=split) |
| 152 | dataset_list = [] |
| 153 | for item in ms_dataset: |
| 154 | label = item['label'] |
| 155 | goal = item['goal'][0].upper() + item['goal'][1:] |
| 156 | if goal.endswith('?') or goal.endswith('.'): |
| 157 | sol1 = item['sol1'][0].upper() + item['sol1'][1:] |
| 158 | sol2 = item['sol2'][0].upper() + item['sol2'][1:] |
| 159 | else: |
| 160 | sol1 = item['sol1'][0].lower() + item['sol1'][1:] |
| 161 | sol2 = item['sol2'][0].lower() + item['sol2'][1:] |
| 162 | dataset_list.append({ |
| 163 | 'goal': goal, |
| 164 | 'sol1': sol1, |
| 165 | 'sol2': sol2, |
| 166 | 'label': label |
| 167 | }) |
| 168 | dataset[split] = Dataset.from_list(dataset_list) |
| 169 | else: |
| 170 | train_dataset = PIQADatasetV3.load_single(path, 'train.jsonl', |
| 171 | 'train-labels.lst') |
| 172 | val_dataset = PIQADatasetV3.load_single(path, 'dev.jsonl', |
| 173 | 'dev-labels.lst') |
| 174 | dataset = DatasetDict({ |
| 175 | 'train': train_dataset, |
| 176 | 'validation': val_dataset |
| 177 | }) |
| 178 | return dataset |
nothing calls this directly
no test coverage detected