(max_sample, tokenizer)
| 125 | |
| 126 | |
| 127 | def get_alpaca_dataset(max_sample, tokenizer): |
| 128 | alpaca_dataset = load_dataset("yahma/alpaca-cleaned", split='train') |
| 129 | # alpaca_dataset = load_dataset("/root/model/datasets/alpaca-clean", split='train') |
| 130 | |
| 131 | prompt_input, prompt_no_input = ALPACA_PROMPT_DICT["prompt_input"], ALPACA_PROMPT_DICT["prompt_no_input"] |
| 132 | |
| 133 | sources = [ |
| 134 | prompt_input.format_map(example) if example.get("input", "") != "" else prompt_no_input.format_map(example) |
| 135 | for example in alpaca_dataset |
| 136 | ] |
| 137 | targets = [f"{example['output']}{tokenizer.eos_token}" for example in alpaca_dataset] |
| 138 | |
| 139 | return extract_random_dataset(sources, targets, max_sample) |
| 140 | |
| 141 | def get_alpaca_solar_dataset(max_sample, tokenizer): |
| 142 | alpaca_dataset = load_dataset("yahma/alpaca-cleaned", split='train') |
no test coverage detected