MCPcopy Create free account
hub / github.com/OpenBitSys/BitDistiller / get_alpaca_dataset

Function get_alpaca_dataset

data/generation/data_utils.py:127–139  ·  view source on GitHub ↗
(max_sample, tokenizer)

Source from the content-addressed store, hash-verified

125
126
127def get_alpaca_dataset(max_sample, tokenizer):
128 alpaca_dataset = load_dataset("yahma/alpaca-cleaned", split='train')
129 # alpaca_dataset = load_dataset("/root/model/datasets/alpaca-clean", split='train')
130
131 prompt_input, prompt_no_input = ALPACA_PROMPT_DICT["prompt_input"], ALPACA_PROMPT_DICT["prompt_no_input"]
132
133 sources = [
134 prompt_input.format_map(example) if example.get("input", "") != "" else prompt_no_input.format_map(example)
135 for example in alpaca_dataset
136 ]
137 targets = [f"{example['output']}{tokenizer.eos_token}" for example in alpaca_dataset]
138
139 return extract_random_dataset(sources, targets, max_sample)
140
141def get_alpaca_solar_dataset(max_sample, tokenizer):
142 alpaca_dataset = load_dataset("yahma/alpaca-cleaned", split='train')

Callers 1

get_gen_datasetFunction · 0.85

Calls 1

extract_random_datasetFunction · 0.85

Tested by

no test coverage detected