(datasets="pileval", tokenizer=None, n_samples=128, block_size=1024)
| 8 | import os |
| 9 | import torch.nn as nn |
| 10 | def get_calib_dataset(datasets="pileval", tokenizer=None, n_samples=128, block_size=1024): |
| 11 | if datasets == "pile": |
| 12 | return get_pile_dataset(tokenizer=tokenizer, n_samples=n_samples, block_size=block_size) |
| 13 | elif datasets == "gsm8k": |
| 14 | return get_calib_dataset_gsm8k(tokenizer=tokenizer, n_samples=n_samples, block_size=block_size) |
| 15 | elif datasets == "code": |
| 16 | return get_calib_dataset_code(tokenizer=tokenizer, n_samples=n_samples, block_size=block_size) |
| 17 | |
| 18 | def get_pile_dataset(tokenizer=None, n_samples=512, block_size=512): |
| 19 | # dataset = load_dataset("json", data_files="/root/model/llm-awq/val.jsonl.zst", split="train") |
no test coverage detected