| 12 | import re |
| 13 | |
| 14 | class Tokenizer: |
| 15 | def __init__(self, tokenizer): |
| 16 | self.tokenizer = tokenizer |
| 17 | self.bos_id: int = self.tokenizer.bos_token_id |
| 18 | self.eos_id: int = self.tokenizer.eos_token_id |
| 19 | |
| 20 | |
| 21 | def encode(self, s: str, bos: bool, eos: bool) -> List[int]: |
| 22 | assert type(s) is str |
| 23 | t = self.tokenizer.encode(s) |
| 24 | while t[0] == self.bos_id: |
| 25 | t = t[1:] |
| 26 | while t[-1] == self.eos_id: |
| 27 | t = t[:-1] |
| 28 | |
| 29 | if bos and self.bos_id is not None: |
| 30 | t = [self.bos_id] + t |
| 31 | if eos and self.eos_id is not None: |
| 32 | t = t + [self.eos_id] |
| 33 | return t |
| 34 | |
| 35 | def decode(self, t: List[int]) -> str: |
| 36 | return self.tokenizer.decode(t) |
| 37 | |
| 38 | class SidSFTDataset(Dataset): |
| 39 | def __init__(self, train_file, tokenizer, max_len=2048, sample=-1, test=False, seed=0, category="", K=4, dedup=False): |