MCPcopy Create free account
hub / github.com/THUDM/GLM / __init__

Method __init__

data_utils/datasets.py:373–391  ·  view source on GitHub ↗
(self, path, tokenizer=None, preprocess_fn=None, binarize_sent=False,
                 text_key='sentence', label_key='label', loose_json=False, **kwargs)

Source from the content-addressed store, hash-verified

371 """
372
373 def __init__(self, path, tokenizer=None, preprocess_fn=None, binarize_sent=False,
374 text_key='sentence', label_key='label', loose_json=False, **kwargs):
375 self.is_lazy = False
376 self.preprocess_fn = preprocess_fn
377 self.path = path
378 self.SetTokenizer(tokenizer)
379 self.X = []
380 self.Y = []
381 self.text_key = text_key
382 self.label_key = label_key
383 self.loose_json = loose_json
384
385 for j in self.load_json_stream(self.path):
386 s = j[text_key]
387 self.X.append(s)
388 self.Y.append(j[label_key])
389
390 if binarize_sent:
391 self.Y = binarize_labels(self.Y, hard=binarize_sent)
392
393 def SetTokenizer(self, tokenizer):
394 if tokenizer is None:

Callers

nothing calls this directly

Calls 3

SetTokenizerMethod · 0.95
load_json_streamMethod · 0.95
appendMethod · 0.80

Tested by

no test coverage detected