(self, data, tokenizer, tokenize)
| 369 | print_rank_0("Load language detection model") |
| 370 | |
| 371 | def process_line(self, data, tokenizer, tokenize): |
| 372 | text = data['text'] |
| 373 | if len(text) > 100: |
| 374 | lang = self.model.predict(text.replace('\n', ''))[0][0] |
| 375 | if lang == '__label__en': |
| 376 | prompt, text = self.process_sample("", tokenizer, tokenize), self.process_sample(text, tokenizer, |
| 377 | tokenize) |
| 378 | return [prompt], [text] |
| 379 | return [], [] |
| 380 | |
| 381 | |
| 382 | class CCNews(PromptReader): |
nothing calls this directly
no test coverage detected