(self, load_config)
| 5 | class MyModelWorker(BaseWorker): |
| 6 | |
| 7 | def load_model_and_tokenizer(self, load_config): |
| 8 | # TODO: load your model here |
| 9 | hf_model_config = {"pretrained_model_name_or_path": load_config['config_dir'],'trust_remote_code': True, 'low_cpu_mem_usage': True} |
| 10 | hf_tokenizer_config = {"pretrained_model_name_or_path": load_config['config_dir'], 'padding_side': 'left', 'trust_remote_code': True} |
| 11 | precision = load_config.get('precision', 'fp16') |
| 12 | device = load_config.get('device', 'cuda') |
| 13 | assert device == "cuda", 'only supports CUDA inference' |
| 14 | |
| 15 | if precision == 'fp16': |
| 16 | hf_model_config.update({"torch_dtype": torch.float16}) |
| 17 | |
| 18 | model = AutoModelForCausalLM.from_pretrained(**hf_model_config) |
| 19 | tokenizer = AutoTokenizer.from_pretrained(**hf_tokenizer_config) |
| 20 | |
| 21 | model.eval() |
| 22 | return model, tokenizer |
| 23 | |
| 24 | @property |
| 25 | def system_prompt(self): |
nothing calls this directly
no outgoing calls
no test coverage detected