(model_name)
| 220 | |
| 221 | @lru_cache(maxsize=1) |
| 222 | def initialize_hf_model(model_name): |
| 223 | hf_tokenizer = AutoTokenizer.from_pretrained( |
| 224 | model_name, device_map="auto", trust_remote_code=True |
| 225 | ) |
| 226 | hf_model = AutoModelForCausalLM.from_pretrained( |
| 227 | model_name, device_map="auto", trust_remote_code=True |
| 228 | ) |
| 229 | if hf_tokenizer.pad_token is None: |
| 230 | hf_tokenizer.pad_token = hf_tokenizer.eos_token |
| 231 | |
| 232 | return hf_model, hf_tokenizer |
| 233 | |
| 234 | |
| 235 | async def hf_model_if_cache( |