↓ 2 callersFunctionload_model(
model_path, device, num_gpus, max_gpu_memory=None, load_8bit=False, load_4bit=False, debug=False
)
llmzoo/deploy/webapp/inference.py:51
Functiongenerate_stream(model, tokenizer, params, device, context_len=2048, stream_interval=2)
llmzoo/deploy/webapp/inference.py:113