↓ 19 callersFunctionload_pretrained_model(
model_path,
model_base,
model_name,
model_type,
load_8bit=False,
load_4bit=False,
vispeak/model/builder.py:14
↓ 6 callersFunctionmodel_gen(model, text, images, need_bos=True, padding=False, beams=3, max_token=500)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2.py:34
↓ 6 callersMethodstreaming_generate(self,
user_input_ids,
start_inference_seg,
timestamps,
seg_token_id,
vispeak/model/language_model/vispeak_qwen2.py:474
↓ 5 callersFunction_get_rawvideo_dec(
video_path,
image_processor,
max_frames=32,
min_frames=4,
video_framerate=3,
audio_s
vispeak/util/data_utils.py:567
↓ 5 callersFunctionmodel_gen(model, text, images, need_bos=True, padding=False, beams=3, max_token=500)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2_4KHD.py:60
↓ 5 callersFunctionmodel_gen(model, text, images, need_bos=True, padding=False, beams=3, max_token=500)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2d5.py:62
↓ 4 callersMethodinfer(self, xs, buffer, buffer_index, buffer_out, pe_index)
vispeak/model/vita_tts/encoder/transformer.py:267