↓ 5 callersFunctionmodel_gen(model, text, images, need_bos=True, padding=False, beams=3, max_token=500)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2_4KHD.py:60
↓ 5 callersFunctionmodel_gen(model, text, images, need_bos=True, padding=False, beams=3, max_token=500)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2d5.py:62
↓ 4 callersMethodinfer(self, xs, buffer, buffer_index, buffer_out, pe_index)
vita/model/vita_tts/encoder/transformer.py:267
↓ 3 callersFunctionmcq_vanilla_eval(model, data, meta, nproc, result_file, dataset_name=None)
VLMEvalKit/vlmeval/dataset/utils/multiple_choice.py:337
↓ 2 callersFunction_get_rawvideo_dec(video_path, image_processor, max_frames=MAX_IMAGE_LENGTH, image_resolution=224, video_framerate=1, s=None, e=
videomme/yt_video_inference_qa.py:185
↓ 2 callersFunction_get_rawvideo_dec(
video_path,
image_processor,
max_frames=32,
min_frames=4,
image_resolution=384,
vide
vita/util/data_utils_video_audio_patch.py:579
↓ 2 callersFunction_get_rawvideo_dec(
video_path,
image_processor,
max_frames=32,
min_frames=4,
image_resolution=384,
vide
vita/util/data_utils_video_audio_neg_patch.py:721
↓ 2 callersFunction_get_rawvideo_dec(
video_path,
image_processor,
max_frames=32,
min_frames=4,
image_resolution=384,
vide
vita/util/data_utils_video_audio_neg_patch_fo.py:719
↓ 2 callersFunction_get_rawvideo_dec(
video_path,
image_processor,
max_frames=32,
min_frames=4,
image_resolution=384,
vide
vita/util/data_utils_video_patch_audio.py:587
↓ 2 callersFunction_get_rawvideo_dec(
video_path,
image_processor,
max_frames=32,
min_frames=4,
image_resolution=384,
vide
vita/util/data_utils_video_audio.py:265
↓ 2 callersFunction_get_rawvideo_dec(
video_path,
image_processor,
max_frames=32,
min_frames=4,
image_resolution=384,
vide
vita/util/data_utils_video_audio_patch_sf.py:579
↓ 2 callersMethodanswer(self, conv, model, img_list, do_sample=True, max_new_tokens=500, num_beams=1, min_length=1, top_p=0.9,
VLMEvalKit/vlmeval/vlm/video_llm/videochat2.py:269