↓ 8 callersFunctiondynamic_preprocess(
image, min_num=1, max_num=6, image_size=448, use_thumbnail=False, img_mean=0
)
vita/util/data_utils_video_audio_neg_frameCat.py:1236
↓ 7 callersMethodprepare_inputs_labels_for_multimodal(
self, input_ids, position_ids, attention_mask, past_key_values, labels, images, audios, sf_masks, sh
vita/model/vita_arch.py:308
↓ 6 callersFunctionmodel_gen(model, text, images, need_bos=True, padding=False, beams=3, max_token=500)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2.py:34