↓ 2 callersFunctionget_loader(args, split='vcr_train', mode='train',
batch_size=32, workers=4, distributed=False, gpu=0,
image_video_text_understanding/VL-T5/src/pretrain_vcr_data.py:501
↓ 2 callersFunctionget_tuple(splits: str, bs: int, shuffle=False, drop_last=False, topk=-1, distributed = False, aspect_ratio_group_factor
image_video_text_understanding/CLIP-ViL/src/pretrain/lxmert_pretrain.py:41
↓ 2 callersMethodprepare_inputs_labels_for_multimodal(
self, input_ids, position_ids, attention_mask, past_key_values, labels, images
)
visual_instruction_tuning/llava/model/llava_arch.py:99
↓ 2 callersMethodupdate_layer_conv2d(self, adapter_name, r, lora_alpha, lora_dropout, init_lora_weights)
visual_instruction_tuning/peft/src/peft/tuners/lora.py:708
↓ 2 callersMethodupdate_layer_embedding(self, adapter_name, r, lora_alpha, lora_dropout, init_lora_weights)
visual_instruction_tuning/peft/src/peft/tuners/lora.py:733
↓ 1 callersMethod__init__(self, d_model: int, n_heads: int, attn_impl: str='triton', clip_qkv: Optional[float]=None, qk_ln: bool=False,
visual_instruction_tuning/llava/model/language_model/mpt/attention.py:158