↓ 21 callersFunctionload_pretrained_model(
model_path,
model_name,
model_base=None,
load_8bit=False,
load_4bit=False,
device_ma
llava/model/builder.py:29
↓ 9 callersMethod_load_video(video_path, num_video_frames, loader_fps, data_args, fps=None, frame_count=None)
llava/data/dataset.py:299
↓ 7 callersFunction_flash_attn_backward(do, q, k, v, o, lse, dq, dk, dv, bias=None, causal=False, softmax_scale=None)
llava/model/language_model/mpt/flash_attn_triton.py:729
↓ 7 callersFunction_flash_attn_forward(q, k, v, bias=None, causal=False, softmax_scale=None)
llava/model/language_model/mpt/flash_attn_triton.py:655
↓ 7 callersMethodprepare_inputs_labels_for_multimodal(
self, input_ids, position_ids, attention_mask, past_key_values, labels, images
)
llava/model/llava_arch.py:267
↓ 6 callersFunctionrepeat_kv This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
llava/model/language_model/modeling_mixtral_long_context.py:276
↓ 6 callersFunctionrepeat_kv This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
llava/train/transformers_replace/models/mixtral/modeling_mixtral.py:312
↓ 6 callersFunctionrepeat_kv This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
llava/train/transformers_replace/models/mistral/modeling_mistral.py:189