↓ 1 callersMethod_load_pretrained_model(
cls,
model,
state_dict,
loaded_keys,
resolved_archive_file,
llava/train/transformers_replace/modeling_utils.py:3798
↓ 1 callersMethod_upad_input(self, query_layer, key_layer, value_layer, attention_mask, query_length)
llava/model/language_model/modeling_mixtral_long_context.py:690
↓ 1 callersMethod_upad_input(self, query_layer, key_layer, value_layer, attention_mask, query_length, seqlens_in_batch)
llava/train/transformers_replace/models/mixtral/modeling_mixtral.py:711
↓ 1 callersMethod_upad_input(self, query_layer, key_layer, value_layer, attention_mask, query_length, seqlens_in_batch)
llava/train/transformers_replace/models/mistral/modeling_mistral.py:586
↓ 1 callersMethod_upad_input(self, query_layer, key_layer, value_layer, attention_mask, query_length, seqlens_in_batch)
llava/train/transformers_replace/models/gemma/modeling_gemma.py:462
↓ 1 callersFunctionall_to_all_5D all-to-all for QKV forward (bs, seqlen/N, 3, hc, hs) -> (bs, seqlen, 3, hc/N, hs) Args: input (torch.tensor): a tensor sharded a
llava/train/sequence_parallel/all_to_all.py:168
↓ 1 callersFunctionattn_bias_shape(attn_impl, n_heads, seq_len, alibi, prefix_lm, causal, use_sequence_id)
llava/model/language_model/mpt/attention.py:429
↓ 1 callersFunctionbuild_alibi_bias(n_heads, seq_len, full=False, alibi_bias_max=8, device=None, dtype=None)
llava/model/language_model/mpt/attention.py:470
↓ 1 callersFunctionbuild_attn_bias(attn_impl, attn_bias, n_heads, seq_len, causal=False, alibi=False, alibi_bias_max=8)
llava/model/language_model/mpt/attention.py:444