↓ 4 callersMethod_upad_input(self, query_layer, key_layer, value_layer, attention_mask, query_length, seqlens_in_batch)
llava/train/transformers_replace/models/llama/modeling_llama.py:570
↓ 4 callersFunctionrepeat_kv This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
llava/train/transformers_replace/models/gemma/modeling_gemma.py:179
↓ 3 callersFunctionbackward(dout, q, k, v, out, softmax_lse, causal)
llava/train/sequence_parallel/ring/zigzag_ring_flash_attn.py:130
↓ 3 callersFunctionbackward(dout, q, k, v, out, softmax_lse, causal)
llava/train/sequence_parallel/ring/zigzag_ring_flash_attn_varlen.py:203
↓ 3 callersFunctionextract_local_input_ids(input_ids, image_positions, sp_rank, sp_size, bos_token_id=1, image_token_len=3)
llava/train/sequence_parallel/input_utils.py:47