↓ 3 callersFunction_flash_attn_backward(
do, q, k, v, o, lse, dq, dk, dv, bias=None, causal=False, softmax_scale=None
)
model/llava/model/language_model/mpt/flash_attn_triton.py:833
↓ 3 callersFunction_flash_attn_forward(q, k, v, bias=None, causal=False, softmax_scale=None)
model/llava/model/language_model/mpt/flash_attn_triton.py:751
↓ 2 callersMethod__init__(
self, normalized_shape, eps=1e-05, weight=True, dtype=None, device=None
)
model/llava/model/language_model/mpt/norm.py:62
↓ 2 callersFunction_bwd_kernel_one_col_block(
start_n,
Q,
K,
V,
Bias,
DO,
DQ,
DK,
DV,
LSE,
D,
softmax_scal
model/llava/model/language_model/mpt/flash_attn_triton.py:350
↓ 2 callersFunction_bwd_store_dk_dv(
dk_ptrs,
dv_ptrs,
dk,
dv,
offs_n,
offs_d,
seqlen_k,
headdim,
EVEN_M: tl.
model/llava/model/language_model/mpt/flash_attn_triton.py:317
↓ 2 callersMethodprepare_inputs_labels_for_multimodal(
self, input_ids, attention_mask, past_key_values, labels, images
)
model/llava/model/llava_arch.py:98