↓ 2 callersFunction_attn_bwd_dkdv(dk, dv, #
Q, k, v, sm_scale, #
DO, #
M, D, #
triton_fused_attention.py:211
↓ 2 callersFunction_attn_bwd_dq(dq, q, K, V, #
do, m, D,
# shared by Q/K/V/DO.
stride_tok
triton_fused_attention.py:264
↓ 2 callersFunction_attn_fwd_inner(acc, l_i, m_i, q, #
K_block_ptr, V_block_ptr, #
start_m, qk_scale,
triton_fused_attention.py:28
Function_attn_bwd(Q, K, V, sm_scale, #
DO, #
DQ, DK, DV, #
M, D,
# s
triton_fused_attention.py:311
Function_attn_bwd_preprocess(O, DO, #
Delta, #
Z, H, N_CTX, #
triton_fused_attention.py:193
Function_attn_fwd(Q, K, V, sm_scale, M, Out, #
stride_qz, stride_qh, stride_qm, stride_qk, #
stri
triton_fused_attention.py:102
Methodforward(ctx, q, k, v, mask=None, causal=None, *args, **kwargs)
bench_with_triton_ck_BNHD_linux.py:108
Methodforward(ctx, q, k, v, mask=None, causal=None, *args, **kwargs)
precision_test_fp32ver.py:57
Methodforward(ctx, q, k, v, mask=None, causal=None, scale=None, BNHD_fmt=False, *args, **kwargs)
rocwmma_fattn/FlashAttn.py:49