↓ 2 callersFunction_attn_fwd_inner(acc, l_i, m_i, q, #
desc_k, desc_v, #
dtype: tl.constexpr, start_m,
python/triton_dist/mega_triton_kernel/test/triton_impl_utils.py:32
↓ 2 callersFunction_attn_fwd_with_qkv_desc(
desc_q,
desc_k,
desc_v,
start_m,
offset_o,
out_ptr,
sm_scale, #
Z,
H_Q,
python/triton_dist/mega_triton_kernel/test/triton_impl_utils.py:82
↓ 2 callersFunction_flash_attn_forward_inner(
acc,
l_i,
m_i,
q,
global_offset_q, #
K_block_ptr,
V_block_ptr, #
start_m,
python/triton_dist/kernels/nvidia/sp_ag_attention_intra_node.py:188
↓ 2 callersFunction_flash_attn_forward_inner(
acc,
l_i,
m_i,
q,
global_offset_q, #
K_block_ptr,
V_block_ptr, #
start_m,
python/triton_dist/kernels/nvidia/sp_ag_attention_inter_node.py:260
↓ 2 callersFunction_store_v4_impl(ptr, val0, val1, val2, val3, suffix: core.constexpr, scope="gpu", semantic="relaxed",
_sem
python/triton_dist/language/extra/cuda/language_extra.py:201
↓ 2 callersFunctionallgather_strided_chunked_pull_kernel(
pid,
npid,
symm_ptr, # (M, N), M = M_per_rank * num_ranks
M_per_rank,
N,
stride_m,
python/triton_dist/kernels/amd/allgather.py:185