↓ 1 callersFunction_has_slice_intersection_for_diff_shape(start_indices1, data_sizes1, shape1, start_indices2, data_sizes2, shape2)
python/triton_dist/mega_triton_kernel/core/utils.py:37
↓ 1 callersFunction_qkv_pack_attn_fwd(
tile_id,
qkv_ptr,
out_ptr, #
N_CTX, #
H_Q: tl.constexpr,
H_KV: tl.constexpr,
S
python/triton_dist/mega_triton_kernel/kernels/flash_attn.py:91
↓ 1 callersFunction_split_tiles_for_each_segment(
expert_id,
rank,
tp_size,
block_size_m,
token_cnts: List[int],
)
python/triton_dist/kernels/nvidia/threadblock_swizzle_ag_moe.py:55
↓ 1 callersFunction_torch_impl(input, weight, seq_lens_cpu, input_scale, weight_scale, bias)
python/triton_dist/test/nvidia/test_llm_ulysess_gemm_all2all_intra_node.py:256