↓ 3 callersMethodcreate(profiler_buffer, group_id, num_groups=1, is_leader=True, num_blocks=None, ENABLE_PROFILING=True)
python/triton_dist/tools/profiler/language.py:52
↓ 3 callersFunctioncreate_gemm_rs_context(
max_M,
N,
rank,
world_size,
local_world_size,
output_dtype: torch.dtype,
rs_stre
python/triton_dist/kernels/nvidia/gemm_reduce_scatter.py:78
↓ 3 callersFunctiongenerate_ntokens_per_rank_per_expert_uniform [ [ntokens(r0, e0), ntokens(r0, e1), ...], [ntokens(r1, e0), ntokens(r1, e1), ...], ... [ntokens(r7, e0), ntokens
python/triton_dist/kernels/nvidia/threadblock_swizzle_ag_moe_triton.py:314
↓ 3 callersFunctiongenerate_token_cnts_per_rank_per_expert_uniform [ [ntokens(r0, e0), ntokens(r0, e1), ...], [ntokens(r1, e0), ntokens(r1, e1), ...], ... [ntokens(r7, e0), ntokens
python/triton_dist/kernels/nvidia/threadblock_swizzle_ag_moe.py:176
↓ 3 callersFunctionmake_data(M, N, K, dtype: torch.dtype, trans_b, tp_group: torch.distributed.ProcessGroup)
python/triton_dist/test/nvidia/test_ag_gemm.py:76
↓ 3 callersMethodmake_flash_decode query: (batch, seq_len, num_q_heads, q_head_dim) key_cache: (MAX_NUM_KV_BLOCKS, PAGE_SIZE, num_kv_heads, q_head_dim)
python/triton_dist/mega_triton_kernel/models/model_builder.py:251
↓ 3 callersFunctionrun_p2p_single_test(M, K, dtype, RANK, WORLD_SIZE, TP_GROUP, args)
python/triton_dist/test/amd/test_mori_shmem_bw.py:283
↓ 3 callersFunctionsort_topk_ids_align_block_size(
topk_ids: torch.Tensor, # [ntokens, topk]
num_experts: int,
rank: int,
num_ranks: int,
python/triton_dist/kernels/nvidia/allgather_group_gemm.py:201
↓ 3 callersFunctionthreadblock_swizzle_gemm_reduce_scatter_kernel(
tiled_m,
M,
rank,
WORLD_SIZE: tl.constexpr,
NNODES: tl.constexpr,
BLOCK_SIZE_M: tl.c
python/triton_dist/kernels/nvidia/gemm_rs_threadblock_swizzle.py:69
↓ 3 callersFunctiontile_wise_matmul_compute(tile_id, a_ptr, b_ptr, c_ptr, M, N, K, BLOCK_SIZE_M, BLOCK_SIZE_N, BLOCK_SIZE_K,
python/triton_dist/mega_triton_kernel/kernels/linear.py:32
↓ 3 callersFunctiontransposed_dot(
a_ptrs,
b_ptrs,
c_ptrs,
split_size,
N,
K,
stride_am: tl.constexpr,
stride_bm
python/triton_dist/kernels/nvidia/group_gemm.py:475