↓ 4 callersMethodset_signal(self, pp_rank, buffer_id, value, stream=None, num_barriers=1)
python/triton_dist/layers/nvidia/p2p.py:137
↓ 4 callersFunctiontile_kernel_topk_reduce_token_intra_node(
pid,
num_pid,
num_input_tokens_per_rank, # [world_size]
scatter_send_buf, #[max_tokens, to
python/triton_dist/kernels/nvidia/ep_all2all_fused.py:485
↓ 3 callersFunction_kernel_inner_tile_copy(
src_base_ptr,
dst_base_ptr,
seq,
tile_id_seq,
stride_src_seq,
stride_src_hd,
str
python/triton_dist/kernels/nvidia/ulysses_sp_dispatch.py:280
↓ 3 callersFunction_multimem_st_v4_impl(ptr, val0, val1, val2, val3, suffix: core.constexpr, _semantic=None)
python/triton_dist/language/extra/cuda/language_extra.py:320