↓ 2 callersFunction_train_moe(config, hidden_dim, num_chunks, num_steps, use_no_sync, ep_size=1, seed=42)
tests/unit/v1/zero/test_zero_coalesce_grad_reduction.py:276
↓ 2 callersFunction_triton_packed_flash(qkv, head_size, mask, sm_scale, causal=False, add_mask=True)
deepspeed/ops/transformer/inference/triton/attention.py:357
↓ 2 callersFunctionapply_folding_correction_to_grad_buffer(
folding_spec: ParallelFoldingSpec | None,
param,
grad,
*,
tp_group,
param_name: str
deepspeed/module_inject/auto_ep_folding.py:474