↓ 3 callersFunctionlayer_norm_residual(a, input_bias, residual, weight, bias, eps)
deepspeed/ops/transformer/inference/triton/layer_norm.py:199
↓ 3 callersFunctionmaybe_copy_geglu(module, sd, weight_quantizer, mp_replace, dst_name, src_names)
deepspeed/module_inject/policy.py:189
↓ 3 callersFunctionprepare_tp_model(hidden_dim, nlayers, linear_indices, allreduce_indices, group, return_global_copy=False)
tests/unit/model_parallelism/test_autotp_training.py:656