↓ 2 callersMethod__init__(self, batch_size, hidden_size, intermediate_size, heads, attn_dropout_ratio, hidden_dropout_ratio,
deepspeed/ops/transformer/transformer.py:21
↓ 2 callersMethod__init__(self, config, q_scales=None, q_groups=1, merge_count=1, mlp_extra_grouping=False, mp_group=None)
deepspeed/ops/transformer/inference/moe_inference.py:133
↓ 2 callersMethod__init__(
self,
init_optimizer,
param_names,
timers,
optimizer_params,
deepspeed/runtime/zenflow/zenflow_stage_1_and_2.py:49
↓ 2 callersMethod__init__(self, vocab_size, hidden_size, num_layers, num_heads, max_seq_len, dropout=0.1)
examples/sdma_allgather/train_zero3.py:82