Method__init__(self, normalized_shape, init_method, dp=4, eps=1e-5, scale=1e-3)
models/pangualpha/testLayerNorm.py:4
Method__init__(self, optimizer, start_lr,
warmup_iter, total_iters,
decay_style, last_iter
models/pangualpha/megatron/learning_rates.py:26
Method__init__(self, input_in_fp16, upper_triang_mask,
mask_func, softmax_in_fp32, scale)
models/pangualpha/megatron/model/fused_softmax.py:58
Method__init__(self, mpu_vocab_size, hidden_size, init_method,
layernorm_epsilon, parallel_output)
models/pangualpha/megatron/model/bert_model.py:80
Method__init__(self, name, data_prefix, documents, indexed_dataset,
num_samples, seq_length, seed)
models/pangualpha/megatron/data/gpt2_dataset.py:90
Method__init__(self, name, block_dataset, title_dataset, data_prefix,
num_epochs, max_num_samples, max_seq_
models/pangualpha/megatron/data/ict_dataset.py:40
Method__init__(self, sampler, batch_size, drop_last, rank=-1,
world_size=2, wrap_last=False, interleave=Fal
models/pangualpha/megatron/data/samplers.py:95
Method__init__(self, name, indexed_dataset, data_prefix,
num_epochs, max_num_samples, masked_lm_prob,
models/pangualpha/megatron/data/bert_dataset.py:37
Method__init__(self, records, batch_size, max_seq_len, max_preds_per_seq,
train, num_workers=2, seed=1, thr
models/pangualpha/megatron/deprecated_data_utils/tf_dl.py:27
Method__init__(self, sampler, batch_size, drop_last, rank=-1, world_size=2, wrap_last=False)
models/pangualpha/megatron/deprecated_data_utils/samplers.py:85
Method__init__(self, tokenization, text=None, original_text=None,
command_tokens=None, asIds=True)
models/pangualpha/megatron/deprecated_data_utils/tokenization.py:61
Method__init__(self, model_type='bpe', vocab_size=None, corpus=None,
model_path=None, character_coverage=1.
models/pangualpha/megatron/deprecated_data_utils/tokenization.py:602