MCPcopy Create free account
hub / github.com/deepspeedai/DeepSpeedExamples / add_model_config_args

Function add_model_config_args

Megatron-LM/arguments.py:24–64  ·  view source on GitHub ↗

Model arguments

(parser)

Source from the content-addressed store, hash-verified

22
23
24def add_model_config_args(parser):
25 """Model arguments"""
26
27 group = parser.add_argument_group('model', 'model configuration')
28
29 group.add_argument('--pretrained-bert', action='store_true',
30 help='use a pretrained bert-large-uncased model instead'
31 'of initializing from scratch. See '
32 '--tokenizer-model-type to specify which pretrained '
33 'BERT model to use')
34 group.add_argument('--attention-dropout', type=float, default=0.1,
35 help='dropout probability for attention weights')
36 group.add_argument('--num-attention-heads', type=int, default=16,
37 help='num of transformer attention heads')
38 group.add_argument('--hidden-size', type=int, default=1024,
39 help='tansformer hidden size')
40 group.add_argument('--intermediate-size', type=int, default=None,
41 help='transformer embedding dimension for FFN'
42 'set to 4*`--hidden-size` if it is None')
43 group.add_argument('--num-layers', type=int, default=24,
44 help='num decoder layers')
45 group.add_argument('--layernorm-epsilon', type=float, default=1e-5,
46 help='layer norm epsilon')
47 group.add_argument('--hidden-dropout', type=float, default=0.1,
48 help='dropout probability for hidden state transformer')
49 group.add_argument('--max-position-embeddings', type=int, default=512,
50 help='maximum number of position embeddings to use')
51 group.add_argument('--vocab-size', type=int, default=30522,
52 help='vocab size to use for non-character-level '
53 'tokenization. This value will only be used when '
54 'creating a tokenizer')
55 group.add_argument('--deep-init', action='store_true',
56 help='initialize bert model similar to gpt2 model.'
57 'scales initialization of projection layers by a '
58 'factor of 1/sqrt(2N). Necessary to train bert '
59 'models larger than BERT-Large.')
60 group.add_argument('--make-vocab-size-divisible-by', type=int, default=128,
61 help='Pad the vocab size to be divisible by this value.'
62 'This is added for computational efficieny reasons.')
63
64 return parser
65
66
67def add_fp16_config_args(parser):

Callers 1

get_argsFunction · 0.85

Calls

no outgoing calls

Tested by

no test coverage detected