MCPcopy Create free account
hub / github.com/THUDM/GLM / add_model_config_args

Function add_model_config_args

arguments.py:26–75  ·  view source on GitHub ↗

Model arguments

(parser)

Source from the content-addressed store, hash-verified

24
25
26def add_model_config_args(parser):
27 """Model arguments"""
28
29 group = parser.add_argument_group('model', 'model configuration')
30
31 group.add_argument('--transformer-xl', action='store_true', help='use transformer-xl for training')
32 group.add_argument('--pretrained-bert', action='store_true',
33 help='use a pretrained bert-large-uncased model instead'
34 'of initializing from scratch. See '
35 '--tokenizer-model-type to specify which pretrained '
36 'BERT model to use')
37 group.add_argument('--encoder-decoder', action='store_true',
38 help="use the encoder-decoder architecture for blocklm")
39 group.add_argument('--attention-dropout', type=float, default=0.1,
40 help='dropout probability for attention weights')
41 group.add_argument('--num-attention-heads', type=int, default=16,
42 help='num of transformer attention heads')
43 group.add_argument('--hidden-size', type=int, default=1024,
44 help='transformer hidden size')
45 group.add_argument('--intermediate-size', type=int, default=None,
46 help='transformer embedding dimension for FFN'
47 'set to 4*`--hidden-size` if it is None')
48 group.add_argument('--num-layers', type=int, default=24,
49 help='num decoder layers')
50 group.add_argument('--layernorm-epsilon', type=float, default=1e-5,
51 help='layer norm epsilon')
52 group.add_argument('--hidden-dropout', type=float, default=0.1,
53 help='dropout probability for hidden state transformer')
54 group.add_argument('--output-dropout', type=float, default=0.1,
55 help='dropout probability for pooled output')
56 group.add_argument('--max-position-embeddings', type=int, default=512,
57 help='maximum number of position embeddings to use')
58 group.add_argument('--vocab-size', type=int, default=30522,
59 help='vocab size to use for non-character-level '
60 'tokenization. This value will only be used when '
61 'creating a tokenizer')
62 group.add_argument('--deep-init', action='store_true',
63 help='initialize bert model similar to gpt2 model.'
64 'scales initialization of projection layers by a '
65 'factor of 1/sqrt(2N). Necessary to train bert '
66 'models larger than BERT-Large.')
67 group.add_argument('--make-vocab-size-divisible-by', type=int, default=128,
68 help='Pad the vocab size to be divisible by this value.'
69 'This is added for computational efficiency reasons.')
70 group.add_argument('--cpu-optimizer', action='store_true',
71 help='Run optimizer on CPU')
72 group.add_argument('--cpu_torch_adam', action='store_true',
73 help='Use Torch Adam as optimizer on CPU.')
74
75 return parser
76
77
78def add_fp16_config_args(parser):

Callers 1

get_argsFunction · 0.85

Calls

no outgoing calls

Tested by

no test coverage detected