(
self,
vocab_size=30522,
hidden_size=768,
num_hidden_layers=12,
num_attention_heads=12,
intermediate_size=3072,
hidden_act="gelu",
hidden_dropout_prob=0.1,
attention_probs_dropout_prob=0.1,
max_position_embeddings=512,
type_vocab_size=2,
initializer_range=0.02,
layer_norm_eps=1e-12,
pad_token_id=0,
gradient_checkpointing=False,
**kwargs
)
| 109 | model_type = "bert" |
| 110 | |
| 111 | def __init__( |
| 112 | self, |
| 113 | vocab_size=30522, |
| 114 | hidden_size=768, |
| 115 | num_hidden_layers=12, |
| 116 | num_attention_heads=12, |
| 117 | intermediate_size=3072, |
| 118 | hidden_act="gelu", |
| 119 | hidden_dropout_prob=0.1, |
| 120 | attention_probs_dropout_prob=0.1, |
| 121 | max_position_embeddings=512, |
| 122 | type_vocab_size=2, |
| 123 | initializer_range=0.02, |
| 124 | layer_norm_eps=1e-12, |
| 125 | pad_token_id=0, |
| 126 | gradient_checkpointing=False, |
| 127 | **kwargs |
| 128 | ): |
| 129 | super().__init__(pad_token_id=pad_token_id, **kwargs) |
| 130 | |
| 131 | self.vocab_size = vocab_size |
| 132 | self.hidden_size = hidden_size |
| 133 | self.num_hidden_layers = num_hidden_layers |
| 134 | self.num_attention_heads = num_attention_heads |
| 135 | self.hidden_act = hidden_act |
| 136 | self.intermediate_size = intermediate_size |
| 137 | self.hidden_dropout_prob = hidden_dropout_prob |
| 138 | self.attention_probs_dropout_prob = attention_probs_dropout_prob |
| 139 | self.max_position_embeddings = max_position_embeddings |
| 140 | self.type_vocab_size = type_vocab_size |
| 141 | self.initializer_range = initializer_range |
| 142 | self.layer_norm_eps = layer_norm_eps |
| 143 | self.gradient_checkpointing = gradient_checkpointing |
nothing calls this directly
no outgoing calls
no test coverage detected