(
self,
hidden_size,
num_attention_heads,
layer_number,
layernorm_epsilon=1e-5,
)
| 483 | """ |
| 484 | |
| 485 | def __init__( |
| 486 | self, |
| 487 | hidden_size, |
| 488 | num_attention_heads, |
| 489 | layer_number, |
| 490 | layernorm_epsilon=1e-5, |
| 491 | ): |
| 492 | super(TopQueryLayer, self).__init__() |
| 493 | self.hidden_size = hidden_size |
| 494 | self.num_attention_heads = num_attention_heads |
| 495 | self.layernorm_epsilon = layernorm_epsilon |
| 496 | self.layer_number = layer_number |
| 497 | |
| 498 | # Use FP32 for Layernorm |
| 499 | self.input_layernorm = paddle.nn.LayerNorm(self.hidden_size, |
| 500 | epsilon=self.layernorm_epsilon) |
| 501 | |
| 502 | # Self attention. |
| 503 | self.attention = TopQuerySelfAttention(self.hidden_size, |
| 504 | self.num_attention_heads, |
| 505 | self.layer_number) |
| 506 | # Layernorm on the input data. |
| 507 | self.post_attention_layernorm = paddle.nn.LayerNorm(self.hidden_size, |
| 508 | epsilon=self.layernorm_epsilon) |
| 509 | |
| 510 | # MLP |
| 511 | self.mlp = MLP(self.hidden_size) |
| 512 | |
| 513 | def forward( |
| 514 | self, |
nothing calls this directly
no test coverage detected