| 232 | """ |
| 233 | |
| 234 | def __init__( |
| 235 | self, |
| 236 | hidden_size, |
| 237 | num_attention_heads, |
| 238 | layer_number, |
| 239 | fp16=True, |
| 240 | attention_softmax_in_fp32=True, |
| 241 | ): |
| 242 | super(TopQuerySelfAttention, self).__init__() |
| 243 | self.hidden_size = hidden_size |
| 244 | self.num_attention_heads = num_attention_heads |
| 245 | self.fp16 = fp16 |
| 246 | self.attention_softmax_in_fp32 = attention_softmax_in_fp32 |
| 247 | self.layer_number = max(1, layer_number) |
| 248 | |
| 249 | assert self.hidden_size % self.num_attention_heads == 0 |
| 250 | self.hidden_size_per_attention_head = int(self.hidden_size // self.num_attention_heads) |
| 251 | |
| 252 | self.query = torch.nn.Linear(self.hidden_size, self.hidden_size) |
| 253 | self.key = torch.nn.Linear(self.hidden_size, self.hidden_size) |
| 254 | self.value = torch.nn.Linear(self.hidden_size, self.hidden_size) |
| 255 | |
| 256 | self.norm_factor = math.sqrt(self.hidden_size_per_attention_head) |
| 257 | self.softmax = torch.nn.Softmax(dim=-1) |
| 258 | |
| 259 | self.dense = torch.nn.Linear(self.hidden_size, self.hidden_size) |
| 260 | |
| 261 | def forward( |
| 262 | self, |