(self, image, audio)
| 253 | ) |
| 254 | |
| 255 | def forward(self, image, audio): |
| 256 | image_embedding = self.face_encoder(image) |
| 257 | audio_embedding = ( |
| 258 | self.audio_encoder(audio) |
| 259 | .unsqueeze(2) |
| 260 | .unsqueeze(3) |
| 261 | .repeat(1, 1, image_embedding.size(2), image_embedding.size(3)) |
| 262 | ) |
| 263 | concat_embedding = torch.cat([image_embedding, audio_embedding], 1) |
| 264 | out_score = self.merge_encoder(concat_embedding) |
| 265 | return out_score |
| 266 | |
| 267 | |
| 268 | class SyncNetPerception(nn.Module): |
nothing calls this directly
no outgoing calls
no test coverage detected