(self, context_length=22,
vocab_size=49408,
transformer_width=512,
transformer_heads=8,
transformer_layers=12,
embed_dim=1024,
out_dim=256,
pretrained=None, **kwargs)
| 435 | @BACKBONES.register_module() |
| 436 | class CLIPTextContextEncoder(nn.Module): |
| 437 | def __init__(self, context_length=22, |
| 438 | vocab_size=49408, |
| 439 | transformer_width=512, |
| 440 | transformer_heads=8, |
| 441 | transformer_layers=12, |
| 442 | embed_dim=1024, |
| 443 | out_dim=256, |
| 444 | pretrained=None, **kwargs): |
| 445 | super().__init__() |
| 446 | |
| 447 | self.pretrained = pretrained |
| 448 | |
| 449 | self.context_length = context_length |
| 450 | |
| 451 | self.transformer = Transformer( |
| 452 | width=transformer_width, |
| 453 | layers=transformer_layers, |
| 454 | heads=transformer_heads, |
| 455 | attn_mask=self.build_attention_mask() |
| 456 | ) |
| 457 | |
| 458 | self.embed_dim = embed_dim |
| 459 | |
| 460 | self.vocab_size = vocab_size |
| 461 | self.token_embedding = nn.Embedding(vocab_size, transformer_width) |
| 462 | self.positional_embedding = nn.Parameter(torch.empty(self.context_length, transformer_width)) |
| 463 | self.ln_final = LayerNorm(transformer_width) |
| 464 | self.text_projection = nn.Parameter(torch.empty(transformer_width, embed_dim)) |
| 465 | |
| 466 | def init_weights(self, pretrained=None): |
| 467 | pretrained = pretrained or self.pretrained |
nothing calls this directly
no test coverage detected