(self, context_length=77,
vocab_size=49408,
# vocab_size=49408+1,
transformer_width=512,
transformer_heads=8,
transformer_layers=12,
embed_dim=512,
out_dim=256,
pretrained=None, **kwargs)
| 8 | |
| 9 | class CLIPTextEncoder(nn.Module): |
| 10 | def __init__(self, context_length=77, |
| 11 | vocab_size=49408, |
| 12 | # vocab_size=49408+1, |
| 13 | transformer_width=512, |
| 14 | transformer_heads=8, |
| 15 | transformer_layers=12, |
| 16 | embed_dim=512, |
| 17 | out_dim=256, |
| 18 | pretrained=None, **kwargs): |
| 19 | super().__init__() |
| 20 | |
| 21 | self.pretrained = pretrained |
| 22 | |
| 23 | self.context_length = context_length |
| 24 | |
| 25 | self.transformer = Transformer( |
| 26 | width=transformer_width, |
| 27 | layers=transformer_layers, |
| 28 | heads=transformer_heads, |
| 29 | attn_mask=self.build_attention_mask() |
| 30 | ) |
| 31 | |
| 32 | self.vocab_size = vocab_size |
| 33 | self.token_embedding = nn.Embedding(vocab_size, transformer_width) |
| 34 | self.positional_embedding = nn.Parameter(torch.empty(self.context_length, transformer_width)) |
| 35 | self.ln_final = LayerNorm(transformer_width) |
| 36 | self.text_projection = nn.Parameter(torch.empty(transformer_width, embed_dim)) |
| 37 | # self.text_projection = nn.Linear(transformer_width, embed_dim) |
| 38 | |
| 39 | def init_weights(self, pretrained=None): |
| 40 | pretrained = pretrained or self.pretrained |
nothing calls this directly
no test coverage detected