(self, context_length=77,
vocab_size=49408,
transformer_width=512,
transformer_heads=8,
transformer_layers=12,
embed_dim=1024,
out_dim=256,
pretrained=None, **kwargs)
| 366 | class CLIPTextEncoder(nn.Module): |
| 367 | |
| 368 | def __init__(self, context_length=77, |
| 369 | vocab_size=49408, |
| 370 | transformer_width=512, |
| 371 | transformer_heads=8, |
| 372 | transformer_layers=12, |
| 373 | embed_dim=1024, |
| 374 | out_dim=256, |
| 375 | pretrained=None, **kwargs): |
| 376 | super().__init__() |
| 377 | |
| 378 | self.pretrained = pretrained |
| 379 | |
| 380 | self.context_length = context_length |
| 381 | |
| 382 | self.transformer = Transformer( |
| 383 | width=transformer_width, |
| 384 | layers=transformer_layers, |
| 385 | heads=transformer_heads, |
| 386 | attn_mask=self.build_attention_mask() |
| 387 | ) |
| 388 | |
| 389 | self.vocab_size = vocab_size |
| 390 | self.token_embedding = nn.Embedding(vocab_size, transformer_width) |
| 391 | self.positional_embedding = nn.Parameter(torch.empty(self.context_length, transformer_width)) |
| 392 | self.ln_final = LayerNorm(transformer_width) |
| 393 | self.text_projection = nn.Parameter(torch.empty(transformer_width, embed_dim)) |
| 394 | |
| 395 | def init_weights(self, pretrained=None): |
| 396 | pretrained = pretrained or self.pretrained |
nothing calls this directly
no test coverage detected