Method
__init__
(self,
embed_dim=512,
image_size=224,
patch_size=16,
vision_dim=768,
vision_mlp_ratio=4,
vision_heads=12,
vision_layers=12,
vision_pool='token',
vision_pre_norm=True,
vision_post_norm=False,
vocab_size=49408,
text_len=77,
text_dim=512,
text_mlp_ratio=4,
text_heads=8,
text_layers=12,
text_causal=True,
text_pool='argmax',
text_head_bias=False,
logit_bias=None,
activation='quick_gelu',
attn_dropout=0.0,
proj_dropout=0.0,
embedding_dropout=0.0,
norm_eps=1e-5)
Source from the content-addressed store, hash-verified
| 481 | class CLIP(nn.Module): |
| 482 | |
| 483 | def __init__(self, |
| 484 | embed_dim=512, |
| 485 | image_size=224, |
| 486 | patch_size=16, |
| 487 | vision_dim=768, |
| 488 | vision_mlp_ratio=4, |
| 489 | vision_heads=12, |
| 490 | vision_layers=12, |
| 491 | vision_pool='token', |
| 492 | vision_pre_norm=True, |
| 493 | vision_post_norm=False, |
| 494 | vocab_size=49408, |
| 495 | text_len=77, |
| 496 | text_dim=512, |
| 497 | text_mlp_ratio=4, |
| 498 | text_heads=8, |
| 499 | text_layers=12, |
| 500 | text_causal=True, |
| 501 | text_pool='argmax', |
| 502 | text_head_bias=False, |
| 503 | logit_bias=None, |
| 504 | activation='quick_gelu', |
| 505 | attn_dropout=0.0, |
| 506 | proj_dropout=0.0, |
| 507 | embedding_dropout=0.0, |
| 508 | norm_eps=1e-5): |
| 509 | super().__init__() |
| 510 | self.embed_dim = embed_dim |
| 511 | self.image_size = image_size |
| 512 | self.patch_size = patch_size |
| 513 | self.vision_dim = vision_dim |
| 514 | self.vision_mlp_ratio = vision_mlp_ratio |
| 515 | self.vision_heads = vision_heads |
| 516 | self.vision_layers = vision_layers |
| 517 | self.vision_pool = vision_pool |
| 518 | self.vision_pre_norm = vision_pre_norm |
| 519 | self.vision_post_norm = vision_post_norm |
| 520 | self.vocab_size = vocab_size |
| 521 | self.text_len = text_len |
| 522 | self.text_dim = text_dim |
| 523 | self.text_mlp_ratio = text_mlp_ratio |
| 524 | self.text_heads = text_heads |
| 525 | self.text_layers = text_layers |
| 526 | self.text_causal = text_causal |
| 527 | self.text_pool = text_pool |
| 528 | self.text_head_bias = text_head_bias |
| 529 | self.norm_eps = norm_eps |
| 530 | |
| 531 | # models |
| 532 | self.visual = VisionTransformer( |
| 533 | image_size=image_size, |
| 534 | patch_size=patch_size, |
| 535 | dim=vision_dim, |
| 536 | mlp_ratio=vision_mlp_ratio, |
| 537 | out_dim=embed_dim, |
| 538 | num_heads=vision_heads, |
| 539 | num_layers=vision_layers, |
| 540 | pool_type=vision_pool, |
Tested by
no test coverage detected