(self,
embed_dim=1024,
image_size=224,
patch_size=14,
vision_dim=1280,
vision_mlp_ratio=4,
vision_heads=16,
vision_layers=32,
vision_pool='token',
vision_pre_norm=True,
vision_post_norm=False,
activation='gelu',
vocab_size=250002,
max_text_len=514,
type_size=1,
pad_id=1,
text_dim=1024,
text_heads=16,
text_layers=24,
text_post_norm=True,
text_dropout=0.1,
attn_dropout=0.0,
proj_dropout=0.0,
embedding_dropout=0.0,
norm_eps=1e-5)
| 328 | class XLMRobertaCLIP(nn.Module): |
| 329 | |
| 330 | def __init__(self, |
| 331 | embed_dim=1024, |
| 332 | image_size=224, |
| 333 | patch_size=14, |
| 334 | vision_dim=1280, |
| 335 | vision_mlp_ratio=4, |
| 336 | vision_heads=16, |
| 337 | vision_layers=32, |
| 338 | vision_pool='token', |
| 339 | vision_pre_norm=True, |
| 340 | vision_post_norm=False, |
| 341 | activation='gelu', |
| 342 | vocab_size=250002, |
| 343 | max_text_len=514, |
| 344 | type_size=1, |
| 345 | pad_id=1, |
| 346 | text_dim=1024, |
| 347 | text_heads=16, |
| 348 | text_layers=24, |
| 349 | text_post_norm=True, |
| 350 | text_dropout=0.1, |
| 351 | attn_dropout=0.0, |
| 352 | proj_dropout=0.0, |
| 353 | embedding_dropout=0.0, |
| 354 | norm_eps=1e-5): |
| 355 | super().__init__() |
| 356 | self.embed_dim = embed_dim |
| 357 | self.image_size = image_size |
| 358 | self.patch_size = patch_size |
| 359 | self.vision_dim = vision_dim |
| 360 | self.vision_mlp_ratio = vision_mlp_ratio |
| 361 | self.vision_heads = vision_heads |
| 362 | self.vision_layers = vision_layers |
| 363 | self.vision_pre_norm = vision_pre_norm |
| 364 | self.vision_post_norm = vision_post_norm |
| 365 | self.activation = activation |
| 366 | self.vocab_size = vocab_size |
| 367 | self.max_text_len = max_text_len |
| 368 | self.type_size = type_size |
| 369 | self.pad_id = pad_id |
| 370 | self.text_dim = text_dim |
| 371 | self.text_heads = text_heads |
| 372 | self.text_layers = text_layers |
| 373 | self.text_post_norm = text_post_norm |
| 374 | self.norm_eps = norm_eps |
| 375 | |
| 376 | # models |
| 377 | self.visual = VisionTransformer( |
| 378 | image_size=image_size, |
| 379 | patch_size=patch_size, |
| 380 | dim=vision_dim, |
| 381 | mlp_ratio=vision_mlp_ratio, |
| 382 | out_dim=embed_dim, |
| 383 | num_heads=vision_heads, |
| 384 | num_layers=vision_layers, |
| 385 | pool_type=vision_pool, |
| 386 | pre_norm=vision_pre_norm, |
| 387 | post_norm=vision_post_norm, |
nothing calls this directly
no test coverage detected