MCPcopy Create free account
hub / github.com/OpenImagingLab/FlashVSR / __init__

Method __init__

diffsynth/models/wan_video_image_encoder.py:483–569  ·  view source on GitHub ↗
(self,
                 embed_dim=512,
                 image_size=224,
                 patch_size=16,
                 vision_dim=768,
                 vision_mlp_ratio=4,
                 vision_heads=12,
                 vision_layers=12,
                 vision_pool='token',
                 vision_pre_norm=True,
                 vision_post_norm=False,
                 vocab_size=49408,
                 text_len=77,
                 text_dim=512,
                 text_mlp_ratio=4,
                 text_heads=8,
                 text_layers=12,
                 text_causal=True,
                 text_pool='argmax',
                 text_head_bias=False,
                 logit_bias=None,
                 activation='quick_gelu',
                 attn_dropout=0.0,
                 proj_dropout=0.0,
                 embedding_dropout=0.0,
                 norm_eps=1e-5)

Source from the content-addressed store, hash-verified

481class CLIP(nn.Module):
482
483 def __init__(self,
484 embed_dim=512,
485 image_size=224,
486 patch_size=16,
487 vision_dim=768,
488 vision_mlp_ratio=4,
489 vision_heads=12,
490 vision_layers=12,
491 vision_pool='token',
492 vision_pre_norm=True,
493 vision_post_norm=False,
494 vocab_size=49408,
495 text_len=77,
496 text_dim=512,
497 text_mlp_ratio=4,
498 text_heads=8,
499 text_layers=12,
500 text_causal=True,
501 text_pool='argmax',
502 text_head_bias=False,
503 logit_bias=None,
504 activation='quick_gelu',
505 attn_dropout=0.0,
506 proj_dropout=0.0,
507 embedding_dropout=0.0,
508 norm_eps=1e-5):
509 super().__init__()
510 self.embed_dim = embed_dim
511 self.image_size = image_size
512 self.patch_size = patch_size
513 self.vision_dim = vision_dim
514 self.vision_mlp_ratio = vision_mlp_ratio
515 self.vision_heads = vision_heads
516 self.vision_layers = vision_layers
517 self.vision_pool = vision_pool
518 self.vision_pre_norm = vision_pre_norm
519 self.vision_post_norm = vision_post_norm
520 self.vocab_size = vocab_size
521 self.text_len = text_len
522 self.text_dim = text_dim
523 self.text_mlp_ratio = text_mlp_ratio
524 self.text_heads = text_heads
525 self.text_layers = text_layers
526 self.text_causal = text_causal
527 self.text_pool = text_pool
528 self.text_head_bias = text_head_bias
529 self.norm_eps = norm_eps
530
531 # models
532 self.visual = VisionTransformer(
533 image_size=image_size,
534 patch_size=patch_size,
535 dim=vision_dim,
536 mlp_ratio=vision_mlp_ratio,
537 out_dim=embed_dim,
538 num_heads=vision_heads,
539 num_layers=vision_layers,
540 pool_type=vision_pool,

Callers 9

__init__Method · 0.45
__init__Method · 0.45
__init__Method · 0.45
__init__Method · 0.45
__init__Method · 0.45
__init__Method · 0.45
__init__Method · 0.45
__init__Method · 0.45
__init__Method · 0.45

Calls 3

init_weightsMethod · 0.95
TextTransformerClass · 0.85
VisionTransformerClass · 0.70

Tested by

no test coverage detected