MCPcopy Create free account
hub / github.com/MeiGen-AI/MultiTalk / __init__

Method __init__

wan/modules/clip.py:330–404  ·  view source on GitHub ↗
(self,
                 embed_dim=1024,
                 image_size=224,
                 patch_size=14,
                 vision_dim=1280,
                 vision_mlp_ratio=4,
                 vision_heads=16,
                 vision_layers=32,
                 vision_pool='token',
                 vision_pre_norm=True,
                 vision_post_norm=False,
                 activation='gelu',
                 vocab_size=250002,
                 max_text_len=514,
                 type_size=1,
                 pad_id=1,
                 text_dim=1024,
                 text_heads=16,
                 text_layers=24,
                 text_post_norm=True,
                 text_dropout=0.1,
                 attn_dropout=0.0,
                 proj_dropout=0.0,
                 embedding_dropout=0.0,
                 norm_eps=1e-5)

Source from the content-addressed store, hash-verified

328class XLMRobertaCLIP(nn.Module):
329
330 def __init__(self,
331 embed_dim=1024,
332 image_size=224,
333 patch_size=14,
334 vision_dim=1280,
335 vision_mlp_ratio=4,
336 vision_heads=16,
337 vision_layers=32,
338 vision_pool='token',
339 vision_pre_norm=True,
340 vision_post_norm=False,
341 activation='gelu',
342 vocab_size=250002,
343 max_text_len=514,
344 type_size=1,
345 pad_id=1,
346 text_dim=1024,
347 text_heads=16,
348 text_layers=24,
349 text_post_norm=True,
350 text_dropout=0.1,
351 attn_dropout=0.0,
352 proj_dropout=0.0,
353 embedding_dropout=0.0,
354 norm_eps=1e-5):
355 super().__init__()
356 self.embed_dim = embed_dim
357 self.image_size = image_size
358 self.patch_size = patch_size
359 self.vision_dim = vision_dim
360 self.vision_mlp_ratio = vision_mlp_ratio
361 self.vision_heads = vision_heads
362 self.vision_layers = vision_layers
363 self.vision_pre_norm = vision_pre_norm
364 self.vision_post_norm = vision_post_norm
365 self.activation = activation
366 self.vocab_size = vocab_size
367 self.max_text_len = max_text_len
368 self.type_size = type_size
369 self.pad_id = pad_id
370 self.text_dim = text_dim
371 self.text_heads = text_heads
372 self.text_layers = text_layers
373 self.text_post_norm = text_post_norm
374 self.norm_eps = norm_eps
375
376 # models
377 self.visual = VisionTransformer(
378 image_size=image_size,
379 patch_size=patch_size,
380 dim=vision_dim,
381 mlp_ratio=vision_mlp_ratio,
382 out_dim=embed_dim,
383 num_heads=vision_heads,
384 num_layers=vision_layers,
385 pool_type=vision_pool,
386 pre_norm=vision_pre_norm,
387 post_norm=vision_post_norm,

Callers

nothing calls this directly

Calls 3

VisionTransformerClass · 0.85
XLMRobertaWithHeadClass · 0.85
__init__Method · 0.45

Tested by

no test coverage detected