MCPcopy Create free account
hub / github.com/Francis-Rings/FlashPortrait / __init__

Method __init__

wan/models/wan_image_encoder.py:332–406  ·  view source on GitHub ↗
(self,
                 embed_dim=1024,
                 image_size=224,
                 patch_size=14,
                 vision_dim=1280,
                 vision_mlp_ratio=4,
                 vision_heads=16,
                 vision_layers=32,
                 vision_pool='token',
                 vision_pre_norm=True,
                 vision_post_norm=False,
                 activation='gelu',
                 vocab_size=250002,
                 max_text_len=514,
                 type_size=1,
                 pad_id=1,
                 text_dim=1024,
                 text_heads=16,
                 text_layers=24,
                 text_post_norm=True,
                 text_dropout=0.1,
                 attn_dropout=0.0,
                 proj_dropout=0.0,
                 embedding_dropout=0.0,
                 norm_eps=1e-5)

Source from the content-addressed store, hash-verified

330class XLMRobertaCLIP(nn.Module):
331
332 def __init__(self,
333 embed_dim=1024,
334 image_size=224,
335 patch_size=14,
336 vision_dim=1280,
337 vision_mlp_ratio=4,
338 vision_heads=16,
339 vision_layers=32,
340 vision_pool='token',
341 vision_pre_norm=True,
342 vision_post_norm=False,
343 activation='gelu',
344 vocab_size=250002,
345 max_text_len=514,
346 type_size=1,
347 pad_id=1,
348 text_dim=1024,
349 text_heads=16,
350 text_layers=24,
351 text_post_norm=True,
352 text_dropout=0.1,
353 attn_dropout=0.0,
354 proj_dropout=0.0,
355 embedding_dropout=0.0,
356 norm_eps=1e-5):
357 super().__init__()
358 self.embed_dim = embed_dim
359 self.image_size = image_size
360 self.patch_size = patch_size
361 self.vision_dim = vision_dim
362 self.vision_mlp_ratio = vision_mlp_ratio
363 self.vision_heads = vision_heads
364 self.vision_layers = vision_layers
365 self.vision_pre_norm = vision_pre_norm
366 self.vision_post_norm = vision_post_norm
367 self.activation = activation
368 self.vocab_size = vocab_size
369 self.max_text_len = max_text_len
370 self.type_size = type_size
371 self.pad_id = pad_id
372 self.text_dim = text_dim
373 self.text_heads = text_heads
374 self.text_layers = text_layers
375 self.text_post_norm = text_post_norm
376 self.norm_eps = norm_eps
377
378 # models
379 self.visual = VisionTransformer(
380 image_size=image_size,
381 patch_size=patch_size,
382 dim=vision_dim,
383 mlp_ratio=vision_mlp_ratio,
384 out_dim=embed_dim,
385 num_heads=vision_heads,
386 num_layers=vision_layers,
387 pool_type=vision_pool,
388 pre_norm=vision_pre_norm,
389 post_norm=vision_post_norm,

Callers

nothing calls this directly

Calls 3

VisionTransformerClass · 0.85
XLMRobertaWithHeadClass · 0.85
__init__Method · 0.45

Tested by

no test coverage detected