Method__init__(self, causal=False, softmax_scale=None, attention_dropout=0.0,
device=None, dtype=None)
pretrain/megatron/legacy/model/transformer.py:444
Method__init__(self, dim, window_size, num_heads, qkv_bias=True, qk_scale=None, attn_drop=0., proj_drop=0.)
pretrain/megatron/legacy/model/vision/esvit_swin_backbone.py:88
Method__init__(self, dim, input_resolution, num_heads, window_size=7, shift_size=0,
mlp_ratio=4., qkv_bias=
pretrain/megatron/legacy/model/vision/esvit_swin_backbone.py:197
Method__init__(self, dim, input_resolution, depth, num_heads, window_size,
mlp_ratio=4., qkv_bias=True, qk_
pretrain/megatron/legacy/model/vision/esvit_swin_backbone.py:405
Method__init__(self, img_size=224, patch_size=16, in_chans=3, embed_dim=768, norm_layer=None)
pretrain/megatron/legacy/model/vision/esvit_swin_backbone.py:471
Method__init__(self, img_size=224, patch_size=4, in_chans=3, num_classes=1000,
embed_dim=96, depths=[2, 2,
pretrain/megatron/legacy/model/vision/esvit_swin_backbone.py:530
Method__init__(self, dim, num_heads, mlp_ratio=4., qkv_bias=False, qk_scale=None, drop=0., attn_drop=0.,
dr
pretrain/megatron/legacy/model/vision/mit_backbone.py:127
Method__init__(self, img_size=224, patch_size=7, stride=4, in_chans=3, embed_dim=768)
pretrain/megatron/legacy/model/vision/mit_backbone.py:169
Method__init__(self, img_size=224, patch_size=16, in_chans=3, num_classes=1000, embed_dims=[64, 128, 256, 512],
pretrain/megatron/legacy/model/vision/mit_backbone.py:205
Method__init__(self, dim, window_size, num_heads, qkv_bias=True, qk_scale=None, attn_drop=0., proj_drop=0.)
pretrain/megatron/legacy/model/vision/swin_backbone.py:85
Method__init__(self, dim, input_resolution, num_heads, window_size=7, shift_size=0,
mlp_ratio=4., qkv_bias=
pretrain/megatron/legacy/model/vision/swin_backbone.py:188