Method__init__(self, input_size, kernel_size=1, padding_l=None, num_heads=1,
weight_dropout=0., weight_soft
fairseq/modules/dynamic_convolution.py:46
Method__init__(self, input_size, kernel_size=1, padding_l=None, num_heads=1,
weight_dropout=0., weight_soft
fairseq/modules/lightweight_convolution.py:105
Method__init__(self, vocab_size, input_dim, cutoff, dropout, factor=4., adaptive_inputs=None, tie_proj=False)
fairseq/modules/adaptive_softmax.py:57
Method__init__(
self, out_channels, embed_dim, head_dim, head_index, dropout=0.,
bias=True, project_input=Tr
fairseq/modules/downsampled_multihead_attention.py:19
Method__init__(
self, out_channels, embed_dim, num_heads, dropout=0., bias=True,
project_input=True, gated=F
fairseq/modules/downsampled_multihead_attention.py:154
Method__init__(self, embed_dim, num_heads, kdim=None, vdim=None, dropout=0., bias=True,
add_bias_kv=False,
fairseq/modules/multihead_attention.py:20
Method__init__(self, embed_dim, num_heads, kdim=None, vdim=None, dropout=0., bias=True,
add_bias_kv=False,
fairseq/modules/sparse_multihead_attention.py:22
Method__init__(self, params,
lr=1e-3, bias_correction = True,
betas=(0.9, 0.999), eps=1e-8
fairseq/optim/adam.py:198
Method__init__(
self, init_scale=2.**15, scale_factor=2., scale_window=2000,
tolerance=0.05, threshold=None,
fairseq/optim/fp16_optimizer.py:15