MCPcopy Create free account

hub / github.com/AIGC-Audio/AudioGPT / types & classes

Types & classes604 in github.com/AIGC-Audio/AudioGPT

↓ 21 callersClassConvBlock
audio_detection/target_sound_detection/src/models.py:175
↓ 19 callersClassConv2d
Conv2d module with customized initialization.
NeuralSeq/modules/parallel_wavegan/layers/upsample.py:47
↓ 18 callersClassBlock2D
audio_detection/target_sound_detection/src/models.py:614
↓ 17 callersClassResnetBlock
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:82
↓ 16 callersClassConvBlockRes
sound_extraction/model/modules.py:381
↓ 16 callersClassResBlock
A residual block that can optionally change the number of channels. :param channels: the number of input channels. :param emb_channels: t
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/openaimodel.py:163
↓ 14 callersClassConvBlockResCond
sound_extraction/model/modules.py:326
↓ 14 callersClassTimestepEmbedSequential
A sequential module that passes timestep embeddings to the children that support it as an extra input.
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/openaimodel.py:74
↓ 12 callersClassConvBlock
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/pann_model.py:32
↓ 12 callersClassConvBlock_GLU
audio_detection/target_sound_detection/src/models.py:220
↓ 10 callersClassVGGSound
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/dataset.py:16
↓ 9 callersClassConv1d1x1
1x1 Conv1d with customized initialization.
NeuralSeq/modules/parallel_wavegan/layers/residual_block.py:29
↓ 8 callersClassAttentionBlock
An attention block that allows spatial positions to attend to each other. Originally ported from here, but adapted to the N-d case. https
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/openaimodel.py:278
↓ 8 callersClassCnn10_mul_scale
audio_detection/target_sound_detection/src/models.py:422
↓ 8 callersClassIndexedDataset
NeuralSeq/utils/indexed_datasets.py:7
↓ 8 callersClassLayerNorm
Layer normalization module. :param int nout: output dim size :param int dim: dimension to be normalized
NeuralSeq/modules/fastspeech/tts_modules.py:37
↓ 7 callersClassBinarizationError
NeuralSeq/data_gen/tts/base_binarizer.py:18
↓ 7 callersClassSeq2SeqAttention
audio_to_text/captioning/models/decoder.py:110
↓ 7 callersClassTokenTextEncoder
Encoder based on a user-supplied vocabulary (file or list).
NeuralSeq/utils/text_encoder.py:157
↓ 6 callersClassActivation1d
text_to_audio/Make_An_Audio/vocoder/bigvgan/alias_free_torch/act.py:8
↓ 6 callersClassConvBlock
audio_to_text/captioning/models/encoder.py:336
↓ 6 callersClassConvBlock
text_to_audio/Make_An_Audio/wav_evaluation/models/audio.py:13
↓ 6 callersClassConvBlock
text_to_audio/Make_An_Audio/ldm/modules/encoders/CLAP/audio.py:13
↓ 6 callersClassDDIMSampler
text_to_audio/Make_An_Audio/ldm/models/diffusion/ddim.py:12
↓ 6 callersClassDecoderBlockRes2BCond
sound_extraction/model/modules.py:184
↓ 6 callersClassEncoderBlockRes2BCond
sound_extraction/model/modules.py:169
↓ 6 callersClassMLPLayers
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/model.py:27
↓ 6 callersClassSpatialTransformer
Transformer block for image-like data. First, project the input (aka embedding) and reshape to b, t, d. Then apply standard transform
text_to_audio/Make_An_Audio/ldm/modules/attention.py:218
↓ 6 callersClassToTensor
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/transforms.py:67
↓ 5 callersClassBinarizationError
NeuralSeq/data_gen/tts/base_binarizer_emotion.py:24
↓ 5 callersClassBlock2D
audio_to_text/captioning/models/encoder.py:58
↓ 5 callersClassCardinal
CARDINAL类
NeuralSeq/utils/text_norm.py:419
↓ 5 callersClassCrop
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/transforms.py:75
↓ 5 callersClassDecoder
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:462
↓ 5 callersClassDiscriminatorP
NeuralSeq/modules/hifigan/hifigan.py:181
↓ 5 callersClassDiscriminatorP
text_to_audio/Make_An_Audio/vocoder/hifigan/modules.py:139
↓ 5 callersClassDownsample
A downsampling layer with an optional convolution. :param channels: channels in the inputs and outputs. :param use_conv: a bool determini
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/openaimodel.py:134
↓ 5 callersClassLayerNorm
NeuralSeq/modules/commons/rel_transformer.py:265
↓ 5 callersClassLayerNorm
Subclass torch's LayerNorm to handle fp16.
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/model.py:244
↓ 5 callersClassNLayerDiscriminator
Defines a PatchGAN discriminator as in Pix2Pix --> see https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix/blob/master/models/networks.py
text_to_audio/Make_An_Audio/ldm/modules/discriminator/model.py:98
↓ 5 callersClassNetLinLayer
A single linear layer which does a 1x1 conv
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/lpaps.py:80
↓ 5 callersClassPyramidVisionTransformerV2
audio_detection/audio_infer/pytorch/models.py:832
↓ 5 callersClassTimeShift
audio_detection/audio_infer/pytorch/models.py:114
↓ 4 callersClassAFF
多特征融合 AFF
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/feature_fusion.py:133
↓ 4 callersClassChineseNumberUnit
中文数字/数位字符 每个字符除繁简体外还有一个额外的大写字符 e.g. '陆' 和 '陸'
NeuralSeq/utils/text_norm.py:77
↓ 4 callersClassCnn10
audio_detection/target_sound_detection/src/models.py:482
↓ 4 callersClassConv1d
Conv1d module with customized initialization.
NeuralSeq/modules/parallel_wavegan/layers/residual_block.py:15
↓ 4 callersClassConvBlock5x5
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/pann_model.py:78
↓ 4 callersClassDAF
直接相加 DirectAddFuse
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/feature_fusion.py:11
↓ 4 callersClassEncoder
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:368
↓ 4 callersClassFastSpeech2
NeuralSeq/modules/fastspeech/fs2.py:22
↓ 4 callersClassGaussianDiffusion
NeuralSeq/modules/diff/shallow_diffusion_tts.py:71
↓ 4 callersClassLPAPS
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/lpaps.py:17
↓ 4 callersClassMMPool
audio_to_text/captioning/models/encoder.py:122
↓ 4 callersClassMish
NeuralSeq/modules/diff/diffusion.py:68
↓ 4 callersClassModel
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:216
↓ 4 callersClassMultiheadAttention
NeuralSeq/modules/commons/transformer.py:137
↓ 4 callersClassPitchExtractor
NeuralSeq/modules/fastspeech/pe.py:119
↓ 4 callersClassStandardNormalizeAudio
Frequency-wise normalization
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/transforms.py:13
↓ 4 callersClassUpsample
An upsampling layer with an optional convolution. :param channels: channels in the inputs and outputs. :param use_conv: a bool determinin
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/openaimodel.py:91
↓ 4 callersClassUpsample
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:42
↓ 4 callersClassVGGishish
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/model.py:5
↓ 4 callersClassiAFF
多特征融合 iAFF
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/feature_fusion.py:23
↓ 3 callersClassBatchNorm1dTBC
NeuralSeq/modules/commons/common_layers.py:524
↓ 3 callersClassCausalConv1d
CausalConv1d module with customized initialization.
NeuralSeq/modules/parallel_wavegan/layers/causal_conv.py:12
↓ 3 callersClassDiffNet
NeuralSeq/modules/diff/net.py:81
↓ 3 callersClassDiscriminatorS
NeuralSeq/modules/hifigan/hifigan.py:253
↓ 3 callersClassDiscriminatorS
text_to_audio/Make_An_Audio/vocoder/hifigan/modules.py:202
↓ 3 callersClassDownsample
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:60
↓ 3 callersClassEncoder
NeuralSeq/modules/commons/rel_transformer.py:29
↓ 3 callersClassFastSpeech2MIDI
NeuralSeq/modules/diffsinger_midi/fs2.py:46
↓ 3 callersClassFilm
sound_extraction/model/film.py:4
↓ 3 callersClassFusion
audio_detection/target_sound_detection/src/models.py:770
↓ 3 callersClassHTSAT_Swin_Transformer
r"""HTSAT based on the Swin Transformer Args: spec_size (int | tuple(int)): Input Spectrogram size. Default 256 patch_size (int |
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/htsat.py:599
↓ 3 callersClassHifiGanGenerator
NeuralSeq/modules/hifigan/hifigan.py:104
↓ 3 callersClassIndexedDatasetBuilder
NeuralSeq/utils/indexed_datasets.py:41
↓ 3 callersClassLatentRescaler
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:655
↓ 3 callersClassLocalStyleAdaptor
NeuralSeq/modules/GenerSpeech/model/prosody_util.py:172
↓ 3 callersClassMultiheadAttention
NeuralSeq/modules/commons/common_layers.py:165
↓ 3 callersClassNSWNormalizer
NeuralSeq/utils/text_norm.py:603
↓ 3 callersClassPitchPredictor
NeuralSeq/modules/fastspeech/tts_modules.py:217
↓ 3 callersClassProsodyAligner
NeuralSeq/modules/GenerSpeech/model/prosody_util.py:129
↓ 3 callersClassSentence2GraphParser
NeuralSeq/modules/syntaspeech/syntactic_graph_buider.py:7
↓ 3 callersClassSinusoidalPositionalEmbedding
This module produces sinusoidal positional embeddings of any length. Padding symbols are ignored.
NeuralSeq/modules/commons/transformer.py:13
↓ 3 callersClassSinusoidalPositionalEmbedding
This module produces sinusoidal positional embeddings of any length. Padding symbols are ignored.
NeuralSeq/modules/commons/common_layers.py:87
↓ 3 callersClassSnake
Implementation of a sine-based periodic activation function Shape: - Input: (B, C, T) - Output: (B, C, T), same shape as the
text_to_audio/Make_An_Audio/vocoder/bigvgan/activations.py:9
↓ 3 callersClassSnakeBeta
A modified Snake function which uses separate parameters for the magnitude of the periodic components Shape: - Input: (B, C, T)
text_to_audio/Make_An_Audio/vocoder/bigvgan/activations.py:62
↓ 3 callersClassTextEncoder
text_to_audio/Make_An_Audio/ldm/modules/encoders/CLAP/clap.py:42
↓ 3 callersClassVocoderBigVGAN
text_to_audio/Make_An_Audio/vocoder/bigvgan/models.py:393
↓ 3 callersClassWN
NeuralSeq/modules/GenerSpeech/model/wavenet.py:14
↓ 3 callersClassWN
NeuralSeq/modules/commons/wavenet.py:14
↓ 3 callersClassWeightedCrossEntropy
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/loss.py:6
↓ 2 callersClassActNorm
NeuralSeq/modules/GenerSpeech/model/glow_modules.py:68
↓ 2 callersClassAttention
text_to_audio/Make_An_Audio/ldm/modules/x_transformer.py:215
↓ 2 callersClassAttnBlock
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:150
↓ 2 callersClassBlock
NeuralSeq/modules/diff/diffusion.py:103
↓ 2 callersClassBottleneck
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/model.py:47
↓ 2 callersClassCLAP
text_to_audio/Make_An_Audio/ldm/modules/encoders/CLAP/clap.py:54
↓ 2 callersClassCLAPAudioCfp
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/model.py:397
↓ 2 callersClassCLAPTextCfg
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/model.py:413
next →1–100 of 604, ranked by callers