Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/AIGC-Audio/AudioGPT
/ types & classes
Types & classes
604 in github.com/AIGC-Audio/AudioGPT
⨍
Functions
2,752
◇
Types & classes
604
↓ 21 callers
Class
ConvBlock
audio_detection/target_sound_detection/src/models.py:175
↓ 19 callers
Class
Conv2d
Conv2d module with customized initialization.
NeuralSeq/modules/parallel_wavegan/layers/upsample.py:47
↓ 18 callers
Class
Block2D
audio_detection/target_sound_detection/src/models.py:614
↓ 17 callers
Class
ResnetBlock
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:82
↓ 16 callers
Class
ConvBlockRes
sound_extraction/model/modules.py:381
↓ 16 callers
Class
ResBlock
A residual block that can optionally change the number of channels. :param channels: the number of input channels. :param emb_channels: t
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/openaimodel.py:163
↓ 14 callers
Class
ConvBlockResCond
sound_extraction/model/modules.py:326
↓ 14 callers
Class
TimestepEmbedSequential
A sequential module that passes timestep embeddings to the children that support it as an extra input.
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/openaimodel.py:74
↓ 12 callers
Class
ConvBlock
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/pann_model.py:32
↓ 12 callers
Class
ConvBlock_GLU
audio_detection/target_sound_detection/src/models.py:220
↓ 10 callers
Class
VGGSound
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/dataset.py:16
↓ 9 callers
Class
Conv1d1x1
1x1 Conv1d with customized initialization.
NeuralSeq/modules/parallel_wavegan/layers/residual_block.py:29
↓ 8 callers
Class
AttentionBlock
An attention block that allows spatial positions to attend to each other. Originally ported from here, but adapted to the N-d case. https
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/openaimodel.py:278
↓ 8 callers
Class
Cnn10_mul_scale
audio_detection/target_sound_detection/src/models.py:422
↓ 8 callers
Class
IndexedDataset
NeuralSeq/utils/indexed_datasets.py:7
↓ 8 callers
Class
LayerNorm
Layer normalization module. :param int nout: output dim size :param int dim: dimension to be normalized
NeuralSeq/modules/fastspeech/tts_modules.py:37
↓ 7 callers
Class
BinarizationError
NeuralSeq/data_gen/tts/base_binarizer.py:18
↓ 7 callers
Class
Seq2SeqAttention
audio_to_text/captioning/models/decoder.py:110
↓ 7 callers
Class
TokenTextEncoder
Encoder based on a user-supplied vocabulary (file or list).
NeuralSeq/utils/text_encoder.py:157
↓ 6 callers
Class
Activation1d
text_to_audio/Make_An_Audio/vocoder/bigvgan/alias_free_torch/act.py:8
↓ 6 callers
Class
ConvBlock
audio_to_text/captioning/models/encoder.py:336
↓ 6 callers
Class
ConvBlock
text_to_audio/Make_An_Audio/wav_evaluation/models/audio.py:13
↓ 6 callers
Class
ConvBlock
text_to_audio/Make_An_Audio/ldm/modules/encoders/CLAP/audio.py:13
↓ 6 callers
Class
DDIMSampler
text_to_audio/Make_An_Audio/ldm/models/diffusion/ddim.py:12
↓ 6 callers
Class
DecoderBlockRes2BCond
sound_extraction/model/modules.py:184
↓ 6 callers
Class
EncoderBlockRes2BCond
sound_extraction/model/modules.py:169
↓ 6 callers
Class
MLPLayers
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/model.py:27
↓ 6 callers
Class
SpatialTransformer
Transformer block for image-like data. First, project the input (aka embedding) and reshape to b, t, d. Then apply standard transform
text_to_audio/Make_An_Audio/ldm/modules/attention.py:218
↓ 6 callers
Class
ToTensor
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/transforms.py:67
↓ 5 callers
Class
BinarizationError
NeuralSeq/data_gen/tts/base_binarizer_emotion.py:24
↓ 5 callers
Class
Block2D
audio_to_text/captioning/models/encoder.py:58
↓ 5 callers
Class
Cardinal
CARDINAL类
NeuralSeq/utils/text_norm.py:419
↓ 5 callers
Class
Crop
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/transforms.py:75
↓ 5 callers
Class
Decoder
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:462
↓ 5 callers
Class
DiscriminatorP
NeuralSeq/modules/hifigan/hifigan.py:181
↓ 5 callers
Class
DiscriminatorP
text_to_audio/Make_An_Audio/vocoder/hifigan/modules.py:139
↓ 5 callers
Class
Downsample
A downsampling layer with an optional convolution. :param channels: channels in the inputs and outputs. :param use_conv: a bool determini
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/openaimodel.py:134
↓ 5 callers
Class
LayerNorm
NeuralSeq/modules/commons/rel_transformer.py:265
↓ 5 callers
Class
LayerNorm
Subclass torch's LayerNorm to handle fp16.
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/model.py:244
↓ 5 callers
Class
NLayerDiscriminator
Defines a PatchGAN discriminator as in Pix2Pix --> see https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix/blob/master/models/networks.py
text_to_audio/Make_An_Audio/ldm/modules/discriminator/model.py:98
↓ 5 callers
Class
NetLinLayer
A single linear layer which does a 1x1 conv
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/lpaps.py:80
↓ 5 callers
Class
PyramidVisionTransformerV2
audio_detection/audio_infer/pytorch/models.py:832
↓ 5 callers
Class
TimeShift
audio_detection/audio_infer/pytorch/models.py:114
↓ 4 callers
Class
AFF
多特征融合 AFF
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/feature_fusion.py:133
↓ 4 callers
Class
ChineseNumberUnit
中文数字/数位字符 每个字符除繁简体外还有一个额外的大写字符 e.g. '陆' 和 '陸'
NeuralSeq/utils/text_norm.py:77
↓ 4 callers
Class
Cnn10
audio_detection/target_sound_detection/src/models.py:482
↓ 4 callers
Class
Conv1d
Conv1d module with customized initialization.
NeuralSeq/modules/parallel_wavegan/layers/residual_block.py:15
↓ 4 callers
Class
ConvBlock5x5
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/pann_model.py:78
↓ 4 callers
Class
DAF
直接相加 DirectAddFuse
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/feature_fusion.py:11
↓ 4 callers
Class
Encoder
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:368
↓ 4 callers
Class
FastSpeech2
NeuralSeq/modules/fastspeech/fs2.py:22
↓ 4 callers
Class
GaussianDiffusion
NeuralSeq/modules/diff/shallow_diffusion_tts.py:71
↓ 4 callers
Class
LPAPS
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/lpaps.py:17
↓ 4 callers
Class
MMPool
audio_to_text/captioning/models/encoder.py:122
↓ 4 callers
Class
Mish
NeuralSeq/modules/diff/diffusion.py:68
↓ 4 callers
Class
Model
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:216
↓ 4 callers
Class
MultiheadAttention
NeuralSeq/modules/commons/transformer.py:137
↓ 4 callers
Class
PitchExtractor
NeuralSeq/modules/fastspeech/pe.py:119
↓ 4 callers
Class
StandardNormalizeAudio
Frequency-wise normalization
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/transforms.py:13
↓ 4 callers
Class
Upsample
An upsampling layer with an optional convolution. :param channels: channels in the inputs and outputs. :param use_conv: a bool determinin
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/openaimodel.py:91
↓ 4 callers
Class
Upsample
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:42
↓ 4 callers
Class
VGGishish
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/model.py:5
↓ 4 callers
Class
iAFF
多特征融合 iAFF
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/feature_fusion.py:23
↓ 3 callers
Class
BatchNorm1dTBC
NeuralSeq/modules/commons/common_layers.py:524
↓ 3 callers
Class
CausalConv1d
CausalConv1d module with customized initialization.
NeuralSeq/modules/parallel_wavegan/layers/causal_conv.py:12
↓ 3 callers
Class
DiffNet
NeuralSeq/modules/diff/net.py:81
↓ 3 callers
Class
DiscriminatorS
NeuralSeq/modules/hifigan/hifigan.py:253
↓ 3 callers
Class
DiscriminatorS
text_to_audio/Make_An_Audio/vocoder/hifigan/modules.py:202
↓ 3 callers
Class
Downsample
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:60
↓ 3 callers
Class
Encoder
NeuralSeq/modules/commons/rel_transformer.py:29
↓ 3 callers
Class
FastSpeech2MIDI
NeuralSeq/modules/diffsinger_midi/fs2.py:46
↓ 3 callers
Class
Film
sound_extraction/model/film.py:4
↓ 3 callers
Class
Fusion
audio_detection/target_sound_detection/src/models.py:770
↓ 3 callers
Class
HTSAT_Swin_Transformer
r"""HTSAT based on the Swin Transformer Args: spec_size (int | tuple(int)): Input Spectrogram size. Default 256 patch_size (int |
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/htsat.py:599
↓ 3 callers
Class
HifiGanGenerator
NeuralSeq/modules/hifigan/hifigan.py:104
↓ 3 callers
Class
IndexedDatasetBuilder
NeuralSeq/utils/indexed_datasets.py:41
↓ 3 callers
Class
LatentRescaler
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:655
↓ 3 callers
Class
LocalStyleAdaptor
NeuralSeq/modules/GenerSpeech/model/prosody_util.py:172
↓ 3 callers
Class
MultiheadAttention
NeuralSeq/modules/commons/common_layers.py:165
↓ 3 callers
Class
NSWNormalizer
NeuralSeq/utils/text_norm.py:603
↓ 3 callers
Class
PitchPredictor
NeuralSeq/modules/fastspeech/tts_modules.py:217
↓ 3 callers
Class
ProsodyAligner
NeuralSeq/modules/GenerSpeech/model/prosody_util.py:129
↓ 3 callers
Class
Sentence2GraphParser
NeuralSeq/modules/syntaspeech/syntactic_graph_buider.py:7
↓ 3 callers
Class
SinusoidalPositionalEmbedding
This module produces sinusoidal positional embeddings of any length. Padding symbols are ignored.
NeuralSeq/modules/commons/transformer.py:13
↓ 3 callers
Class
SinusoidalPositionalEmbedding
This module produces sinusoidal positional embeddings of any length. Padding symbols are ignored.
NeuralSeq/modules/commons/common_layers.py:87
↓ 3 callers
Class
Snake
Implementation of a sine-based periodic activation function Shape: - Input: (B, C, T) - Output: (B, C, T), same shape as the
text_to_audio/Make_An_Audio/vocoder/bigvgan/activations.py:9
↓ 3 callers
Class
SnakeBeta
A modified Snake function which uses separate parameters for the magnitude of the periodic components Shape: - Input: (B, C, T)
text_to_audio/Make_An_Audio/vocoder/bigvgan/activations.py:62
↓ 3 callers
Class
TextEncoder
text_to_audio/Make_An_Audio/ldm/modules/encoders/CLAP/clap.py:42
↓ 3 callers
Class
VocoderBigVGAN
text_to_audio/Make_An_Audio/vocoder/bigvgan/models.py:393
↓ 3 callers
Class
WN
NeuralSeq/modules/GenerSpeech/model/wavenet.py:14
↓ 3 callers
Class
WN
NeuralSeq/modules/commons/wavenet.py:14
↓ 3 callers
Class
WeightedCrossEntropy
text_to_audio/Make_An_Audio/ldm/modules/losses_audio/vggishish/loss.py:6
↓ 2 callers
Class
ActNorm
NeuralSeq/modules/GenerSpeech/model/glow_modules.py:68
↓ 2 callers
Class
Attention
text_to_audio/Make_An_Audio/ldm/modules/x_transformer.py:215
↓ 2 callers
Class
AttnBlock
text_to_audio/Make_An_Audio/ldm/modules/diffusionmodules/model.py:150
↓ 2 callers
Class
Block
NeuralSeq/modules/diff/diffusion.py:103
↓ 2 callers
Class
Bottleneck
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/model.py:47
↓ 2 callers
Class
CLAP
text_to_audio/Make_An_Audio/ldm/modules/encoders/CLAP/clap.py:54
↓ 2 callers
Class
CLAPAudioCfp
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/model.py:397
↓ 2 callers
Class
CLAPTextCfg
text_to_audio/Make_An_Audio/ldm/modules/encoders/open_clap/model.py:413
next →
1–100 of 604, ranked by callers