MCPcopy Create free account

hub / github.com/FunAudioLLM/ThinkSound / functions

Functions638 in github.com/FunAudioLLM/ThinkSound

Method__call__
(self, signal)
ThinkSound/data/utils.py:15
Method__call__
(self, source: torch.Tensor, randomize=True)
ThinkSound/data/utils.py:33
Method__call__
(self, audio: torch.Tensor, video: torch.Tensor)
ThinkSound/data/utils.py:85
Method__call__
(self, audio: torch.Tensor, video: torch.Tensor)
ThinkSound/data/utils.py:143
Method__call__
(self, audio: torch.Tensor, video: torch.Tensor)
ThinkSound/data/utils.py:201
Method__call__
(self, audio: torch.Tensor, video_360: torch.Tensor, video_fov: torch.Tensor)
ThinkSound/data/utils.py:270
Method__call__
(self, signal)
ThinkSound/data/utils.py:324
Method__call__
(self, signal)
ThinkSound/data/utils.py:328
Method__call__
(self, signal)
ThinkSound/data/utils.py:332
Method__call__
(self, signal)
ThinkSound/data/utils.py:346
Method__getitem__
(self, idx)
ThinkSound/data/dataset.py:210
Method__getitem__
(self, idx)
ThinkSound/data/dataset.py:337
Method__getitem__
(self, idx)
ThinkSound/data/dataset.py:428
Method__getitem__
(self, idx)
ThinkSound/data/dataset.py:541
Method__getitem__
(self, idx)
ThinkSound/data/dataset.py:583
Method__getitem__
(self, idx: int)
data_utils/v2a_utils/vggsound_text.py:88
Method__getitem__
(self, idx: int)
data_utils/v2a_utils/audioset_224.py:294
Method__getitem__
(self, idx: int)
data_utils/v2a_utils/audioset_video_224.py:247
Method__getitem__
(self, idx: int)
data_utils/v2a_utils/vggsound.py:238
Method__getitem__
(self, idx: int)
data_utils/v2a_utils/vggsound_224_no_sync.py:202
Method__getitem__
(self, idx: int)
data_utils/v2a_utils/vggsound_224_no_audio.py:254
Method__getitem__
(self, idx: int)
data_utils/v2a_utils/audio_text_dataset.py:152
Method__getitem__
(self, idx: int)
data_utils/v2a_utils/vggsound_224.py:304
Method__init__
(self, model_config)
train.py:26
Method__init__
(self, output_dir, write_interval='batch')
train.py:34
Method__init__
(self, model_config)
unwrap.py:28
Method__init__
(self, output_dir, write_interval='batch', batch_size=32)
unwrap.py:36
Method__init__
(self, *a,use_half=True, **kw)
extract_latents.py:63
Method__init__
(self, n_samples: int, sample_rate: int, randomize: bool = True)
ThinkSound/data/utils.py:25
Method__init__
(self, n_samples: int, sample_rate: int, fps: int, randomize: bool = True)
ThinkSound/data/utils.py:75
Method__init__
(self, n_samples: int, sample_rate: int, fps: int, randomize: bool = True)
ThinkSound/data/utils.py:133
Method__init__
(self, n_samples: int, sample_rate: int, fps: int, randomize: bool = True)
ThinkSound/data/utils.py:191
Method__init__
(self, n_samples: int, sample_rate: int, fps: int, randomize: bool = True)
ThinkSound/data/utils.py:260
Method__init__
(self, p=0.5)
ThinkSound/data/utils.py:321
Method__init__
( self, id: str, path: str, split_path: str, audio_dir: str = None,
ThinkSound/data/dataset.py:114
Method__init__
( self, configs, sample_size=65536, sample_rate=48000, keywords=Non
ThinkSound/data/dataset.py:130
Method__init__
( self, configs, sample_size=65536, sample_rate=48000, keywords=Non
ThinkSound/data/dataset.py:269
Method__init__
( self, configs, sample_size=65536, sample_rate=48000, keywords=Non
ThinkSound/data/dataset.py:445
Method__init__
(self, video_datasets: list[torch.utils.data.Dataset], audio_datasets: list[torch.utils.data.Dataset])
ThinkSound/data/dataset.py:571
Method__init__
( self, id: str, s3_path: str, custom_metadata_fn: Optional[Callable[[str], st
ThinkSound/data/dataset.py:915
Method__init__
( self, id: str, path: str, custom_metadata_fn: Optional[Callable[[str], str]]
ThinkSound/data/dataset.py:939
Method__init__
( self, datasets: List[S3DatasetConfig], batch_size, sample_size, samp
ThinkSound/data/dataset.py:982
Method__init__
(self, dataset_config, batch_size, test_batch_size, sample_size, sample_rate, audio_channels=2, num_workers=4,
ThinkSound/data/datamodule.py:36
Method__init__
(self, optimizer, inv_gamma=1., power=1., warmup=0., final_lr=0., last_epoch=-1, verbose=Fals
ThinkSound/training/utils.py:38
Method__init__
( self, model: ConditionedDiffusionModelWrapper, lr: float = None,
ThinkSound/training/diffusion.py:49
Method__init__
(self, demo_every=2000, num_demos=8, sample_size=65536,
ThinkSound/training/diffusion.py:463
Method__init__
( self, autoencoder: AudioAutoencoder, lr: float = 1e-4, warm
ThinkSound/training/autoencoders.py:21
Method__init__
(self, name: str, weight: float = 1.0)
ThinkSound/training/losses/losses.py:7
Method__init__
(self, key: str, name, weight: float = 1.0)
ThinkSound/training/losses/losses.py:17
Method__init__
(self, key_a: str, key_b: str, weight: float = 1.0, mask_key: str = None, name: str = 'mse_loss')
ThinkSound/training/losses/losses.py:45
Method__init__
(self, auraloss_module, input_key: str, target_key: str, name: str, weight: float = 1)
ThinkSound/training/losses/losses.py:71
Method__init__
(self, losses: tp.List[LossModule])
ThinkSound/training/losses/losses.py:85
Method__init__
Initialize sum and difference extraction module.
ThinkSound/training/losses/auraloss.py:46
Method__init__
Initilize FIR pre-emphasis filtering module.
ThinkSound/training/losses/auraloss.py:96
Method__init__
(self)
ThinkSound/training/losses/auraloss.py:177
Method__init__
(self, log=True, log_eps=0.0, log_fac=1.0, distance="L1", reduction="mean")
ThinkSound/training/losses/auraloss.py:205
Method__init__
( self, fft_sizes: List[int] = [1024, 2048, 512], hop_sizes: List[int] = [120, 240, 50
ThinkSound/training/losses/auraloss.py:473
Method__init__
( self, fft_sizes: List[int], hop_sizes: List[int], win_lengths: List[int],
ThinkSound/training/losses/auraloss.py:563
Method__init__
( self, fft_sizes: List[int], hop_sizes: List[int], win_lengths: List[int],
ThinkSound/training/losses/auraloss.py:638
Method__init__
(self, *, latent_dim: int, clip_dim: int,
ThinkSound/models/mmdit.py:29
Method__init__
(self, main, skip=None)
ThinkSound/models/blocks.py:14
Method__init__
(self, c_in, c_mid, c_out, is_last=False, kernel_size=5, conv_bias=True, use_snake=False)
ThinkSound/models/blocks.py:23
Method__init__
(self, c_in, n_head=1, dropout_rate=0.)
ThinkSound/models/blocks.py:35
Method__init__
(self, *main)
ThinkSound/models/blocks.py:77
Method__init__
(self, in_features, out_features, std=1.)
ThinkSound/models/blocks.py:85
Method__init__
(self, kernel='linear', pad_mode='reflect', channels_last=False)
ThinkSound/models/blocks.py:112
Method__init__
(self, kernel='linear', pad_mode='reflect', channels_last=False)
ThinkSound/models/blocks.py:134
Method__init__
(self, features, cond_features, eps=1e-6)
ThinkSound/models/blocks.py:212
Method__init__
(self, in_channels, out_channels, kernel_size=1)
ThinkSound/models/blocks.py:230
Method__init__
(self, in_features, out_features, bias=True)
ThinkSound/models/blocks.py:277
Method__init__
(self, shape, fix_scale = False, eps=1e-6)
ThinkSound/models/blocks.py:286
Method__init__
(self, in_features, alpha=1.0, alpha_trainable=True, alpha_logscale=True)
ThinkSound/models/blocks.py:313
Method__init__
Initialize the FeedForward module. Args: dim (int): Input dimension. hidden_dim (int): Hidden dimension of t
ThinkSound/models/blocks.py:387
Method__init__
( self, *, dim, depth, dim_in = None, dim_out = None,
ThinkSound/models/local_attention.py:15
Method__init__
( self, in_channels, embed_dim = 768, depth = 3, heads = 12,
ThinkSound/models/local_attention.py:103
Method__init__
( self, in_channels, embed_dim, depth = 3, heads = 12, upsamp
ThinkSound/models/local_attention.py:146
Method__init__
( self, in_channels, out_channels, embed_dims = [768, 384, 192, 96], h
ThinkSound/models/local_attention.py:236
Method__init__
(self, *args, **kwargs)
ThinkSound/models/diffusion.py:36
Method__init__
( self, model: DiffusionModel, io_channels, sa
ThinkSound/models/diffusion.py:43
Method__init__
(self, *args, supports_cross_attention: bool = False, supports
ThinkSound/models/diffusion.py:69
Method__init__
( self, model: ConditionedDiffusionModel, conditioner: MultiConditioner,
ThinkSound/models/diffusion.py:102
Method__init__
( self, *args, **kwargs )
ThinkSound/models/diffusion.py:244
Method__init__
( self, *args, **kwargs )
ThinkSound/models/diffusion.py:304
Method__init__
( self, in_channels, *args, **kwargs )
ThinkSound/models/diffusion.py:355
Method__init__
( self, *args, **kwargs )
ThinkSound/models/diffusion.py:375
Method__init__
( self, io_channels = 2, depth=14, n_attn_layers = 6, channels = [128,
ThinkSound/models/diffusion.py:409
Method__init__
( self, *args, **kwargs )
ThinkSound/models/diffusion.py:523
Method__init__
( self, *args, **kwargs )
ThinkSound/models/diffusion.py:576
Method__init__
( self, model: MMmodule, conditioner: MultiConditioner, io_cha
ThinkSound/models/diffusion.py:627
Method__init__
( self, io_channels, *args, **kwargs )
ThinkSound/models/diffusion.py:709
Method__init__
(self, in_channels, out_channels, stride, use_snake=False, antialias_activation=False)
ThinkSound/models/autoencoders.py:65
Method__init__
(self, in_channels, out_channels, stride, use_snake=False, antialias_activation=False, use_nearest_upsample=Fa
ThinkSound/models/autoencoders.py:84
Method__init__
(self, in_channels=2, channels=128, latent_dim=32,
ThinkSound/models/autoencoders.py:117
Method__init__
(self, out_channels=2, channels=128, latent_dim=32,
ThinkSound/models/autoencoders.py:151
Method__init__
(self, in_channels=1, **kwargs)
ThinkSound/models/autoencoders.py:195
Method__init__
(self, latent_dim, out_channels=1, **kwargs)
ThinkSound/models/autoencoders.py:218
Method__init__
( self, encoder, decoder, latent_dim, downsampling_ratio, samp
ThinkSound/models/autoencoders.py:231
Method__init__
( self, diffusion: ConditionedDiffusionModel, diffusion_downsampling_ratio, *a
ThinkSound/models/autoencoders.py:570
Method__init__
(self, n_q: int, cached: bool = True)
ThinkSound/models/codebook_patterns.py:287
Method__init__
(self, n_q: int, delays: tp.Optional[tp.List[int]] = None, flatten_first: int = 0, empty_init
ThinkSound/models/codebook_patterns.py:325
← previousnext →201–300 of 638, ranked by callers