MCPcopy Create free account

hub / github.com/QwenLM/Qwen3-TTS / functions

Functions375 in github.com/QwenLM/Qwen3-TTS

↓ 1 callersMethodexpire_codes_
(self, batch_samples)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:170
↓ 1 callersMethodextract_code
(self, audio)
qwen_tts/core/tokenizer_25hz/vq/speech_vq.py:140
↓ 1 callersMethodextract_mels
(self, audio, sr)
finetuning/dataset.py:104
↓ 1 callersMethodextract_speaker_embedding
(self, audio, sr)
qwen_tts/core/models/modeling_qwen3_tts.py:1941
↓ 1 callersMethodforward_finetune
( self, input_ids=None, attention_mask=None, position_ids=None, past_k
qwen_tts/core/models/modeling_qwen3_tts.py:1197
↓ 1 callersMethodforward_sub_talker_finetune
(self, codec_ids, talker_hidden_states)
qwen_tts/core/models/modeling_qwen3_tts.py:1612
↓ 1 callersMethodfrom_pretrained
( cls, pretrained_model_name_or_path, *model_args, config=None, cache_
qwen_tts/core/models/modeling_qwen3_tts.py:1856
↓ 1 callersMethodgenerate_icl_prompt
( self, text_id: torch.Tensor, ref_id: torch.Tensor, ref_code: torch.Tensor,
qwen_tts/core/models/modeling_qwen3_tts.py:1968
↓ 1 callersMethodgenerate_speaker_prompt
( self, voice_clone_prompt: list[dict] )
qwen_tts/core/models/modeling_qwen3_tts.py:1957
↓ 1 callersFunctionget_T_after_cnn
(L_in, dilation=1)
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:110
↓ 1 callersFunctionget_mel_audio
(audio, padding=False, audio_vq_ds_rate = 1, n_mels = 128)
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:118
↓ 1 callersMethodget_model_type
Get the underlying tokenizer model type. Returns: str: Model type string from `self.model.config.model_type`
qwen_tts/inference/qwen3_tts_tokenizer.py:367
↓ 1 callersMethodget_output_sample_rate
Get the output sample rate for decoded waveforms. Returns: int: Output sample rate (Hz).
qwen_tts/inference/qwen3_tts_tokenizer.py:386
↓ 1 callersMethodget_rope_index
Calculate the 3D rope index based on image and video's temporal, height and width in LLM. Explanation: Each embedding se
qwen_tts/core/models/modeling_qwen3_tts.py:1746
↓ 1 callersMethodget_supported_languages
(self)
qwen_tts/core/models/modeling_qwen3_tts.py:1852
↓ 1 callersMethodget_supported_speakers
(self)
qwen_tts/core/models/modeling_qwen3_tts.py:1849
↓ 1 callersMethodinit_embed_
(self, data)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:152
↓ 1 callersFunctionkmeans
(samples, num_clusters: int, num_iters: int = 10)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:78
↓ 1 callersFunctionlaplace_smoothing
(x, n_categories: int, epsilon: float = 1e-5)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:56
↓ 1 callersMethodload_audio
Load audio from wav path or base64 string, then resample to target_sr. Args: x (str): A wav file path, o
qwen_tts/inference/qwen3_tts_tokenizer.py:122
↓ 1 callersMethodload_encoder_xvector_extractor
(self, model_path)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1378
↓ 1 callersMethodload_generate_config
(self, generate_config)
qwen_tts/core/models/modeling_qwen3_tts.py:1846
↓ 1 callersMethodload_speech_tokenizer
(self, speech_tokenizer)
qwen_tts/core/models/modeling_qwen3_tts.py:1843
↓ 1 callersFunctionmain
()
finetuning/prepare_data.py:24
↓ 1 callersFunctionmain
()
qwen_tts/__main__.py:16
↓ 1 callersFunctionmain
(argv=None)
qwen_tts/cli/demo.py:595
↓ 1 callersFunctionmain
()
examples/test_model_12hz_voice_design.py:23
↓ 1 callersFunctionmain
()
examples/test_model_12hz_custom_voice.py:23
↓ 1 callersFunctionmain
()
examples/test_model_12hz_base.py:42
↓ 1 callersMethodmel2code
(self, mels)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1318
↓ 1 callersFunctionmel_filters
load the mel filterbank matrix for projecting STFT into a Mel spectrogram. Allows decoupling librosa dependency; saved using: np.sav
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:44
↓ 1 callersMethodnormalize_spectrogram
(self, spectrogram, max_value, min_db)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1038
↓ 1 callersMethodprocess_mel_spectrogram
(self, mel_spectrogram)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1047
↓ 1 callersMethodqkv_flash_attention
( self, q: Tensor, k: Tensor, v: Tensor, cu_seqlens=None )
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:196
↓ 1 callersMethodquantize_speech
(self, speechs)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1337
↓ 1 callersMethodreplace_
(self, samples, mask)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:164
↓ 1 callersMethodsample
( self, conditioning_vector, reference_mel_spectrogram, quantized_code,
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1172
↓ 1 callersMethodset_audio_sync
(self)
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:333
↓ 1 callersFunctionsinusoids
Returns sinusoids for positional embedding
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:129
↓ 1 callersMethodsox_norm
(self, audio)
qwen_tts/core/tokenizer_25hz/vq/speech_vq.py:157
↓ 1 callersFunctionspectral_normalize_torch
(magnitudes)
qwen_tts/core/tokenizer_25hz/vq/speech_vq.py:38
↓ 1 callersMethodspeech2mel
(self, speechs)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1309
↓ 1 callersFunctiontrain
()
finetuning/sft_12hz.py:31
↓ 1 callersFunctionuniform_init
(*shape: int)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:60
Method__call__
Main method to prepare for the model one or several sequences(s) and audio(s). This method forwards the `text` and `kwargs` arguments
qwen_tts/core/models/processing_qwen3_tts.py:46
Method__getitem__
(self, idx)
finetuning/dataset.py:120
Method__init__
(self, data_list, processor, config:Qwen3TTSConfig, lag_num = -1)
finetuning/dataset.py:34
Method__init__
(self, dim, base=10000)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:102
Method__init__
( self, in_channels, out_channels, kernel_size, dilation, )
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:125
Method__init__
(self, in_channels, out_channels, scale=8, kernel_size=3, dilation=1)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:148
Method__init__
(self, in_channels, se_channels, out_channels)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:182
Method__init__
(self, channels, attention_channels=128)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:216
Method__init__
( self, in_channels, out_channels, res2net_scale=8, se_channels=128,
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:305
Method__init__
(self, config: Qwen3TTSTokenizerV1DecoderBigVGANConfig)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:348
Method__init__
(self, config: Qwen3TTSTokenizerV1DecoderBigVGANConfig)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:427
Method__init__
(self, codec_num_embeds, codec_dim, repeats)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:461
Method__init__
(self, dim)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:478
Method__init__
(self, dim)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:497
Method__init__
(self, config: Qwen3TTSTokenizerV1DecoderBigVGANConfig)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:571
Method__init__
(self, dim)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:635
Method__init__
(self, dim, freq_embed_dim=256)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:650
Method__init__
(self, config: Qwen3TTSTokenizerV1DecoderBigVGANConfig, look_ahead_block=0, look_backward_block=0)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:664
Method__init__
(self, in_features, alpha=1.0)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:712
Method__init__
(self, ratio=2, kernel_size=None)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:786
Method__init__
(self, ratio=2, kernel_size=None)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:811
Method__init__
( self, activation, up_ratio: int = 2, down_ratio: int = 2, up_kernel_
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:836
Method__init__
(self, *args, **kwargs)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:860
Method__init__
( self, channels, kernel_size=3, dilation=(1, 3, 5), causal_type='1',
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:869
Method__init__
(self, config: Qwen3TTSTokenizerV1DecoderBigVGANConfig)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:999
Method__init__
(self, config: Qwen3TTSTokenizerV1DecoderDiTConfig)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1075
Method__init__
(self, config: Qwen3TTSTokenizerV1DecoderConfig)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1235
Method__init__
(self, config: Qwen3TTSTokenizerV1EncoderConfig)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1284
Method__init__
(self, config: Qwen3TTSTokenizerV1Config)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1361
Method__init__
( self, hidden_size=1024, num_hidden_layers=22, num_attention_heads=16,
qwen_tts/core/tokenizer_25hz/configuration_qwen3_tts_tokenizer_v1.py:71
Method__init__
( self, mel_dim=80, upsample_initial_channel=1536, resblock_kernel_sizes=[3, 7
qwen_tts/core/tokenizer_25hz/configuration_qwen3_tts_tokenizer_v1.py:146
Method__init__
(self, dit_config=None, bigvgan_config=None, **kwargs)
qwen_tts/core/tokenizer_25hz/configuration_qwen3_tts_tokenizer_v1.py:185
Method__init__
( self, n_mels=128, n_ctx=1500, n_state=1280, n_head=20, n_lay
qwen_tts/core/tokenizer_25hz/configuration_qwen3_tts_tokenizer_v1.py:241
Method__init__
(self, filter_length=1024, hop_length=160, win_length=640,
qwen_tts/core/tokenizer_25hz/vq/speech_vq.py:59
Method__init__
( self, n_mels: int, n_ctx: int, n_state: int, n_h
qwen_tts/core/tokenizer_25hz/vq/speech_vq.py:163
Method__init__
(self, n_state: int, n_head: int)
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:162
Method__init__
(self, n_state: int, n_head: int, enable_mp: bool = False, sequence_parallel: bool = False)
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:266
Method__init__
( self, dim: int, codebook_size: int, codebook_dim: tp.Optiona
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:267
Method__init__
(self, *, num_quantizers, quantize_dropout: bool = False, r
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:338
Method__init__
(self, *, num_groups, num_quantizers, quantize_dropout: boo
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:482
Method__init__
( self, codebook_size=2048, hidden_size=1024, latent_dim=1024, max_pos
qwen_tts/core/tokenizer_12hz/configuration_qwen3_tts_tokenizer_v2.py:72
Method__init__
( self, in_channels, out_channels, kernel_size, dilation=1, st
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:160
Method__init__
(self, in_channels, out_channels, kernel_size, stride=1)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:196
Method__init__
(self, dim: int)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:212
Method__init__
(self, config: Qwen3TTSTokenizerV2DecoderConfig, device=None)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:249
Method__init__
(self, config: Qwen3TTSTokenizerV2DecoderConfig, layer_idx)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:285
Method__init__
(self, config)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:358
Method__init__
Qwen3TTSTokenizerV2DecoderRMSNorm is equivalent to T5LayerNorm
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:375
Method__init__
(self, config)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:399
Method__init__
(self, config: Qwen3TTSTokenizerV2DecoderConfig, layer_idx)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:410
Method__init__
(self, config: Qwen3TTSTokenizerV2DecoderConfig)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:482
Method__init__
(self, dim: int = 16, dilation: int = 1)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:620
Method__init__
(self, config: Qwen3TTSTokenizerV2DecoderConfig, layer_idx)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:639
Method__init__
( self, dim: int, codebook_size: int, epsilon: float = 1e-5, )
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:662
Method__init__
( self, dim: int, codebook_size: int, codebook_dim: Optional[int] = None,
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:683
Method__init__
(self, *, num_quantizers: int, **kwargs)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:715
← previousnext →101–200 of 375, ranked by callers