MCPcopy Create free account

hub / github.com/QwenLM/Qwen3-TTS / functions

Functions375 in github.com/QwenLM/Qwen3-TTS

↓ 26 callersMethod__init__
(self, dim, mult=4, dropout=0.0)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:515
↓ 20 callersMethod__init__
(self, in_features, alpha=1.0)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:592
↓ 19 callersMethod__init__
(self, in_channels, out_channels, scale=8, kernel_size=3, dilation=1)
qwen_tts/core/models/modeling_qwen3_tts.py:96
↓ 15 callersMethodget_input_embeddings
(self)
qwen_tts/core/models/modeling_qwen3_tts.py:1447
↓ 12 callersMethod_ensure_list
(self, x: MaybeList)
qwen_tts/inference/qwen3_tts_model.py:266
↓ 9 callersMethoddecode
Decode back to waveform. Usage: 1) Pass the raw output of `encode(...)` directly (recommended). - 25Hz: expects f
qwen_tts/inference/qwen3_tts_tokenizer.py:259
↓ 8 callersMethodgenerate_voice_clone
Voice clone speech using the Base model. You can provide either: - (ref_audio, ref_text, x_vector_only_mode) and let this
qwen_tts/inference/qwen3_tts_model.py:470
↓ 8 callersMethodget_text_embeddings
(self)
qwen_tts/core/models/modeling_qwen3_tts.py:1450
↓ 7 callersMethodencode
Batch-encode audio into discrete codes (and optional conditioning, depending on 25Hz/12Hz). Args: audios (AudioInput):
qwen_tts/inference/qwen3_tts_tokenizer.py:208
↓ 7 callersMethodfrom_pretrained
Load a Qwen3 TTS model and its processor in HuggingFace `from_pretrained` style. This method: 1) Loads config via AutoConf
qwen_tts/inference/qwen3_tts_model.py:83
↓ 6 callersMethod_tokenize_texts
(self, texts: List[str])
qwen_tts/inference/qwen3_tts_model.py:278
↓ 6 callersMethoddecode
(self, codes: torch.Tensor)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:676
↓ 6 callersFunctionrun_case
(tts: Qwen3TTSModel, out_dir: str, case_name: str, call_fn)
examples/test_model_12hz_base.py:28
↓ 5 callersMethodcreate_voice_clone_prompt
Build voice-clone prompt items from reference audio (and optionally reference text) using Base model. Modes: - x_vector_on
qwen_tts/inference/qwen3_tts_model.py:356
↓ 5 callersMethoddecode
(self, embed_ind, buffers)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:212
↓ 4 callersMethod__init__
( self, encoder_config=None, decoder_config=None, input_sample_rate=24000,
qwen_tts/core/tokenizer_25hz/configuration_qwen3_tts_tokenizer_v1.py:299
↓ 4 callersFunction_gen_common_kwargs
()
qwen_tts/cli/demo.py:268
↓ 4 callersMethod_get_padding
(self, kernel_size, dilation=1)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:979
↓ 4 callersFunction_wav_to_gradio_audio
(wav: np.ndarray, sr: int)
qwen_tts/cli/demo.py:241
↓ 4 callersMethodencode
(self, x, buffers)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:200
↓ 4 callersMethodgenerate
( self, input_ids: Optional[list[torch.Tensor]] = None, instruct_ids: Optional[list[to
qwen_tts/core/models/modeling_qwen3_tts.py:2022
↓ 4 callersFunctionrotate_half
Rotates half the hidden dims of the input.
qwen_tts/core/models/modeling_qwen3_tts.py:615
↓ 3 callersMethod__init__
( self, dim: int, codebook_size: int, kmeans_init: int = False
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:129
↓ 3 callersMethod_build_assistant_text
(self, text: str)
qwen_tts/inference/qwen3_tts_model.py:269
↓ 3 callersMethod_merge_generate_kwargs
Merge user-provided generation arguments with defaults from `generate_config.json`. Rule: - If the user explicitly passes
qwen_tts/inference/qwen3_tts_model.py:287
↓ 3 callersMethod_validate_languages
Validate that requested languages are supported by the model. Args: languages (List[str]): Language names for each sampl
qwen_tts/inference/qwen3_tts_model.py:141
↓ 3 callersMethodgenerate_custom_voice
Generate speech with the CustomVoice model using a predefined speaker id, optionally controlled by instruction text. Args:
qwen_tts/inference/qwen3_tts_model.py:732
↓ 3 callersMethodgenerate_voice_design
Generate speech with the VoiceDesign model using natural-language style instructions. Args: text: Text(s
qwen_tts/inference/qwen3_tts_model.py:637
↓ 3 callersMethodqkv_attention_manual
( self, q: Tensor, k: Tensor, v: Tensor, cu_seqlens: Tensor )
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:214
↓ 2 callersMethod__init__
(self, audio_codec_with_xvector)
qwen_tts/core/tokenizer_25hz/vq/speech_vq.py:119
↓ 2 callersMethod__init__
( self, n_mels: int, n_ctx: int, n_state: int, n_h
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:289
↓ 2 callersMethod__init__
( self, talker_config=None, speaker_encoder_config=None, tokenizer_type=None,
qwen_tts/core/models/configuration_qwen3_tts.py:465
↓ 2 callersFunction_audio_to_tuple
(audio: Any)
qwen_tts/cli/demo.py:224
↓ 2 callersFunction_build_choices_and_map
(items: Optional[List[str]])
qwen_tts/cli/demo.py:39
↓ 2 callersMethod_build_instruct_text
(self, instruct: str)
qwen_tts/inference/qwen3_tts_model.py:275
↓ 2 callersMethod_compute_statistics
(self, x, m, dim=2)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:261
↓ 2 callersMethod_compute_statistics
(self, x, m, dim=2)
qwen_tts/core/models/modeling_qwen3_tts.py:209
↓ 2 callersMethod_conv_forward
( self, x: Tensor, weight: Tensor, bias: Optional[Tensor] )
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:139
↓ 2 callersFunction_normalize_audio
(wav, eps=1e-12, clip=True)
qwen_tts/cli/demo.py:192
↓ 2 callersMethod_prompt_items_to_voice_clone_prompt
(self, items: List[VoiceClonePromptItem])
qwen_tts/inference/qwen3_tts_model.py:460
↓ 2 callersMethod_supported_languages_set
(self)
qwen_tts/inference/qwen3_tts_model.py:123
↓ 2 callersMethod_supported_speakers_set
(self)
qwen_tts/inference/qwen3_tts_model.py:132
↓ 2 callersFunctionapply_interleaved_rope
(x, modality_num)
qwen_tts/core/models/modeling_qwen3_tts.py:694
↓ 2 callersMethoddequantize
(self, embed_ind)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:196
↓ 2 callersFunctionema_inplace
(moving_avg, new, decay: float)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:52
↓ 2 callersMethodextract
(self, audio, **kwargs)
qwen_tts/core/tokenizer_25hz/vq/speech_vq.py:92
↓ 2 callersMethodget_input_embeddings
(self)
qwen_tts/core/models/modeling_qwen3_tts.py:1591
↓ 2 callersFunctionkaiser_sinc_filter1d
Generates a 1D Kaiser-windowed sinc filter. Args: cutoff (float): Normalized cutoff frequency (0 to 0.5). half_width (float): Tra
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:739
↓ 2 callersFunctionlog_mel_spectrogram
Compute the log-Mel spectrogram of Parameters ---------- audio: Union[str, np.ndarray, torch.Tensor], shape = (*) The path t
qwen_tts/core/tokenizer_25hz/vq/whisper_encoder.py:62
↓ 2 callersFunctionmel_spectrogram
Calculate the mel spectrogram of an input signal. This function uses slaney norm for the librosa mel filterbank (using librosa.filters.mel) a
qwen_tts/core/models/modeling_qwen3_tts.py:399
↓ 2 callersFunctionpostprocess_emb
(embed_ind, shape)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:109
↓ 2 callersFunctionpreprocess
(x)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:104
↓ 2 callersMethodquantize
(self, x)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:186
↓ 2 callersFunctionrepeat_kv
This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:109
↓ 2 callersFunctionrepeat_kv
This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
qwen_tts/core/models/modeling_qwen3_tts.py:622
↓ 2 callersFunctionrotate_half
Rotates half the hidden dims of the input.
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:75
↓ 2 callersFunctionrotate_half_codec
(x)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:556
↓ 2 callersFunctionsample_vectors
(samples, num: int)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:66
↓ 1 callersMethod__init__
( self, encoder_config=None, decoder_config=None, encoder_valid_num_quantizers
qwen_tts/core/tokenizer_12hz/configuration_qwen3_tts_tokenizer_v2.py:143
↓ 1 callersMethod_build_assistant_text
(self, text: str)
finetuning/dataset.py:91
↓ 1 callersMethod_build_ref_text
(self, text: str)
qwen_tts/inference/qwen3_tts_model.py:272
↓ 1 callersMethod_calc_quantize_activities
(self, indices)
qwen_tts/core/tokenizer_25hz/vq/speech_vq.py:230
↓ 1 callersFunction_collect_gen_kwargs
(args: argparse.Namespace)
qwen_tts/cli/demo.py:178
↓ 1 callersMethod_create_block_diff
(self, hidden_states)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1104
↓ 1 callersMethod_decode_base64_to_wav_bytes
(self, b64: str)
qwen_tts/inference/qwen3_tts_model.py:202
↓ 1 callersMethod_decode_base64_to_wav_bytes
(self, b64: str)
qwen_tts/inference/qwen3_tts_tokenizer.py:116
↓ 1 callersFunction_detect_model_kind
(ckpt: str, tts: Qwen3TTSModel)
qwen_tts/cli/demo.py:246
↓ 1 callersMethod_do_quantize
x: torch.Tensor, shape = (T, D) q: torch.Tensor, shape = (T, D) i: torch.Tensor, shape = (T)
qwen_tts/core/tokenizer_25hz/vq/speech_vq.py:239
↓ 1 callersFunction_dtype_from_str
(s: str)
qwen_tts/cli/demo.py:47
↓ 1 callersMethod_ensure_list
(self, x: MaybeList)
finetuning/dataset.py:94
↓ 1 callersMethod_get_extra_padding_for_conv1d
(self, hidden_state: torch.Tensor)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:183
↓ 1 callersMethod_is_probably_base64
(self, s: str)
qwen_tts/inference/qwen3_tts_model.py:188
↓ 1 callersMethod_is_probably_base64
(self, s: str)
qwen_tts/inference/qwen3_tts_tokenizer.py:101
↓ 1 callersMethod_is_url
(self, s: str)
qwen_tts/inference/qwen3_tts_model.py:195
↓ 1 callersMethod_is_url
(self, s: str)
qwen_tts/inference/qwen3_tts_tokenizer.py:109
↓ 1 callersMethod_length_to_mask
Creates a binary mask for each sequence. Reference: https://discuss.pytorch.org/t/how-to-generate-variable-length-mask/23397/3 Argum
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:230
↓ 1 callersMethod_length_to_mask
Creates a binary mask for each sequence. Reference: https://discuss.pytorch.org/t/how-to-generate-variable-length-mask/23397/3 Argum
qwen_tts/core/models/modeling_qwen3_tts.py:178
↓ 1 callersMethod_load_audio_to_np
(self, x: str)
finetuning/dataset.py:43
↓ 1 callersMethod_load_audio_to_np
(self, x: str)
qwen_tts/inference/qwen3_tts_model.py:207
↓ 1 callersMethod_normalize_audio_inputs
Normalize audio inputs into a list of (waveform, sr). Supported forms: - str: wav path / URL / base64 audio string
finetuning/dataset.py:52
↓ 1 callersMethod_normalize_audio_inputs
Normalize audio inputs into a list of (waveform, sr). Supported forms: - str: wav path / URL / base64 audio string
qwen_tts/inference/qwen3_tts_model.py:225
↓ 1 callersMethod_normalize_audio_inputs
Normalize all supported input types into a list of 1-D numpy float32 waveforms at `self.feature_extractor.sampling_rate`. Ar
qwen_tts/inference/qwen3_tts_tokenizer.py:160
↓ 1 callersFunction_resolve_checkpoint
(args: argparse.Namespace)
qwen_tts/cli/demo.py:171
↓ 1 callersFunction_title_case_display
(s: str)
qwen_tts/cli/demo.py:33
↓ 1 callersMethod_tokenize_texts
(self, text)
finetuning/dataset.py:97
↓ 1 callersMethod_update_model_kwargs_for_generation
(self, outputs, model_kwargs, is_encoder_decoder=False, num_new_tokens=1)
qwen_tts/core/models/modeling_qwen3_tts.py:1802
↓ 1 callersMethod_validate_speakers
Validate that requested speakers are supported by the Instruct model. Args: speakers (List[Optional[str]]): Speaker name
qwen_tts/inference/qwen3_tts_model.py:165
↓ 1 callersMethodamplitude_to_db
(self, amplitude, min_db_level)
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:1041
↓ 1 callersFunctionapply_multimodal_rotary_pos_emb
Applies Rotary Position Embedding with Multimodal Sections to the query and key tensors (https://qwenlm.github.io/blog/qwen2-vl/). Explanation:
qwen_tts/core/models/modeling_qwen3_tts.py:660
↓ 1 callersFunctionapply_rotary_pos_emb
Applies Rotary Position Embedding to the query and key tensors. Args: q (`torch.Tensor`): The query tensor. k (`torch.Tensor`): T
qwen_tts/core/tokenizer_25hz/modeling_qwen3_tts_tokenizer_v1.py:535
↓ 1 callersFunctionapply_rotary_pos_emb
Applies Rotary Position Embedding to the query and key tensors. Args: q (`torch.Tensor`): The query tensor. k (`torch.Tensor`): T
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:82
↓ 1 callersFunctionapply_rotary_pos_emb
Applies Rotary Position Embedding to the query and key tensors. Args: q (`torch.Tensor`): The query tensor. k (`torch.Tensor`): T
qwen_tts/core/models/modeling_qwen3_tts.py:858
↓ 1 callersFunctionbuild_demo
(tts: Qwen3TTSModel, ckpt: str, gen_kwargs_default: Dict[str, Any])
qwen_tts/cli/demo.py:254
↓ 1 callersFunctionbuild_parser
()
qwen_tts/cli/demo.py:62
↓ 1 callersMethodchunked_decode
(self, codes, chunk_size=300, left_context_size=25)
qwen_tts/core/tokenizer_12hz/modeling_qwen3_tts_tokenizer_v2.py:886
↓ 1 callersFunctiondefault
(val: tp.Any, d: tp.Any)
qwen_tts/core/tokenizer_25hz/vq/core_vq.py:48
↓ 1 callersFunctiondownload_weights_from_hf_specific
Download model weights from Hugging Face Hub. Users can specify the allow_patterns to download only the necessary weights. Args: mode
qwen_tts/core/models/modeling_qwen3_tts.py:55
↓ 1 callersFunctiondynamic_range_compression_torch
(x, C=1, clip_val=1e-5)
qwen_tts/core/tokenizer_25hz/vq/speech_vq.py:35
↓ 1 callersFunctiondynamic_range_compression_torch
(x, C=1, clip_val=1e-5)
qwen_tts/core/models/modeling_qwen3_tts.py:396
↓ 1 callersFunctionensure_dir
(d: str)
examples/test_model_12hz_base.py:24
next →1–100 of 375, ranked by callers