MCPcopy Create free account

hub / github.com/FireRedTeam/FireRedTTS2 / functions

Functions168 in github.com/FireRedTeam/FireRedTTS2

↓ 34 callersFunctioni18n
(key)
gradio_demo.py:119
↓ 12 callersMethodforward_chunk
Forward only one frame. Args: spec: shape (B, N, T=chunk_size) cache: previous chunk's last ifft frame, shape (B, N,
fireredtts2/codec/decoder.py:407
↓ 9 callersFunctionclean_text
(text)
fireredtts2/utils/spliter.py:59
↓ 8 callersMethod__init__
( self, n_fft: int, hop_length: int, win_length: int, padding: str = "same" )
fireredtts2/codec/decoder.py:338
↓ 6 callersMethod_shape
(self, tensor: torch.Tensor, seq_len: int, bsz: int)
fireredtts2/codec/whisper.py:42
↓ 6 callersFunctioncheck_monologue_text
(text: str, prefix: str = None)
gradio_demo.py:124
↓ 5 callersMethodencode
Args: audio16k: shape (b, t) audio16k_length: (b,) Returns: token: shape (b, nq, l) t
fireredtts2/codec/model.py:245
↓ 5 callersMethodreset_caches
(self)
fireredtts2/llm/llm.py:307
↓ 5 callersFunctionutf_8_len
(text)
fireredtts2/utils/spliter.py:76
↓ 4 callersFunctionWNConv1d
(*args, **kwargs)
fireredtts2/codec/rvq.py:8
↓ 4 callersMethod__init__
( self, in_dim: int, embed_dim: int, num_layers: int, num_heads: int,
fireredtts2/codec/whisper.py:196
↓ 4 callersMethod__init__
( self, embed_dim: int = 768, stride: int = 4, )
fireredtts2/codec/model.py:124
↓ 4 callersFunction_create_causal_mask
(seq_len: int, device: torch.device)
fireredtts2/llm/llm.py:16
↓ 4 callersMethod_tokenize_segment
Returns: (seq_len,17), (seq_len, 17)
fireredtts2/fireredtts2.py:124
↓ 4 callersMethoddecode_one_token
Decode one single token to audio. Args: token: (B=1, nq, L=1) Returns: audio: (B=1, t)
fireredtts2/codec/model.py:327
↓ 4 callersMethodfrom_pretrained
(cls, conf_path: str, ckpt_path: str)
fireredtts2/codec/model.py:211
↓ 4 callersMethodgenerate_frame
Args: tokens: (batch_size, seq_len, audio_num_codebooks+1) tokens_mask: (batch_size, seq_len, audio_num_codebooks+1)
fireredtts2/llm/llm.py:249
↓ 4 callersFunctionmake_nonpad_mask
(lengths: torch.Tensor, max_len: int = 0)
fireredtts2/codec/utils.py:15
↓ 4 callersMethodprepare_prompt
(self, text, speaker, audio_path)
fireredtts2/fireredtts2.py:75
↓ 3 callersMethod_tokenize_text_segment
( self, text: str, speaker: str )
fireredtts2/fireredtts2.py:79
↓ 3 callersFunctionbreak_text
(texts, length, splits: set)
fireredtts2/utils/spliter.py:80
↓ 3 callersFunctionhertz_to_mel
( freq: Union[float, np.ndarray], mel_scale: str = "htk" )
fireredtts2/codec/audio.py:24
↓ 2 callersMethod_embed_audio
(self, codebook: int, tokens: torch.Tensor)
fireredtts2/llm/llm.py:311
↓ 2 callersMethod_embed_tokens
(self, tokens: torch.Tensor)
fireredtts2/llm/llm.py:314
↓ 2 callersFunction_index_causal_mask
Args: mask: (max_seq_len, max_seq_len) input_pos: (batch_size, seq_len) Returns: (batch_size, seq_len, max_seq_len)
fireredtts2/llm/llm.py:20
↓ 2 callersFunction_multinomial_sample_one_no_sync
(probs)
fireredtts2/llm/llm.py:34
↓ 2 callersFunction_prepare_transformer
(model)
fireredtts2/llm/llm.py:9
↓ 2 callersFunctionadd_cleaned
(curr, segments)
fireredtts2/utils/spliter.py:116
↓ 2 callersFunctioncount_characters_chinese
统计中文字符数量
fireredtts2/utils/spliter.py:176
↓ 2 callersFunctioncount_words_english
统计英文单词数量
fireredtts2/utils/spliter.py:171
↓ 2 callersMethoddecode
Args: tokens: (B=1, nq, L) Returns: audio: (B=1, t)
fireredtts2/codec/model.py:308
↓ 2 callersMethoddecode_code
(self, embed_id)
fireredtts2/codec/rvq.py:56
↓ 2 callersMethoddecode_codes
Decode codes from multiple quantizers to embeddings. Args: codes: Tensor of shape (nq, B, T) containing code indices for each qua
fireredtts2/codec/rvq.py:145
↓ 2 callersMethodforward
Compute the Inverse Short Time Fourier Transform (ISTFT) of a complex spectrogram. Args: spec (Tensor): Input complex sp
fireredtts2/codec/decoder.py:350
↓ 2 callersMethodforward
( self, hidden_states: torch.Tensor, hidden_length: torch.Tensor, apply_positi
fireredtts2/codec/whisper.py:234
↓ 2 callersMethodgenerate
( self, text: str, speaker: str, context: List[Segment], max_audio_len
fireredtts2/fireredtts2.py:139
↓ 2 callersMethodgenerate
( self, text: str, speaker: str, context: List[Segment], max_audio_len
fireredtts2/fireredtts2.py:385
↓ 2 callersFunctioninit_weights
Initialize the weights of the model. - Xavier uniform initialization for linear layers - Normal initialization for embeddings - Xavie
fireredtts2/llm/utils.py:199
↓ 2 callersFunctionload_custom_tokenizer
(qwen2_tokenizer_path: str)
fireredtts2/llm/utils.py:190
↓ 2 callersFunctionprocess_text_list
(text_list)
fireredtts2/utils/spliter.py:279
↓ 2 callersFunctionsample_topk
(logits: torch.Tensor, topk: int, temperature: float)
fireredtts2/llm/llm.py:39
↓ 2 callersFunctionsplit_text
(text, length)
fireredtts2/utils/spliter.py:132
↓ 1 callersMethod__init__
( self, input_dim: int = 768, # Input dimension, unrelated to RVQ rvq_dim=None, # RV
fireredtts2/codec/rvq.py:93
↓ 1 callersMethod_create_bins
(self, lengths: List[int], batch_size: int)
bin/finetune_example/posttrain_dataloader.py:251
↓ 1 callersFunction_create_triangular_filter_bank
Creates a triangular filter bank. Adapted from *torchaudio* and *librosa*. Args: fft_freqs (`np.ndarray` of shape `(num_frequen
fireredtts2/codec/audio.py:78
↓ 1 callersMethod_encode_one_batch
(self, audio16k: torch.Tensor)
fireredtts2/codec/model.py:218
↓ 1 callersFunction_load_one_audio
(audio_path: str)
bin/finetune_example/data_preparation/step2_extract_token.py:48
↓ 1 callersMethod_pad_and_chunk
(audio: torch.Tensor, chunk_size: int)
fireredtts2/codec/model.py:238
↓ 1 callersMethod_shuffle_bins
(self, epoch: int)
bin/finetune_example/posttrain_dataloader.py:266
↓ 1 callersMethod_tokenize_audio
(self, audio: torch.Tensor)
fireredtts2/fireredtts2.py:97
↓ 1 callersFunctionbreak_text_by_length
(texts, length)
fireredtts2/utils/spliter.py:98
↓ 1 callersFunctioncheck_dialogue_text
(text_list: List[str])
gradio_demo.py:139
↓ 1 callersFunctioncontains_chinese
检测文本是否包含中文字符
fireredtts2/utils/spliter.py:166
↓ 1 callersFunctioncreate_dataloaders
( train_datasets: str, validation_datasets: str, batch_size: int, device, # for debug inf
bin/finetune_example/posttrain_dataloader.py:288
↓ 1 callersFunctioncreate_meta
_summary_ Args: data_dir (_type_): LJspeech root path out_jsonl (_type_): output meta
bin/finetune_example/data_preparation/step1_create_meta.py:29
↓ 1 callersMethodencode_code
(self, z: torch.Tensor)
fireredtts2/codec/rvq.py:62
↓ 1 callersMethodencode_codes
(self, z: torch.Tensor)
fireredtts2/codec/rvq.py:132
↓ 1 callersMethodextract_fbank
Args: audio: batched audio of shape (b, t)
fireredtts2/codec/whisper.py:304
↓ 1 callersFunctionextract_tokens
_summary_ Args: jsonl (_type_): _description_ pretrained_dir (_type_): _description_
bin/finetune_example/data_preparation/step2_extract_token.py:54
↓ 1 callersMethodforward
(self, x: torch.Tensor, input_length: torch.Tensor)
fireredtts2/codec/model.py:142
↓ 1 callersMethodforward_upsample_conv_chunk
Stream forward upsample_conv module with previous block cache. Args: x: shape (B, C, T) cache: shape (B, C, 3), where
fireredtts2/codec/decoder.py:624
↓ 1 callersMethodfrom_config
(cls, config_json: str)
fireredtts2/codec/model.py:174
↓ 1 callersMethodgenerate_dialogue
( self, text_list, prompt_wav_list=None, prompt_text_list=None, temper
fireredtts2/fireredtts2.py:267
↓ 1 callersMethodgenerate_single
( self, context: List[Segment], temperature: float = 0.9, topk: int = 20 )
fireredtts2/fireredtts2.py:210
↓ 1 callersMethodgenerate_single
( self, context: List[Segment], temperature: float = 0.9, topk: int = 20 )
fireredtts2/fireredtts2.py:467
↓ 1 callersFunctionget_args
()
gradio_demo.py:349
↓ 1 callersFunctionget_grad_norm
(model)
fireredtts2/llm/utils.py:316
↓ 1 callersFunctionget_index
_summary_ Args: audio_segment_len (_type_): _description_ text_segment_len (_type_): _description_
bin/finetune_example/posttrain_dataloader.py:67
↓ 1 callersFunctionget_speaker_dict
_summary_ Args: segment (_type_): _description_
bin/finetune_example/data_preparation/step3_write_arrow.py:42
↓ 1 callersFunctionget_uttrid2path
_summary_ Args: wav_dir (_type_): _description_
bin/finetune_example/data_preparation/step1_create_meta.py:13
↓ 1 callersFunctioninitiate_model
(pretrained_dir: str, device="cuda")
gradio_demo.py:16
↓ 1 callersFunctioninterleave
_summary_ Args: audio_tokens_flatten (_type_): _description_ text_tokens (_type_): _description_ audio_segment_len (_type
bin/finetune_example/posttrain_dataloader.py:94
↓ 1 callersFunctionload_llm_model
Load model, add forward method, and move to device. Args: model_name_or_checkpoint_path: Name or path of pretrained model or checkpoint.
fireredtts2/llm/utils.py:261
↓ 1 callersFunctionload_model
Load model, add forward method, and move to device. Args: model_name_or_checkpoint_path: Name or path of pretrained model or checkpoint.
fireredtts2/llm/utils.py:225
↓ 1 callersMethodload_prompt_audio
(self, audio_path)
fireredtts2/fireredtts2.py:67
↓ 1 callersFunctionmake_block_causal_mask
( lengths: torch.Tensor, max_len: int = 0, chunk_size: int = 4 )
fireredtts2/codec/utils.py:19
↓ 1 callersFunctionmake_pad_mask
(lengths: torch.Tensor, max_len: int = 0)
fireredtts2/codec/utils.py:5
↓ 1 callersFunctionmel_filter_bank
( num_frequency_bins: int, num_mel_filters: int, min_frequency: float, max_frequency: float,
fireredtts2/codec/audio.py:102
↓ 1 callersFunctionmel_to_hertz
( mels: Union[float, np.ndarray], mel_scale: str = "htk" )
fireredtts2/codec/audio.py:51
↓ 1 callersFunctionmerge_sentences_chinese
合并中文句子
fireredtts2/utils/spliter.py:237
↓ 1 callersFunctionmerge_sentences_english
合并英文句子
fireredtts2/utils/spliter.py:215
↓ 1 callersFunctionpack
pack .arrow Args: jsonl (_type_): _description_ pretrained_dir (_type_): _description_ dataset_dir (_type_): _description
bin/finetune_example/data_preparation/step3_write_arrow.py:58
↓ 1 callersFunctionprocess_text
(text)
fireredtts2/utils/spliter.py:259
↓ 1 callersFunctionread_jsonl
(path)
bin/finetune_example/data_preparation/step3_write_arrow.py:31
↓ 1 callersFunctionread_jsonl
(path)
bin/finetune_example/data_preparation/step2_extract_token.py:33
↓ 1 callersFunctionrecovery_debug
_summary_ Args: audio_tokens_flatten (_type_): _description_ text_tokens (_type_): _description_ audio_segment_len (_type
bin/finetune_example/data_preparation/step3_write_arrow.py:157
↓ 1 callersFunctionrender_interface
()
gradio_demo.py:202
↓ 1 callersMethodsetup_caches
Setup KV caches and return a causal mask.
fireredtts2/llm/llm.py:117
↓ 1 callersFunctionsinusoids
Returns sinusoids for positional embedding
fireredtts2/codec/whisper.py:11
↓ 1 callersFunctionsplit_by_punctuation_chinese
按中文标点符号分割
fireredtts2/utils/spliter.py:198
↓ 1 callersFunctionsplit_by_punctuation_english
按英文标点符号分割
fireredtts2/utils/spliter.py:181
↓ 1 callersFunctionsummarize
( writer, global_step, scalars={}, histograms={}, images={}, audios={}, audio_samp
fireredtts2/llm/utils.py:297
↓ 1 callersFunctiontrain
trial is only used when we are sweeping hyperparameters.
bin/finetune_example/posttrain.py:22
FunctionWNConvTranspose1d
(*args, **kwargs)
fireredtts2/codec/rvq.py:12
Method__call__
(self, audio16k: torch.Tensor, audio16k_length: torch.Tensor)
fireredtts2/codec/whisper.py:325
Method__getitem__
(self, idx: int)
bin/finetune_example/posttrain_dataloader.py:47
Method__init__
_summary_ Args: dataset_dir (str): _description_ device (_type_): for debug
bin/finetune_example/posttrain_dataloader.py:26
Method__init__
( self, lengths: List[int], batch_size: int, shuffle: bool = True, is_
bin/finetune_example/posttrain_dataloader.py:236
Method__init__
(self, pretrained_dir, gen_type, device, use_bf16=False)
fireredtts2/fireredtts2.py:16
Method__init__
(self, config: ModelArgs)
fireredtts2/llm/llm.py:87
next →1–100 of 168, ranked by callers