MCPcopy Create free account

hub / github.com/MoonshotAI/Kimi-Audio / functions

Functions236 in github.com/MoonshotAI/Kimi-Audio

↓ 16 callersMethodaudio_append
(self, index: int, is_continuous: bool = False, audio_token_loss_mask: bool = False)
kimia_infer/utils/data.py:17
↓ 13 callersMethodfrom_pretrained
(cls, model_config, ckpt_path, device)
kimia_infer/models/detokenizer/bigvgan_wrapper.py:99
↓ 10 callersMethoddetokenize_streaming
( self, semantic_token, ode_step=30, verbose=False, ode_solver="neural
kimia_infer/models/detokenizer/__init__.py:122
↓ 10 callersMethodtext_append
(self, index: int, text_token_loss_mask: bool = False)
kimia_infer/utils/data.py:22
↓ 8 callersMethodclear_states
(self)
kimia_infer/models/detokenizer/__init__.py:254
↓ 8 callersMethodload_state_dict
(self, state_dict)
kimia_infer/models/detokenizer/flow_matching/ode_wrapper.py:71
↓ 7 callersMethod_shape
(self, tensor: torch.Tensor, seq_len: int, bsz: int)
kimia_infer/models/tokenizer/whisper_Lv3/modeling_whisper.py:320
↓ 7 callersMethodstate_dict
(self)
kimia_infer/models/detokenizer/flow_matching/ode_wrapper.py:60
↓ 6 callersMethod__init__
(self, config: WhisperConfig)
kimia_infer/models/tokenizer/whisper_Lv3/modeling_whisper.py:1465
↓ 6 callersMethodaudio_extend
(self, ids: list[int], is_continuous: bool = False, audio_token_loss_mask: bool = False)
kimia_infer/utils/data.py:26
↓ 6 callersMethodtext_extend
(self, ids: list[int], text_token_loss_mask: bool = False)
kimia_infer/utils/data.py:31
↓ 5 callersMethod__init__
(self, config)
finetune_codes/modeling_kimia.py:520
↓ 5 callersMethodgenerate
( self, chats: list[dict], output_type="text", audio_temperature=0.0,
kimia_infer/api/kimia.py:210
↓ 3 callersMethod_tokenize_audio
(self, wav_path)
kimia_infer/api/prompt_manager.py:53
↓ 3 callersMethodclear_all_states
(self)
kimia_infer/models/detokenizer/flow_matching/ode_wrapper.py:50
↓ 3 callersFunctionget_padding
(kernel_size, dilation=1)
kimia_infer/models/detokenizer/vocoder/utils.py:109
↓ 3 callersFunctionmodulate
(x, shift, scale)
kimia_infer/models/detokenizer/flow_matching/dit_block.py:179
↓ 3 callersMethodset_conditions
(self, x_mask, x_cond, start_position_id, cache={})
kimia_infer/models/detokenizer/flow_matching/ode_wrapper.py:80
↓ 3 callersMethodupdate_incremental_state
(self)
kimia_infer/models/detokenizer/semantic_fm_prefix_streaming.py:233
↓ 2 callersMethod__init__
( self, hidden_size, num_heads, mlp_ratio=4.0, ffn_type="conv1d_conv1d
kimia_infer/models/detokenizer/flow_matching/dit_block.py:208
↓ 2 callersMethod__init__
( self, input_size, output_size, semantic_vocab_size, hidden_size=1024
kimia_infer/models/detokenizer/flow_matching/model.py:176
↓ 2 callersMethod__init__
(self, h: AttrDict, use_cuda_kernel: bool = False)
kimia_infer/models/detokenizer/vocoder/bigvgan.py:258
↓ 2 callersFunction_compute_mask_indices
Computes random mask spans for a given shape. Used to implement [SpecAugment: A Simple Data Augmentation Method for ASR](https://arxiv.org/ab
kimia_infer/models/tokenizer/whisper_Lv3/modeling_whisper.py:150
↓ 2 callersMethod_set_cos_sin_cache
(self, seq_len, device, dtype)
finetune_codes/modeling_kimia.py:209
↓ 2 callersMethod_tokenize_text
(self, text)
kimia_infer/api/prompt_manager.py:47
↓ 2 callersFunctioncompute_num_masked_span
Given input length, compute how many spans should be masked
kimia_infer/models/tokenizer/whisper_Lv3/modeling_whisper.py:188
↓ 2 callersMethoddecode_mel
params: mel: [T, num_mels], torch.tensor return: wav: [1, T], torch.tensor
kimia_infer/models/detokenizer/bigvgan_wrapper.py:76
↓ 2 callersMethodget_embedding
Build sinusoidal embeddings. This matches the implementation in tensor2tensor, but differs slightly from the description in Section 3
kimia_infer/models/detokenizer/flow_matching/model.py:103
↓ 2 callersFunctionget_melspec
Calculate the mel spectrogram of an input signal. This function uses slaney norm for the librosa mel filterbank (using librosa.filters.mel) a
kimia_infer/models/detokenizer/vocoder/utils.py:17
↓ 2 callersMethodinfer_chunk
semantic_tokens: [T_1], torch.LongTensor xt: [T_2, 80], torch.Tensor, DO NOT normalize it outside ode_steps: int, number of o
kimia_infer/models/detokenizer/semantic_fm_prefix_streaming.py:73
↓ 2 callersFunctioninstantiate_extra_tokens
(tokenizer)
kimia_infer/utils/special_tokens.py:25
↓ 2 callersMethodis_valid
(self)
kimia_infer/utils/data.py:70
↓ 2 callersFunctionkaiser_sinc_filter1d
( cutoff, half_width, kernel_size )
kimia_infer/models/detokenizer/vocoder/alias_free_activation/torch/filter.py:30
↓ 2 callersMethodmerge
(self, other: "KimiAContent")
kimia_infer/utils/data.py:53
↓ 2 callersMethodprefill
Arguments: timbre_speech: torch.Tensor, shape [B, N_speech_24k] timbre_semantic_token: torch.Tensor, shape [B, N]
kimia_infer/models/detokenizer/__init__.py:69
↓ 2 callersMethodprefill_chunk
mel_chunk: [T, 80], torch.Tensor, T is the chunk size semantic_tokens_chunk: [T], torch.LongTensor start_position_id: int, de
kimia_infer/models/detokenizer/semantic_fm_prefix_streaming.py:290
↓ 2 callersMethodto_tensor
(self)
kimia_infer/utils/data.py:61
↓ 2 callersMethodtokenize_message
( self, message, tokenize_role=True, has_ct_token=False, has_msg_end_t
kimia_infer/api/prompt_manager.py:78
↓ 2 callersMethodtokenize_message
( self, message, tokenize_role=True, has_ct_token=False, has_msg_end_t
finetune_codes/datasets.py:60
↓ 1 callersMethod__init__
(self)
kimia_infer/models/detokenizer/flow_matching/scheduler.py:13
↓ 1 callersMethod__init__
Initialization. INPUT: - in_features: shape of the input - alpha: trainable parameter alpha is in
kimia_infer/models/detokenizer/vocoder/activations.py:23
↓ 1 callersMethod__init__
(self, ratio=2, kernel_size=None)
kimia_infer/models/detokenizer/vocoder/alias_free_activation/torch/resample.py:11
↓ 1 callersFunction_cpp_extention_load_helper
(name, sources, extra_cuda_flags)
kimia_infer/models/detokenizer/vocoder/alias_free_activation/cuda/load.py:31
↓ 1 callersFunction_create_build_dir
(buildpath)
kimia_infer/models/detokenizer/vocoder/alias_free_activation/cuda/load.py:81
↓ 1 callersFunction_expand_mask
Expands attention_mask from `[bsz, seq_len]` to `[bsz, 1, tgt_seq_len, src_seq_len]`.
kimia_infer/models/tokenizer/whisper_Lv3/modeling_whisper.py:133
↓ 1 callersFunction_expand_mask
Expands attention_mask from `[bsz, seq_len]` to `[bsz, 1, tgt_seq_len, src_seq_len]`.
finetune_codes/modeling_kimia.py:174
↓ 1 callersMethod_flash_attention_forward
Calls the forward method of Flash Attention - if the input hidden states contain at least one padding token first unpad the input, th
finetune_codes/modeling_kimia.py:370
↓ 1 callersMethod_freeze_parameters
(self)
kimia_infer/models/tokenizer/whisper_Lv3/modeling_whisper.py:984
↓ 1 callersMethod_generate_loop
( self, audio_input_ids: torch.Tensor, # input audio tokens text_input_ids: torch.Ten
kimia_infer/api/kimia.py:52
↓ 1 callersFunction_get_cuda_bare_metal_version
(cuda_dir)
kimia_infer/models/detokenizer/vocoder/alias_free_activation/cuda/load.py:68
↓ 1 callersFunction_get_unpad_data
(padding_mask)
finetune_codes/modeling_kimia.py:84
↓ 1 callersMethod_init_rope
(self)
finetune_codes/modeling_kimia.py:265
↓ 1 callersFunction_make_causal_mask
Make causal mask used for bi-directional self-attention.
kimia_infer/models/tokenizer/whisper_Lv3/modeling_whisper.py:98
↓ 1 callersFunction_make_causal_mask
Make causal mask used for bi-directional self-attention.
finetune_codes/modeling_kimia.py:143
↓ 1 callersMethod_mask_input_features
Masks extracted features along time axis and/or along feature axis according to [SpecAugment](https://arxiv.org/abs/1904.08779).
kimia_infer/models/tokenizer/whisper_Lv3/modeling_whisper.py:1492
↓ 1 callersMethod_prepare_decoder_attention_mask
( self, attention_mask, input_shape, inputs_embeds, past_key_values_length )
kimia_infer/models/tokenizer/whisper_Lv3/modeling_whisper.py:1191
↓ 1 callersMethod_tokenize_text
(self, text)
finetune_codes/datasets.py:54
↓ 1 callersFunction_upad_input
(query_layer, key_layer, value_layer, padding_mask, query_length)
finetune_codes/modeling_kimia.py:98
↓ 1 callersFunctionapply_rotary_emb
( xq: torch.Tensor, xk: torch.Tensor, freqs_cis: torch.Tensor, )
kimia_infer/models/detokenizer/flow_matching/dit_block.py:28
↓ 1 callersMethoddetokenize_audio
(self, audio_tokens)
kimia_infer/api/kimia.py:284
↓ 1 callersMethoddetokenize_text
(self, text_tokens)
kimia_infer/api/kimia.py:316
↓ 1 callersMethoddownload
(self)
finetune_codes/demo_data/audio_understanding/prepare_librispeech_asrtask.py:13
↓ 1 callersFunctiondynamic_range_compression_torch
(x, C=1, clip_val=1e-5)
kimia_infer/models/detokenizer/vocoder/utils.py:9
↓ 1 callersMethodexport_model
(input_dir, output_dir)
finetune_codes/model.py:49
↓ 1 callersMethodextract_mel_from_wav
params: wav_path: str, path of the wav, should be 24k wav_data: torch.tensor or numpy array, shape [T], wav data, sho
kimia_infer/models/detokenizer/bigvgan_wrapper.py:28
↓ 1 callersFunctionextract_speech_token
(model: WhisperVQEncoder, feature_extractor: WhisperFeatureExtractor, utts)
kimia_infer/models/tokenizer/glm4_utils.py:40
↓ 1 callersMethodextract_whisper_feat
(self, wav: torch.Tensor | str)
kimia_infer/api/prompt_manager.py:59
↓ 1 callersMethodextract_whisper_feat
(self, wav: str)
finetune_codes/datasets.py:34
↓ 1 callersMethodforward
(self, x)
kimia_infer/models/detokenizer/vocoder/bigvgan.py:352
↓ 1 callersMethodforward
(self, x)
kimia_infer/models/detokenizer/vocoder/alias_free_activation/cuda/activation1d.py:54
↓ 1 callersMethodforward
(self, audio, kimia_whisper_clip_silence=False)
kimia_infer/models/tokenizer/whisper_Lv3/whisper.py:178
↓ 1 callersMethodforward_flash_attn
hidden_states: [bsz, tgt_len, embed_dim] seq_lens: Optinal, [bsz]
kimia_infer/models/tokenizer/whisper_Lv3/modeling_whisper.py:327
↓ 1 callersMethodfrom_pretrained
( cls, vocoder_config, vocoder_ckpt, fm_config, fm_ckpt, devic
kimia_infer/models/detokenizer/__init__.py:37
↓ 1 callersFunctionget_audio_detokenizer
(model_path)
kimia_infer/models/detokenizer/__init__.py:261
↓ 1 callersFunctionget_cached_zeros
(numel, device="cpu", dtype=torch.float32)
kimia_infer/models/detokenizer/flow_matching/ode_wrapper.py:8
↓ 1 callersMethodget_prompt
messages: List[Dict] messages[i] = { "role": "user" | "assistant" | "system", "content": str }
kimia_infer/api/prompt_manager.py:170
↓ 1 callersMethodinit_from_pretrained
(cls, model_name_or_path, model_load_kwargs)
finetune_codes/model.py:19
↓ 1 callersMethodinitialize_weights
(self)
kimia_infer/models/detokenizer/flow_matching/model.py:262
↓ 1 callersFunctionload_audio
Open an audio file and read as mono waveform, resampling as necessary Parameters ---------- file: str The audio file to open
kimia_infer/models/tokenizer/whisper_Lv3/whisper.py:43
↓ 1 callersFunctionload_checkpoint
(filepath, device)
kimia_infer/models/detokenizer/vocoder/utils.py:95
↓ 1 callersFunctionload_hparams_from_json
(path)
kimia_infer/models/detokenizer/vocoder/bigvgan.py:25
↓ 1 callersMethodload_state_dict
(self, state_dict)
kimia_infer/models/detokenizer/semantic_fm_prefix_streaming.py:227
↓ 1 callersFunctionlog_mel_spectrogram
Compute the log-Mel spectrogram of Parameters ---------- audio: Union[str, np.ndarray, torch.Tensor], shape = (*) The path t
kimia_infer/models/tokenizer/whisper_Lv3/whisper.py:117
↓ 1 callersMethodmake_positions
Replace non-padding symbols with their position numbers. Position numbers begin at padding_idx+1. Padding symbols are ignored.
kimia_infer/models/detokenizer/flow_matching/model.py:158
↓ 1 callersFunctionmake_supervised_data_module
Make dataset and collator for supervised fine-tuning.
finetune.py:91
↓ 1 callersFunctionmel_filters
load the mel filterbank matrix for projecting STFT into a Mel spectrogram. Allows decoupling librosa dependency; saved using: np.sav
kimia_infer/models/tokenizer/whisper_Lv3/whisper.py:100
↓ 1 callersFunctionpad_or_trim
Pad or trim the audio array to N_SAMPLES, as expected by the encoder.
kimia_infer/models/tokenizer/whisper_Lv3/whisper.py:73
↓ 1 callersFunctionprecompute_freqs_cis
( dim: int, end: int, theta: float = 10000.0, interpolation_factor: int = 1, max_seq_lengt
kimia_infer/models/detokenizer/flow_matching/model.py:7
↓ 1 callersFunctionrank0_print
(*args)
finetune.py:73
↓ 1 callersMethodremove_weight_norm
(self)
kimia_infer/models/detokenizer/vocoder/bigvgan.py:380
↓ 1 callersFunctionreshape_for_broadcast
(freqs_cis: torch.Tensor, x: torch.Tensor)
kimia_infer/models/detokenizer/flow_matching/dit_block.py:12
↓ 1 callersFunctionsafe_save_model_for_hf_trainer
Collects the state dict and dump to disk.
finetune.py:78
↓ 1 callersMethodsample
(self, ode_wrapper, time_steps, xt, verbose=False, x0=None)
kimia_infer/models/detokenizer/flow_matching/scheduler.py:55
↓ 1 callersMethodsample_audio_logits
Sample from audio logits with top-k, temperature and repetition penalty. Args: logits: Logits tensor of shape [batch_size, seq_le
kimia_infer/utils/sampler.py:26
↓ 1 callersMethodsample_by_neuralode
(self, ode_wrapper, time_steps, xt, verbose=False, x0=None)
kimia_infer/models/detokenizer/flow_matching/scheduler.py:70
↓ 1 callersMethodsample_text_logits
Sample from text logits with top-k, temperature and repetition penalty. Args: logits: Logits tensor of shape [batch_size, seq_len
kimia_infer/utils/sampler.py:98
↓ 1 callersMethodset_timesteps
(self)
kimia_infer/models/detokenizer/flow_matching/scheduler.py:17
↓ 1 callersFunctionsinc
Implementation of sinc, i.e. sin(pi * x) / (pi * x) __Warning__: Different to julius.sinc, the input is multiplied by `pi`!
kimia_infer/models/detokenizer/vocoder/alias_free_activation/torch/filter.py:15
↓ 1 callersFunctionspectral_normalize_torch
(magnitudes)
kimia_infer/models/detokenizer/vocoder/utils.py:13
↓ 1 callersMethodtimestep_embedding
Create sinusoidal timestep embeddings. :param t: a 1-D Tensor of N indices, one per batch element. These ma
kimia_infer/models/detokenizer/flow_matching/model.py:51
next →1–100 of 236, ranked by callers