MCPcopy Create free account

hub / github.com/VITA-MLLM/VITA-Audio / functions

Functions566 in github.com/VITA-MLLM/VITA-Audio

↓ 1 callersMethod_get_local_indices
(total_size, world_size, rank)
evaluation/evaluate_seedtts.py:166
↓ 1 callersMethod_get_local_indices
(total_size, world_size, rank)
evaluation/evaluate_asr.py:136
↓ 1 callersMethod_get_local_indices
(total_size, world_size, rank)
evaluation/evaluate_libritts.py:93
↓ 1 callersMethod_get_local_indices
(total_size, world_size, rank)
evaluation/evaluate_sqa.py:139
↓ 1 callersMethod_initialize_pool
(self, size, model_path)
web/pool.py:38
↓ 1 callersMethod_initialize_pool
(self, size, configs)
web/pool.py:78
↓ 1 callersFunction_launch_demo
(model, tokenizer, audio_tokenizer)
web_demo.py:64
↓ 1 callersFunction_parse_text
(text)
web_demo.py:32
↓ 1 callersMethod_prepare_4d_causal_attention_mask_with_cache_position
Creates a causal 4D mask of shape `(batch_size, 1, query_length, key_value_length)` from a 2D mask of shape `(batch_size, key_value_l
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/modeling_qwen2.py:775
↓ 1 callersMethod_prepare_4d_causal_attention_mask_with_cache_position
Creates a causal 4D mask of shape `(batch_size, 1, query_length, key_value_length)` from a 2D mask of shape `(batch_size, key_value_l
vita_audio/models/qwen2_v4_48_3/modeling_qwen2.py:674
↓ 1 callersMethod_prepare_4d_causal_attention_mask_with_cache_position
Creates a causal 4D mask of shape `(batch_size, 1, query_length, key_value_length)` from a 2D mask of shape `(batch_size, key_value_l
vita_audio/models/qwen2_mtp_v4_48_3/modeling_qwen2.py:722
↓ 1 callersMethod_prepare_mtp_for_generation
( self, mtp_inference_mode, max_new_tokens, )
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/modeling_qwen2.py:1300
↓ 1 callersMethod_update_causal_mask
( self, attention_mask: torch.Tensor, input_tensor: torch.Tensor, cache_positi
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/modeling_qwen2.py:709
↓ 1 callersMethod_update_causal_mask
( self, attention_mask: torch.Tensor, input_tensor: torch.Tensor, cache_positi
vita_audio/models/qwen2_v4_48_3/modeling_qwen2.py:608
↓ 1 callersMethod_update_causal_mask
( self, attention_mask: torch.Tensor, input_tensor: torch.Tensor, cache_positi
vita_audio/models/qwen2_mtp_v4_48_3/modeling_qwen2.py:656
↓ 1 callersFunctionasr_task
()
tools/inference_sts.py:881
↓ 1 callersMethodbenchmark_forward
(self, mtp_inference_mode)
tools/inference_sts.py:281
↓ 1 callersMethodbenchmark_generate
(self, mtp_inference_mode)
tools/inference_sts.py:348
↓ 1 callersMethodbenchmark_generate_stream
(self, mtp_inference_mode)
tools/inference_sts.py:388
↓ 1 callersFunctionbenchmark_llm
()
tools/inference_sts.py:696
↓ 1 callersFunctionbenchmark_sts
()
tools/inference_sts.py:728
↓ 1 callersMethodbpe
(self, token)
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/tokenization_qwen2.py:221
↓ 1 callersMethodbpe
(self, token)
vita_audio/models/qwen2_v4_48_3/tokenization_qwen2.py:219
↓ 1 callersMethodbpe
(self, token)
vita_audio/models/qwen2_mtp_v4_48_3/tokenization_qwen2.py:221
↓ 1 callersFunctionbuffer_image
(image: Image, format: str = "JPEG")
vita_audio/data/utils.py:20
↓ 1 callersFunctionbuild_supervised_dataset_deepspeed
( model_config, model_args, data_args, training_args, tokenizer, create_position_ids=T
vita_audio/data/build.py:23
↓ 1 callersFunctionbytes_to_unicode
Returns list of utf-8 byte and a mapping to unicode strings. We specifically avoids mapping to whitespace/control characters the bpe code bar
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/tokenization_qwen2.py:44
↓ 1 callersFunctionbytes_to_unicode
Returns list of utf-8 byte and a mapping to unicode strings. We specifically avoids mapping to whitespace/control characters the bpe code bar
vita_audio/models/qwen2_v4_48_3/tokenization_qwen2.py:44
↓ 1 callersFunctionbytes_to_unicode
Returns list of utf-8 byte and a mapping to unicode strings. We specifically avoids mapping to whitespace/control characters the bpe code bar
vita_audio/models/qwen2_mtp_v4_48_3/tokenization_qwen2.py:44
↓ 1 callersMethodcalculate
(self, lab, rec)
evaluation/compute-cer.py:102
↓ 1 callersMethodcalculate
(self, lab, rec)
evaluation/compute-wer.py:96
↓ 1 callersFunctionclean_punctuation
(value)
evaluation/compute-acc-of-contain.py:29
↓ 1 callersMethodclear
Clear the buffer in a thread-safe manner. Parameters: - None Returns: - None
web/queue.py:59
↓ 1 callersFunctioncompute_kl_loss
(logits, labels)
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/modeling_qwen2.py:75
↓ 1 callersFunctioncompute_kl_loss
(logits, labels)
vita_audio/models/qwen2_mtp_v4_48_3/modeling_qwen2.py:72
↓ 1 callersFunctionctc_forced_align
Align a CTC label sequence to an emission. Args: log_probs (Tensor): log probability of CTC emission output. Tensor of shape
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/modeling_sensevoice.py:18
↓ 1 callersMethoddecode
( self, token_ids, skip_special_tokens: bool = False, clean_up_tokenization_sp
vita_audio/models/qwen2_v4_48_3/tokenization_qwen2.py:289
↓ 1 callersMethoddecode
( self, token_ids, skip_special_tokens: bool = False, clean_up_tokenization_sp
vita_audio/models/qwen2_mtp_v4_48_3/tokenization_qwen2.py:291
↓ 1 callersFunctiondefault_cluster
(word)
evaluation/compute-cer.py:254
↓ 1 callersFunctiondefault_cluster
(word)
evaluation/compute-wer.py:247
↓ 1 callersFunctiondivide_to_patches
Divides an image into patches of a specified size. Args: image (PIL.Image.Image): The input image. patch_size (int): The siz
vita_audio/data/processor/image_processor.py:364
↓ 1 callersFunctiondraw_data
(all_datasets, output_path, tokenizer=None, image_processor=None)
vita_audio/data/utils.py:50
↓ 1 callersFunctiondynamic_preprocess
(image, min_num=1, max_num=6, image_size=448, use_thumbnail=False)
vita_audio/data/processor/image_processor.py:403
↓ 1 callersMethodencode
( self, positions: torch.Tensor = None, depth: int = None, dtype: torch.dtype = torch.float32 )
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/modeling_sensevoice.py:99
↓ 1 callersFunctionextract_speech_token
(model, feature_extractor, utts, device="cuda")
vita_audio/tokenizer_sensevoice_glm4voice.py:237
↓ 1 callersFunctionextract_speech_token
(model, feature_extractor, utts, device="cuda")
vita_audio/tokenizer_glm4voice.py:185
↓ 1 callersFunctionextract_token_ids_as_int
(text)
web_demo_stream.py:156
↓ 1 callersFunctionfind_closest_aspect_ratio
(aspect_ratio, target_ratios, width, height, image_size)
vita_audio/data/processor/image_processor.py:386
↓ 1 callersFunctionfixed_cross_entropy
(source, target, num_items_in_batch: int = None, ignore_index: int = -100, **kwargs)
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/modeling_qwen2.py:48
↓ 1 callersFunctionfixed_cross_entropy
(source, target, num_items_in_batch: int = None, ignore_index: int = -100, **kwargs)
vita_audio/models/qwen2_mtp_v4_48_3/modeling_qwen2.py:45
↓ 1 callersFunctionfloat_to_int16
(audio: np.ndarray)
web_demo.py:20
↓ 1 callersFunctiongenerate_self_signed_cert
Generate a self-signed SSL certificate and its corresponding private key. Parameters: - cert_file (str): The file path where the generat
web/pem.py:16
↓ 1 callersFunctionget_args
()
web_demo_stream.py:32
↓ 1 callersMethodget_chunk_size
(self)
web/vad.py:137
↓ 1 callersMethodget_frame_paths
(self, frame_root, num_frames=8)
vita_audio/data/processor/image_processor.py:77
↓ 1 callersMethodget_max_min_ret_length
(self)
vita_audio/data/dataset_deepseek.py:67
↓ 1 callersMethodget_max_min_ret_length
(self)
vita_audio/data/dataset_hunyuan.py:67
↓ 1 callersMethodget_max_min_ret_length
(self)
vita_audio/data/dataset_cosyvoice2.py:67
↓ 1 callersMethodget_max_min_ret_length
(self)
vita_audio/data/dataset_llama3.py:67
↓ 1 callersMethodget_max_min_ret_length
(self)
vita_audio/data/dataset_qwen2.py:67
↓ 1 callersMethodget_system_message
(self, msg: dict)
Kimi-Audio-Evalkit/almeval/models/vita_audio.py:82
↓ 1 callersMethodget_task_message
(self, msg: dict)
Kimi-Audio-Evalkit/almeval/models/vita_audio.py:91
↓ 1 callersMethodget_video_frames
(self, vid_path, max_fps=1, num_frames=8)
vita_audio/data/processor/image_processor.py:116
↓ 1 callersFunctionget_vit_lr_decay_rate
(name, num_layers, lr_decay_rate)
tools/trainer_v4_48_3.py:1205
↓ 1 callersMethodget_vocab
(self)
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/tokenization_qwen2.py:217
↓ 1 callersFunctionhas_audio
(sample)
vita_audio/data/dataset_hunyuan.py:739
↓ 1 callersFunctionhas_audio
(sample)
vita_audio/data/dataset_cosyvoice2.py:491
↓ 1 callersFunctionhas_audio
(sample)
vita_audio/data/dataset_llama3.py:723
↓ 1 callersFunctionhas_image
(sample)
vita_audio/data/dataset_deepseek.py:803
↓ 1 callersFunctionhas_image
(sample)
vita_audio/data/dataset_hunyuan.py:727
↓ 1 callersFunctionhas_image
(sample)
vita_audio/data/dataset_llama3.py:711
↓ 1 callersFunctionhas_image
(sample)
vita_audio/data/dataset_qwen2.py:818
↓ 1 callersFunctionhas_video
(sample)
vita_audio/data/dataset_deepseek.py:791
↓ 1 callersFunctionhas_video
(sample)
vita_audio/data/dataset_hunyuan.py:715
↓ 1 callersFunctionhas_video
(sample)
vita_audio/data/dataset_llama3.py:699
↓ 1 callersFunctionhas_video
(sample)
vita_audio/data/dataset_qwen2.py:806
↓ 1 callersFunctioninference
(model, tokenizer, audio_tokenizer, dataloader, output_dir)
evaluation/evaluate_seedtts.py:182
↓ 1 callersFunctioninference
(model, tokenizer, audio_tokenizer, dataloader, output_dir)
evaluation/evaluate_asr.py:152
↓ 1 callersFunctioninference
(model, tokenizer, audio_tokenizer, dataloader, output_dir, asr_model)
evaluation/evaluate_libritts.py:109
↓ 1 callersFunctioninference
(model, tokenizer, audio_tokenizer, dataloader, output_dir, asr_model)
evaluation/evaluate_sqa.py:155
↓ 1 callersMethodinference_encode
( self, data_in, data_lengths=None, key: list = ["wav_file_tmp_name"],
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/modeling_sensevoice.py:1005
↓ 1 callersFunctioninverse_shift_code
(codes, codebook_size, vq_strides)
tools/get_neural_audio_codecs.py:281
↓ 1 callersFunctioninverse_shift_code
(codes, codebook_size, vq_strides)
vita_audio/tokenizer_snac.py:169
↓ 1 callersMethodis_skip
(self)
vita_audio/data/dataset_deepseek.py:246
↓ 1 callersMethodis_skip
(self)
vita_audio/data/dataset_hunyuan.py:221
↓ 1 callersMethodis_skip
(self)
vita_audio/data/dataset_cosyvoice2.py:220
↓ 1 callersMethodis_skip
(self)
vita_audio/data/dataset_llama3.py:220
↓ 1 callersMethodis_skip
(self)
vita_audio/data/dataset_qwen2.py:246
↓ 1 callersFunctionis_string_in_string
(text, candidate)
evaluation/compute-acc-of-contain.py:16
↓ 1 callersFunctionload_asr_model
()
evaluation/evaluate_libritts.py:175
↓ 1 callersFunctionload_asr_model
()
evaluation/evaluate_sqa.py:219
↓ 1 callersMethodload_model
(self)
web/vad.py:140
↓ 1 callersMethodload_vad
(self)
web/vad.py:163
↓ 1 callersFunctionmain
()
web_demo.py:305
↓ 1 callersFunctionmain_process_first
(local=True, desc="work")
vita_audio/data/dataset_base.py:336
↓ 1 callersMethodoverall
(self)
evaluation/compute-cer.py:225
↓ 1 callersMethodoverall
(self)
evaluation/compute-wer.py:218
↓ 1 callersMethodpredict
(self, audio)
web/vad.py:191
↓ 1 callersFunctionprepare_fa2_from_position_ids_for_mtp
(position_ids, mtp_idx)
vita_audio/models/qwen2_mtp_sensevoice_v4_48_3/modeling_qwen2.py:1628
↓ 1 callersFunctionprepare_fa2_from_position_ids_for_mtp
(position_ids, mtp_idx)
vita_audio/models/qwen2_mtp_v4_48_3/modeling_qwen2.py:1571
← previousnext →101–200 of 566, ranked by callers