MCPcopy Create free account

hub / github.com/HumanMLLM/ViSpeak / functions

Functions1,447 in github.com/HumanMLLM/ViSpeak

↓ 4 callersMethodprocess
(self, image, question)
VLMEvalKit/vlmeval/vlm/cambrian.py:51
↓ 4 callersFunctionprocess_answer
(answer)
VLMEvalKit/vlmeval/dataset/utils/vqa_eval.py:239
↓ 4 callersFunctionrank0_print
(*args)
vispeak/train/train.py:35
↓ 4 callersFunctionrepeat
Repeat module N times. :param int N: repeat time :param function fn: function to generate module :return: repeated modules :rtype: Mu
vispeak/model/multimodal_encoder/whale/module/component/transformer.py:24
↓ 4 callersMethoduse_custom_prompt
(self, dataset)
VLMEvalKit/vlmeval/vlm/ovis.py:44
↓ 3 callersFunctionMMLongBench_auxeval
(model, line)
VLMEvalKit/vlmeval/dataset/mmlongbench.py:341
↓ 3 callersMethod__init__
(self, date=None, chntext=None)
audio_eval/cn_tn.py:844
↓ 3 callersMethodadd_arguments
Add TDNN common arguments.
vispeak/model/multimodal_encoder/whale/module/component/mamba.py:85
↓ 3 callersMethodbuild_prompt
(self, task, question, options, _anno_, index)
OVO-Bench/utils/OVOBench.py:138
↓ 3 callersMethodbuild_prompt_default
(self, message, add_brief=False, add_yes_or_no=False)
VLMEvalKit/vlmeval/vlm/idefics.py:93
↓ 3 callersFunctioncalc_aAcc
(data)
VLMEvalKit/vlmeval/dataset/utils/yorn.py:67
↓ 3 callersFunctioncalc_fAcc
(data)
VLMEvalKit/vlmeval/dataset/utils/yorn.py:51
↓ 3 callersFunctioncalc_qAcc
(data)
VLMEvalKit/vlmeval/dataset/utils/yorn.py:59
↓ 3 callersFunctionconcat_images
(image_list, max_concat=1, column_num=1)
VLMEvalKit/vlmeval/dataset/mmlongbench.py:263
↓ 3 callersFunctiond2df
(D)
VLMEvalKit/vlmeval/smp/misc.py:115
↓ 3 callersFunctionextract_characters_regex
(s)
VLMEvalKit/vlmeval/dataset/utils/videomme.py:118
↓ 3 callersMethodfeature_select
(self, image_forward_outs)
vispeak/model/multimodal_encoder/siglip/siglip_encoder.py:30
↓ 3 callersMethodgenerate_vanilla
(self, image_path, text)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2_4KHD.py:138
↓ 3 callersMethodgenerate_vanilla
(self, image_path, text)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2.py:117
↓ 3 callersMethodgenerate_vanilla
(self, image_path, text)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2d5.py:193
↓ 3 callersMethodget_index
(self, bound, fps, max_frame, first_idx=0)
VLMEvalKit/vlmeval/dataset/mvbench.py:219
↓ 3 callersMethodget_input_embeddings
(self)
vispeak/model/multimodal_encoder/internvit/modeling_intern_vit.py:351
↓ 3 callersMethodinfer_data
( self, data_sample, system=' ', question_prompt='', # add in the end of question ans
VLMEvalKit/vlmeval/vlm/video_llm/videochat2.py:302
↓ 3 callersMethodinference
(self, video_file_name, prompt, start_time=0, end_time=0)
OVO-Bench/utils/OVOBench.py:185
↓ 3 callersFunctionmaybe_zero_3
(param, ignore_status=False, name=None)
vispeak/train/train.py:100
↓ 3 callersFunctionmcq_vanilla_eval
(model, data, meta, nproc, result_file, dataset_name=None)
VLMEvalKit/vlmeval/dataset/utils/multiple_choice.py:337
↓ 3 callersFunctionparse_file
(s)
VLMEvalKit/vlmeval/smp/file.py:280
↓ 3 callersFunctionpost_check
(line, prefetch=False)
VLMEvalKit/vlmeval/dataset/utils/mathvista.py:74
↓ 3 callersFunctionpost_check
(line, prefetch=False)
VLMEvalKit/vlmeval/dataset/utils/mathv.py:100
↓ 3 callersMethodread_video
(self, video_path, bound=None)
VLMEvalKit/vlmeval/vlm/video_llm/videochat2.py:228
↓ 3 callersMethodremove_weight_norm
(self)
vispeak/model/vita_tts/decoder/ticodec/models.py:516
↓ 3 callersFunctionreport_acc
(df)
VLMEvalKit/vlmeval/dataset/utils/multiple_choice.py:68
↓ 3 callersMethodrun
Run the speech decoder process. Parameters: - hidden (torch.Tensor): The output for embedding layer of the language model.
vispeak/model/vita_tts/decoder/llm2tts.py:114
↓ 3 callersMethodsave_video_frames
(self, imgs, video_name, frames)
VLMEvalKit/vlmeval/dataset/mvbench.py:267
↓ 3 callersFunctionsubsequent_mask
Create mask for subsequent steps (size, size). This mask is used only in decoder which works in an auto-regressive mode. This means the curre
vispeak/model/vita_tts/masks.py:153
↓ 3 callersMethodsupported_datasets
(cls)
VLMEvalKit/vlmeval/dataset/__init__.py:82
↓ 2 callersFunctionHD_transform
(img, im_num=36, id_scale=1.5)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2d5.py:29
↓ 2 callersFunctionMISSING
(lvl)
VLMEvalKit/vlmeval/tools.py:132
↓ 2 callersFunctionRUN
(lvl, model)
VLMEvalKit/vlmeval/tools.py:287
↓ 2 callersFunctionYOrN_Extraction
(output)
VLMEvalKit/vlmeval/dataset/utils/yorn.py:185
↓ 2 callersMethod__init__
( self, enc_out_dim: int = 512, llm_embed_dim: int = 4096, kernel_size: int =
vispeak/model/vita_tts/adapter.py:11
↓ 2 callersMethod__init__
(self, args)
vispeak/model/vita_tts/encoder/subsampling.py:86
↓ 2 callersMethod__init__
( self, enc_out_dim: int = 512, llm_embed_dim: int = 4096, kernel_size: int =
vispeak/model/multimodal_encoder/whale/adapter.py:7
↓ 2 callersMethod__init__
(self, args)
vispeak/model/multimodal_encoder/whale/module/component/subsampling.py:57
↓ 2 callersMethod_generate_one_step
Generates the model's next output based on the current input and state. Parameters: - inputs: The input tensor containing th
vispeak/model/vita_tts/audioLLM.py:387
↓ 2 callersMethod_process
(self, formatted_messages, formatted_images)
VLMEvalKit/vlmeval/vlm/idefics.py:86
↓ 2 callersFunction_to_float
(text: str)
VLMEvalKit/vlmeval/dataset/utils/vqa_eval.py:194
↓ 2 callersFunctionacc
(key, mode='normal')
VLMEvalKit/vlmeval/dataset/utils/yorn.py:17
↓ 2 callersMethodadd_arguments
Add Subsampling common arguments.
vispeak/model/vita_tts/encoder/subsampling.py:77
↓ 2 callersFunctionadd_encoder_args
Add Encoder common arguments.
vispeak/model/vita_tts/encoder/encoder.py:12
↓ 2 callersFunctionadd_optional_chunk_mask
Apply optional mask for encoder. Args: xs (torch.Tensor): padded input, (B, L, D), L for max length mask (torch.Tensor): mask fo
vispeak/model/vita_tts/masks.py:59
↓ 2 callersFunctionadd_optional_chunk_mask
( xs: torch.Tensor, masks: torch.Tensor, use_dynamic_chunk: bool, use_dynamic_left_chunk: bool
vispeak/model/multimodal_encoder/whale/utils.py:105
↓ 2 callersMethodanswer
(self, conv, model, img_list, do_sample=True, max_new_tokens=500, num_beams=1, min_length=1, top_p=0.9,
VLMEvalKit/vlmeval/vlm/video_llm/videochat2.py:269
↓ 2 callersMethodask
(self, text, conv)
VLMEvalKit/vlmeval/vlm/video_llm/videochat2.py:241
↓ 2 callersFunctionassign_args_from_dict
(args, dict, prefix_key=None)
vispeak/model/vita_tts/encoder/encoder.py:36
↓ 2 callersFunctionassign_args_from_dict
(args, dict, prefix_key=None)
vispeak/model/multimodal_encoder/whale/module/encoder/encoder.py:45
↓ 2 callersFunctionbuild_audio_encoder
(audio_encoder_config, **kwargs)
vispeak/model/multimodal_encoder/builder.py:45
↓ 2 callersFunctionbuild_choices
(item)
VLMEvalKit/vlmeval/dataset/utils/multiple_choice.py:224
↓ 2 callersFunctionbuild_prompt
(line)
VLMEvalKit/vlmeval/dataset/utils/llavabench.py:32
↓ 2 callersMethodbuild_prompt
(self, line)
VLMEvalKit/vlmeval/dataset/image_vqa.py:410
↓ 2 callersFunctionbuild_transform
(input_size)
VLMEvalKit/vlmeval/vlm/mmalaya.py:72
↓ 2 callersMethodbuild_video_prompt
(self, prompt, dataset=None, max_nframe=64)
VLMEvalKit/vlmeval/vlm/internvl_chat.py:210
↓ 2 callersFunctionbuild_vision_projector
(config, delay_load=False, **kwargs)
vispeak/model/multimodal_projector/builder.py:154
↓ 2 callersFunctionbuild_vision_tower
(vision_tower_cfg, **kwargs)
vispeak/model/multimodal_encoder/builder.py:13
↓ 2 callersMethodbulid_informative_head
(self, ckpt=None)
vispeak/model/language_model/vispeak_qwen2.py:308
↓ 2 callersFunctioncal_f1_score
(y_true, y_pred)
VLMEvalKit/vlmeval/dataset/utils/yorn.py:103
↓ 2 callersMethodcalculate_score_backward_realtime
(self, results)
OVO-Bench/utils/OVOBenchScore.py:13
↓ 2 callersFunctioncheck_ans
(pred, gt)
VLMEvalKit/vlmeval/dataset/utils/mvbench.py:32
↓ 2 callersFunctioncn_ratio
(data)
VLMEvalKit/scripts/mmb_eval_gradio.py:47
↓ 2 callersFunctioncolored
(s, color)
VLMEvalKit/vlmeval/smp/misc.py:53
↓ 2 callersFunctionconcat_images_vlmeval
(images, target_size=-1, mode='h', return_image=False)
VLMEvalKit/vlmeval/smp/vlm.py:26
↓ 2 callersMethodconcat_tilist
(self, message)
VLMEvalKit/vlmeval/vlm/llava/llava.py:106
↓ 2 callersFunctioncount_choice
(splits, choices, prefix='', suffix='')
VLMEvalKit/vlmeval/utils/matching_util.py:23
↓ 2 callersFunctioncreate_system
根据数字系统类型返回创建相应的数字系统,默认为 mid NUMBERING_TYPES = ['low', 'mid', 'high']: 中文数字系统类型 low: '兆' = '亿' * '十' = $10^{9}$, '京' = '兆' * '十', et
audio_eval/cn_tn.py:526
↓ 2 callersFunctiondecode_base64_to_image
(base64_string, target_size=-1)
VLMEvalKit/vlmeval/smp/vlm.py:101
↓ 2 callersMethoddigit2chntext
(self)
audio_eval/cn_tn.py:783
↓ 2 callersFunctiondynamic_preprocess
(image, min_num=1, max_num=6, image_size=448, use_thumbnail=False)
vispeak/util/data_utils.py:1166
↓ 2 callersFunctionedit_config
(repo_id)
VLMEvalKit/vlmeval/vlm/yi_vl.py:28
↓ 2 callersMethodevaluate
(self, eval_file, **judge_kwargs)
VLMEvalKit/vlmeval/dataset/dude.py:163
↓ 2 callersFunctionexpand2square
(pil_img, background_color)
vispeak/util/data_utils.py:610
↓ 2 callersFunctionextract_answer_from_item
(model, item, dataset_name=None)
VLMEvalKit/vlmeval/dataset/utils/multiple_choice.py:237
↓ 2 callersMethodfeature_select
(self, image_forward_outs)
vispeak/model/multimodal_encoder/clip/clip_encoder.py:27
↓ 2 callersMethodfeature_select
(self, image_forward_outs)
vispeak/model/multimodal_encoder/internvit/internvit_encoder.py:34
↓ 2 callersMethodfill_fix_offset
(more_fix_crop, image_w, image_h, crop_w, crop_h)
VLMEvalKit/vlmeval/dataset/utils/mvbench.py:316
↓ 2 callersFunctionfintabnet_normalize
(s)
VLMEvalKit/vlmeval/dataset/utils/tablevqabench.py:162
↓ 2 callersMethodflush
(self)
vispeak/util/utils.py:96
↓ 2 callersMethodforward_features
(self, x, return_all_features=False)
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:763
↓ 2 callersMethodgenerate
(self, inputs, **kwargs)
VLMEvalKit/vlmeval/api/hf_chat_model.py:241
↓ 2 callersMethodgenerate_inner
The inner function to generate the answer. Returns: tuple(int, str, str): ret_code, response, log
VLMEvalKit/vlmeval/api/base.py:47
↓ 2 callersMethodgenerate_vanilla
(self, image_path, prompt)
VLMEvalKit/vlmeval/vlm/monkey.py:23
↓ 2 callersMethodgenerate_vanilla
(self, image_path, prompt)
VLMEvalKit/vlmeval/vlm/monkey.py:105
↓ 2 callersMethodget_audio_encoder
(self)
vispeak/model/vispeak_arch.py:191
↓ 2 callersMethodget_model
(self)
vispeak/model/language_model/vispeak_qwen2.py:323
↓ 2 callersFunctionget_precision
(gt_ans: float)
VLMEvalKit/vlmeval/dataset/mmlongbench.py:113
↓ 2 callersFunctionget_score
(model, dataset)
VLMEvalKit/scripts/summarize.py:4
↓ 2 callersFunctionget_symbol
(char, system)
audio_eval/cn_tn.py:570
↓ 2 callersFunctionis_exact_match
(s)
VLMEvalKit/vlmeval/dataset/mmlongbench.py:159
↓ 2 callersFunctionis_large
(x)
VLMEvalKit/scripts/auto_run.py:14
↓ 2 callersMethodkv_cache_prefix_forward
(self, prefix, prefix_lens, past_key_values)
vispeak/model/vita_tts/decoder/decoder.py:127
↓ 2 callersFunctionlevenshtein_distance
(s1, s2)
VLMEvalKit/vlmeval/dataset/utils/vqa_eval.py:214
← previousnext →101–200 of 1,447, ranked by callers