MCPcopy Create free account

hub / github.com/HumanMLLM/ViSpeak / functions

Functions1,447 in github.com/HumanMLLM/ViSpeak

↓ 127 callersMethodfrom_pretrained
( cls, pretrained_model_name_or_path: Union[str, os.PathLike], **kwargs )
vispeak/model/multimodal_encoder/internvit/configuration_intern_vit.py:107
↓ 125 callersFunctionlistinstr
(lst, s)
VLMEvalKit/vlmeval/smp/misc.py:108
↓ 112 callersFunctionload
(f, fmt=None)
VLMEvalKit/vlmeval/smp/file.py:148
↓ 91 callersFunctionDATASET_TYPE
(dataset)
VLMEvalKit/vlmeval/dataset/__init__.py:137
↓ 76 callersFunctiondump
(data, f, **kwargs)
VLMEvalKit/vlmeval/smp/file.py:122
↓ 71 callersMethodeval
(self, anno, task_list, mode = "offline")
OVO-Bench/utils/OVOBench.py:40
↓ 44 callersMethodappend_message
(self, role, message)
vispeak/conversation.py:174
↓ 38 callersMethodgenerate
Generate the output message. Args: message (list[dict]): The input message. dataset (str, optional): The name of the
VLMEvalKit/vlmeval/vlm/base.py:100
↓ 37 callersFunctiontokenizer_image_audio_token
( prompt, tokenizer, image_token_index=IMAGE_TOKEN_INDEX, audio_token_index=AUDIO_TOKEN_INDEX,
vispeak/util/mm_utils.py:73
↓ 31 callersFunctioncn_string
(s)
VLMEvalKit/vlmeval/smp/misc.py:118
↓ 30 callersMethodcopy
(self)
vispeak/conversation.py:253
↓ 27 callersMethoddump_image
(self, line, dataset)
VLMEvalKit/vlmeval/vlm/base.py:42
↓ 26 callersMethodmessage_to_promptimg
(self, message, dataset=None)
VLMEvalKit/vlmeval/vlm/omchat.py:96
↓ 22 callersMethodget_prompt
(self, modality=None)
vispeak/conversation.py:32
↓ 20 callersFunctionget_logger
(name, log_file=None, log_level=logging.INFO, file_mode='w')
VLMEvalKit/vlmeval/smp/log.py:6
↓ 19 callersFunctionload_pretrained_model
( model_path, model_base, model_name, model_type, load_8bit=False, load_4bit=False,
vispeak/model/builder.py:14
↓ 17 callersMethodgenerate
(self, message, dataset=None)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2_4KHD.py:148
↓ 17 callersFunctionget_model_name_from_path
(model_path)
vispeak/util/mm_utils.py:119
↓ 17 callersMethodget_vision_tower
(self)
vispeak/model/vispeak_arch.py:40
↓ 17 callersFunctiontoliststr
(s)
VLMEvalKit/vlmeval/smp/misc.py:196
↓ 15 callersMethodget_model
(self)
vispeak/model/vispeak_arch.py:185
↓ 15 callersFunctionmd5
(s)
VLMEvalKit/vlmeval/smp/file.py:261
↓ 15 callersFunctionread_ok
(img_path)
VLMEvalKit/vlmeval/smp/vlm.py:128
↓ 15 callersFunctiontokenizer_image_token
( prompt, tokenizer, image_token_index=IMAGE_TOKEN_INDEX, return_tensors=None )
vispeak/util/mm_utils.py:45
↓ 15 callersMethodwrite
(self, buf)
vispeak/util/utils.py:82
↓ 14 callersFunctionLMUDataRoot
()
VLMEvalKit/vlmeval/smp/file.py:68
↓ 14 callersFunctionbuild_judge
(**kwargs)
VLMEvalKit/vlmeval/dataset/utils/judge_util.py:8
↓ 14 callersFunctiondecode_base64_to_image_file
(base64_string, image_path, target_size=-1)
VLMEvalKit/vlmeval/smp/vlm.py:111
↓ 13 callersFunctionget_rank_and_world_size
()
VLMEvalKit/vlmeval/smp/misc.py:100
↓ 13 callersFunctiontrack_progress_rich
Track the progress of parallel task execution with a progress bar. The built-in :mod:`multiprocessing` module is used for process pools and tasks
VLMEvalKit/vlmeval/utils/mp_util.py:54
↓ 12 callersMethodchat
The main function for multi-turn chatting. Will call `chat_inner` with the preprocessed input messages.
VLMEvalKit/vlmeval/vlm/base.py:117
↓ 12 callersMethodgenerate
(self, message, dataset=None)
VLMEvalKit/vlmeval/api/reka.py:59
↓ 12 callersFunctionget_padding
(kernel_size, dilation=1)
vispeak/model/vita_tts/decoder/ticodec/models.py:14
↓ 12 callersMethodname
(self)
StreamingBench/src/model/ViSpeak.py:24
↓ 11 callersMethodload_model
(self)
vispeak/model/multimodal_encoder/clip/clip_encoder.py:20
↓ 10 callersMethod__init__
(self, h)
vispeak/model/vita_tts/decoder/ticodec/models.py:430
↓ 10 callersMethod__init__
( self, in_features, hidden_features=None, out_features=None, act_laye
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:196
↓ 10 callersMethodworking
If the API model is working, return True, else return False. Returns: bool: If the API model is working, return True, else return
VLMEvalKit/vlmeval/api/base.py:59
↓ 9 callersMethodbuild_prompt
(self, line, dataset=None)
VLMEvalKit/vlmeval/vlm/ovis.py:49
↓ 9 callersFunctionencode_image_to_base64
(img, target_size=-1)
VLMEvalKit/vlmeval/smp/vlm.py:82
↓ 9 callersFunctionget_cache_path
(repo_id, branch=None)
VLMEvalKit/vlmeval/smp/misc.py:74
↓ 9 callersMethodget_model
(self, model_path)
vispeak/model/vita_tts/decoder/llm2tts.py:41
↓ 9 callersMethodmessage_to_promptvideo
(self, message)
VLMEvalKit/vlmeval/vlm/base.py:154
↓ 8 callersMethoddevice
(self)
vispeak/model/multimodal_encoder/clip/clip_encoder.py:62
↓ 8 callersMethodencode
(self, x)
vispeak/model/vita_tts/decoder/ticodec/vqvae.py:44
↓ 8 callersMethodget_audio_encoder
(self)
vispeak/model/vispeak_arch.py:46
↓ 8 callersFunctionload_image
(image_file, input_size=448, max_num=6, upscale=False)
VLMEvalKit/vlmeval/vlm/mmalaya.py:147
↓ 7 callersFunctionLOCALIZE
(fname, new_fname=None)
VLMEvalKit/vlmeval/tools.py:273
↓ 7 callersMethodchat
The main function for multi-turn chatting. Will call `chat_inner` with the preprocessed input messages.
VLMEvalKit/vlmeval/api/base.py:153
↓ 7 callersMethodcheck_content
Check the content type of the input. Four types are allowed: str, dict, liststr, listdict.
VLMEvalKit/vlmeval/vlm/base.py:49
↓ 7 callersMethodcheck_content
Check the content type of the input. Four types are allowed: str, dict, liststr, listdict. Args: msgs: Raw input messages.
VLMEvalKit/vlmeval/api/base.py:83
↓ 7 callersFunctionnum2chn
(number_string, numbering_type=NUMBERING_TYPES[1], big=False, traditional=False, alt_zero=False, a
audio_eval/cn_tn.py:655
↓ 7 callersMethodpreprocess
(self, s: str)
audio_eval/whisper_normalizer/english.py:388
↓ 7 callersFunctionsplitlen
(s, sym='/')
VLMEvalKit/vlmeval/smp/misc.py:105
↓ 6 callersMethod__init__
Initialize Conv1dLinear module. Args: in_chans (int): Number of input channels. hidden_chans (int): Number of hidden
vispeak/model/multimodal_encoder/whale/module/layer/attention.py:217
↓ 6 callersMethod__init__
(self, config: InternVisionConfig)
vispeak/model/multimodal_encoder/internvit/modeling_intern_vit.py:206
↓ 6 callersFunctioncan_infer
(answer, choices)
VLMEvalKit/vlmeval/utils/matching_util.py:66
↓ 6 callersFunctiondownload_file
(url, filename=None)
VLMEvalKit/vlmeval/smp/file.py:180
↓ 6 callersMethodembed
(self, x)
vispeak/model/vita_tts/decoder/ticodec/models.py:661
↓ 6 callersFunctionfile_size
(f, unit='GB')
VLMEvalKit/vlmeval/smp/file.py:301
↓ 6 callersFunctionget_clean_string
(s)
VLMEvalKit/vlmeval/dataset/mmlongbench.py:142
↓ 6 callersMethodinfer
(self, xs, buffer, buffer_index, buffer_out)
vispeak/model/multimodal_encoder/whale/module/component/transformer.py:397
↓ 6 callersFunctionistype
(s, type)
VLMEvalKit/vlmeval/smp/misc.py:60
↓ 6 callersFunctionload_image
(image_file, input_size=448, max_num=6, upscale=False)
VLMEvalKit/vlmeval/vlm/internvl_chat.py:88
↓ 6 callersFunctionmodel_gen
(model, text, images, need_bos=True, padding=False, beams=3, max_token=500)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2.py:34
↓ 6 callersMethodparse
Try to parse into a date. Return: tuple (year, month, date) if successful; otherwise None.
VLMEvalKit/vlmeval/dataset/utils/tablevqabench.py:385
↓ 6 callersMethodpreprocess
(self, images, return_tensors)
vispeak/model/multimodal_encoder/eva_clip/eva_clip_processors.py:53
↓ 6 callersFunctionprocess_images
(images, image_processor, model_cfg)
vispeak/util/mm_utils.py:30
↓ 6 callersFunctionremap
(data_in, tup, off)
VLMEvalKit/vlmeval/tools.py:197
↓ 6 callersMethodstreaming_generate
(self, user_input_ids, start_inference_seg, timestamps, seg_token_id,
vispeak/model/language_model/vispeak_qwen2.py:474
↓ 5 callersMethod__init__
Initialize Conv1dLinear module. Args: in_chans (int): Number of input channels. hidden_chans (int): Number of hidden
vispeak/model/vita_tts/encoder/attention.py:205
↓ 5 callersMethod__init__
(self, config=None, projector_type="v1")
vispeak/model/multimodal_projector/builder.py:115
↓ 5 callersFunction_get_rawvideo_dec
( video_path, image_processor, max_frames=32, min_frames=4, video_framerate=3, audio_s
vispeak/util/data_utils.py:567
↓ 5 callersMethodcardinal2chntext
(self)
audio_eval/cn_tn.py:768
↓ 5 callersMethodcreate
(cls, index, value, numbering_type=NUMBERING_TYPES[1], small_unit=False)
audio_eval/cn_tn.py:429
↓ 5 callersFunctionfind_closest_aspect_ratio
(aspect_ratio, target_ratios, width, height, image_size)
vispeak/util/data_utils.py:1149
↓ 5 callersFunctionget_dimension_rating
(data_path)
VLMEvalKit/vlmeval/dataset/utils/mvbench.py:10
↓ 5 callersFunctiongpt_key_set
()
VLMEvalKit/vlmeval/smp/vlm.py:139
↓ 5 callersMethodmessage_to_promptimg
(self, message, dataset=None)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2d5.py:134
↓ 5 callersFunctionmodel_gen
(model, text, images, need_bos=True, padding=False, beams=3, max_token=500)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2_4KHD.py:60
↓ 5 callersFunctionmodel_gen
(model, text, images, need_bos=True, padding=False, beams=3, max_token=500)
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer2d5.py:62
↓ 5 callersMethodpool_feats
(self, x, out_size)
vispeak/model/vispeak_arch.py:194
↓ 5 callersMethodprocess_images
(self, images, model_cfg)
vispeak/model/language_model/vispeak_qwen2.py:684
↓ 5 callersFunctionproxy_set
(s)
VLMEvalKit/vlmeval/smp/misc.py:95
↓ 4 callersFunctionanls_compute
(groundtruth, prediction, threshold=0.5)
VLMEvalKit/vlmeval/dataset/mmlongbench.py:102
↓ 4 callersFunctionbuild_dataset
(dataset_name, **kwargs)
VLMEvalKit/vlmeval/dataset/__init__.py:155
↓ 4 callersFunctionchn2num
(chinese_string, numbering_type=NUMBERING_TYPES[1])
audio_eval/cn_tn.py:568
↓ 4 callersMethoddump_image
(self, origin_line)
VLMEvalKit/vlmeval/dataset/dude.py:88
↓ 4 callersFunctionencode_image_file_to_base64
(image_path, target_size=-1)
VLMEvalKit/vlmeval/smp/vlm.py:96
↓ 4 callersMethodencode_images
(self, images)
vispeak/model/vispeak_arch.py:208
↓ 4 callersFunctionexpand2square
(pil_img, background_color)
vispeak/util/mm_utils.py:16
↓ 4 callersMethodframe_paths
(self, video, num_frames=8)
VLMEvalKit/vlmeval/dataset/video_base.py:47
↓ 4 callersFunctionget_length_grouped_indices
(lengths, batch_size, world_size, generator=None, merge=True)
vispeak/train/vispeak_trainer.py:100
↓ 4 callersFunctionget_mm_adapter_state_maybe_zero_3
(named_params, keys_to_match)
vispeak/train/vispeak_trainer.py:32
↓ 4 callersFunctionget_model_response
Get the model response for the given input Model: Model name file: Video file path inp: Input prompt
StreamingBench/src/utils/data_execution.py:19
↓ 4 callersFunctionhit_calculate
(result, dataset_name, anls_threshold=0.5)
VLMEvalKit/vlmeval/dataset/utils/vqa_eval.py:160
↓ 4 callersMethodinfer
(self, xs, buffer, buffer_index, buffer_out, pe_index)
vispeak/model/vita_tts/encoder/transformer.py:267
↓ 4 callersFunctionload_env
()
VLMEvalKit/vlmeval/smp/misc.py:154
↓ 4 callersMethodmatch
Return True if the value matches the other value. Args: other (Value) Returns: a boolean
VLMEvalKit/vlmeval/dataset/utils/tablevqabench.py:246
↓ 4 callersFunctionnormalize
(x)
VLMEvalKit/vlmeval/dataset/utils/tablevqabench.py:209
next →1–100 of 1,447, ranked by callers