MCPcopy Create free account

hub / github.com/Mark12Ding/Dispider / functions

Functions286 in github.com/Mark12Ding/Dispider

↓ 17 callersMethodget_model
(self)
dispider/model/llava_arch.py:90
↓ 14 callersMethod__init__
(self, config, layer_num)
dispider/model/multimodal_projector/modeling_sampler.py:361
↓ 12 callersMethodget_model
(self)
dispider/model/long_arch.py:98
↓ 10 callersMethod__init__
( self, grid_size, embed_dim, num_heads, kv_dim=No
dispider/model/multimodal_projector/builder.py:273
↓ 10 callersMethodmix_spatial_tokens
(self, features)
dispider/model/llava_arch.py:119
↓ 10 callersMethodprepare_inputs_labels_for_multimodal
( self, input_ids, position_ids, attention_mask, past_key_values, labels, clips, clips_large, seqs, co
dispider/model/long_arch.py:136
↓ 10 callersFunctiontokenizer_image_token
(prompt, tokenizer, image_token_index=IMAGE_TOKEN_INDEX, return_tensors=None)
dispider/mm_utils.py:43
↓ 9 callersMethod__init__
(self, config)
dispider/model/language_model/qwen_model/modeling_qwen.py:162
↓ 7 callersMethodtranspose_for_scores
(self, x)
dispider/model/multimodal_projector/modeling_sampler.py:145
↓ 6 callersFunction_check_received_keys
Compare the received keys in `config.rope_scaling` against the expected and optional keys
dispider/model/language_model/qwen_model/modeling_rope_utils.py:366
↓ 6 callersMethodappend_message
(self, role, message)
dispider/conversation.py:117
↓ 6 callersMethodget_input_embeddings
(self)
dispider/model/multimodal_projector/modeling_sampler.py:678
↓ 6 callersMethodget_output_embeddings
(self)
dispider/model/multimodal_projector/modeling_sampler.py:949
↓ 6 callersFunctionrepeat_kv
This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
dispider/model/language_model/qwen_model/modeling_qwen.py:176
↓ 5 callersMethodextract_images
(self, images, vision_encoder=None)
dispider/model/llava_arch.py:105
↓ 5 callersMethodget_prompt
(self)
dispider/conversation.py:30
↓ 5 callersMethodget_vision_tower
(self)
dispider/model/llava_arch.py:37
↓ 4 callersFunctionbuild_clip_projector
(config)
dispider/model/language_model/builder.py:196
↓ 4 callersFunctionbuild_compress_projector
(config)
dispider/model/language_model/builder.py:175
↓ 4 callersMethodcopy
(self)
dispider/conversation.py:201
↓ 4 callersMethodget_compressor
(self)
dispider/model/long_arch.py:37
↓ 3 callersFunctionapply_rotary_pos_emb
Applies Rotary Position Embedding to the query and key tensors. Args: q (`torch.Tensor`): The query tensor. k (`torch.Tensor`): T
dispider/model/language_model/qwen_model/modeling_qwen.py:132
↓ 3 callersFunctionbuild_vision_projector
(config, delay_load=False, **kwargs)
dispider/model/multimodal_projector/builder.py:590
↓ 3 callersMethodforward_grounding_hm
( self, input_ids: torch.LongTensor, past_key_values: Optional[List[torch.FloatTensor]
dispider/model/language_model/qwen_model/modeling_qwen.py:1400
↓ 3 callersMethodproject_features
(self, features)
dispider/model/llava_arch.py:115
↓ 2 callersFunction_compute_default_rope_parameters
Computes the inverse frequencies according to the original RoPE implementation Args: config ([`~transformers.PretrainedConfig`]):
dispider/model/language_model/qwen_model/modeling_rope_utils.py:29
↓ 2 callersMethod_set_cos_sin_cache
(self, seq_len, device, dtype)
dispider/model/language_model/qwen_model/modeling_qwen.py:102
↓ 2 callersFunctionbuild_compressor
(compressor_cfg)
dispider/model/language_model/builder.py:161
↓ 2 callersFunctionbuild_vision_tower
(vision_tower_cfg, **kwargs)
dispider/model/multimodal_encoder/builder.py:5
↓ 2 callersFunctioncalculate_diff
(scene_sep, start_frame)
dispider/eval/model_videomme_long.py:69
↓ 2 callersFunctionexpand2square
(pil_img, background_color)
dispider/mm_utils.py:14
↓ 2 callersMethodfeature_select
(self, image_forward_outs)
dispider/model/multimodal_encoder/clip_encoder.py:34
↓ 2 callersFunctionfind_correction_dim
Inverse dimension formula to find the dimension based on the number of rotations
dispider/model/language_model/qwen_model/modeling_rope_utils.py:206
↓ 2 callersMethodforward_token
( self, input_ids: torch.LongTensor = None, attention_mask: Optional[torch.Tensor] = N
dispider/model/language_model/llava_qwen.py:62
↓ 2 callersMethodgenerate
( self, input_ids: torch.LongTensor = None, attention_mask: Optional[torch.Tensor] = N
dispider/model/language_model/long_qwen.py:140
↓ 2 callersFunctionget_1d_sincos_pos_embed_from_grid
embed_dim: output dimension for each position pos: a list of positions to be encoded: size (M,) out: (M, D)
dispider/model/multimodal_projector/builder.py:245
↓ 2 callersFunctionget_2d_sincos_pos_embed
grid_size: int of the grid height and width return: pos_embed: [grid_size*grid_size, embed_dim] or [1+grid_size*grid_size, embed_dim] (w/
dispider/model/multimodal_projector/builder.py:216
↓ 2 callersFunctionget_abs_pos
(abs_pos, tgt_size)
dispider/model/multimodal_projector/builder.py:197
↓ 2 callersMethodget_extended_attention_mask
Makes broadcastable attention and causal masks so that future and masked tokens are ignored. Arguments: attention_mask (
dispider/model/multimodal_projector/modeling_sampler.py:692
↓ 2 callersFunctionget_model_name_from_path
(model_path)
dispider/mm_utils.py:64
↓ 2 callersMethodload_model
(self)
dispider/model/multimodal_encoder/clip_encoder.py:27
↓ 2 callersFunctionload_pretrained_model
(model_path, model_base, model_name, load_8bit=False, load_4bit=False, device_map="auto", device="cuda", **kwa
dispider/model/builder.py:26
↓ 2 callersFunctionrotate_half
Rotates half the hidden dims of the input.
dispider/model/language_model/qwen_model/modeling_qwen.py:124
↓ 1 callersMethodRun
Given the video file and input prompt, run the model and return the response file: Video file path inp: Input prompt
inference.py:202
↓ 1 callersMethod__getitem__
(self, i)
dispider/conv_template.py:171
↓ 1 callersMethod__init__
Initialize the model
inference.py:177
↓ 1 callersMethod__init__
(self, config: Qwen2Config)
dispider/model/language_model/stream_grounding_qwen.py:38
↓ 1 callersMethod__init__
(self, config: Qwen2Config)
dispider/model/language_model/llava_qwen.py:38
↓ 1 callersMethod__init__
(self, config: Qwen2Config)
dispider/model/language_model/grounding_qwen.py:38
↓ 1 callersMethod__init__
(self, compressor)
dispider/model/language_model/builder.py:15
↓ 1 callersMethod__init__
(self, config: Qwen2Config)
dispider/model/language_model/long_qwen.py:38
↓ 1 callersFunction_flash_attention_forward
Calls the forward method of Flash Attention - if the input hidden states contain at least one padding token first unpad the input, then compu
dispider/model/language_model/qwen_model/modeling_flash_attention_utils.py:183
↓ 1 callersFunction_get_unpad_data
Retrieves indexing data required to repad unpadded (ragged) tensors. Arguments: attention_mask (`torch.Tensor`): Boolean
dispider/model/language_model/qwen_model/modeling_flash_attention_utils.py:33
↓ 1 callersMethod_repeat
(self, query, N: int)
dispider/model/multimodal_projector/builder.py:335
↓ 1 callersMethod_repeat
(self, query, N: int)
dispider/model/multimodal_projector/builder.py:412
↓ 1 callersFunction_upad_input
Unpads query, key, and values tensors, using a single dimension for all tokens even though they belong to different batches. This function i
dispider/model/language_model/qwen_model/modeling_flash_attention_utils.py:60
↓ 1 callersMethod_update_causal_mask
( self, attention_mask: torch.Tensor, input_tensor: torch.Tensor, cache_positi
dispider/model/language_model/qwen_model/modeling_qwen.py:936
↓ 1 callersFunctionapply_delta
(base_model_path, target_model_path, delta_path)
dispider/model/apply_delta.py:13
↓ 1 callersFunctionauto_upgrade
(config)
dispider/model/utils.py:4
↓ 1 callersFunctioncalculate_diff
(scene_sep, start_frame)
inference.py:52
↓ 1 callersMethodcall_for_batch
(self, output_ids: torch.LongTensor, scores: torch.FloatTensor, **kwargs)
dispider/mm_utils.py:87
↓ 1 callersFunctionconsolidate_ckpt
(src_path, dst_path)
dispider/model/consolidate.py:13
↓ 1 callersFunctiondisable_torch_init
Disable the redundant torch default initialization to accelerate model creation.
dispider/utils.py:93
↓ 1 callersMethodencode_images
(self, images, base_mode=False)
dispider/model/llava_arch.py:96
↓ 1 callersMethodencode_sequences
(self, clips, clips_large, seqs, compress_mask, qs, qs_mask, time_labels, ans_token, todo_token, insert_positi
dispider/model/long_arch.py:104
↓ 1 callersFunctioneval_dataset
(args)
dispider/eval/model_videomme_long.py:210
↓ 1 callersFunctioneval_your_results
Evaluate your results against the ground truth Args: - your_results_path (str): Path to your results file - video_types (Optional[Li
dispider/eval/eval_videomme.py:88
↓ 1 callersFunctionextract_characters_regex
(s)
dispider/eval/eval_videomme.py:65
↓ 1 callersFunctionfind_correction_range
Find dimension range bounds based on rotations
dispider/model/language_model/qwen_model/modeling_rope_utils.py:210
↓ 1 callersMethodforward
(self, hidden_state)
dispider/model/language_model/qwen_model/modeling_qwen.py:171
↓ 1 callersMethodforward_compress
( self, input_ids: torch.LongTensor = None, attention_mask: Optional[torch.Tensor] = N
dispider/model/language_model/builder.py:24
↓ 1 callersMethodforward_compress
( self, input_ids: torch.LongTensor = None, attention_mask: Optional[torch.Tensor] = N
dispider/model/language_model/builder.py:80
↓ 1 callersMethodforward_grounding_stream
( self, input_ids: torch.LongTensor, past_key_values: Optional[List[torch.FloatTensor]
dispider/model/language_model/qwen_model/modeling_qwen.py:1047
↓ 1 callersMethodforward_grounding_stream_eval
( self, input_ids: torch.LongTensor, past_key_values: Optional[List[torch.FloatTensor]
dispider/model/language_model/qwen_model/modeling_qwen.py:1311
↓ 1 callersMethodforward_grounding_stream_inference
( self, input_ids: torch.LongTensor, past_key_values: Optional[List[torch.FloatTensor]
dispider/model/language_model/qwen_model/modeling_qwen.py:1242
↓ 1 callersMethodforward_token_stream
( self, input_ids: torch.LongTensor, past_key_values: Optional[List[torch.FloatTensor]
dispider/model/language_model/qwen_model/modeling_qwen.py:1551
↓ 1 callersFunctionget_2d_sincos_pos_embed_from_grid
(embed_dim, grid)
dispider/model/multimodal_projector/builder.py:234
↓ 1 callersFunctionget_chunk
(lst, n, k)
dispider/eval/model_videomme_long.py:46
↓ 1 callersMethodget_compressor
(self)
dispider/model/long_arch.py:101
↓ 1 callersMethodget_images
(self, return_pil=False)
dispider/conversation.py:120
↓ 1 callersMethodget_model
(self)
dispider/model/language_model/long_qwen.py:54
↓ 1 callersFunctionget_seq_frames
(total_num_frames, desired_num_frames)
inference.py:34
↓ 1 callersFunctionget_seq_frames
(total_num_frames, desired_num_frames)
dispider/eval/model_videomme_long.py:51
↓ 1 callersFunctionget_seq_time
(vr, frame_idx, num_clip)
inference.py:45
↓ 1 callersFunctionget_seq_time
(vr, frame_idx, num_clip)
dispider/eval/model_videomme_long.py:62
↓ 1 callersMethodget_vision_tower
(self)
dispider/model/llava_arch.py:93
↓ 1 callersMethodinit_qformer
(cls, num_query_token, vision_width, cross_atte
dispider/model/multimodal_projector/builder.py:129
↓ 1 callersFunctioninsert_separator
(X, sep)
dispider/mm_utils.py:46
↓ 1 callersFunctionlinear_ramp_factor
(min, max, dim)
dispider/model/language_model/qwen_model/modeling_rope_utils.py:216
↓ 1 callersFunctionload_video
(vis_path, scene_sep, num_frm=16, max_clip=4, sample_frame=None)
inference.py:59
↓ 1 callersFunctionload_video
(vis_path, scene_sep, num_frm=16, max_clip=4, sample_frame=None)
dispider/eval/model_videomme_long.py:76
↓ 1 callersFunctionmain
()
inference.py:244
↓ 1 callersFunctionprepare_fa2_from_position_ids
This function returns necessary arguments to call `flash_attn_varlen_func`. All three query, key, value states will be flattened. Cummula
dispider/model/language_model/qwen_model/modeling_flash_attention_utils.py:133
↓ 1 callersFunctionpreprocess_phi
( sources, tokenizer: transformers.PreTrainedTokenizer, conv: Conversation, has_image: bool =
dispider/conv_template.py:86
↓ 1 callersFunctionpreprocess_question
(questions, tokenizer)
inference.py:129
↓ 1 callersFunctionpreprocess_question
(questions, tokenizer)
dispider/eval/model_videomme_long.py:162
↓ 1 callersFunctionpreprocess_time
(time, num_clip, tokenizer)
inference.py:112
↓ 1 callersFunctionpreprocess_time
(time, num_clip, tokenizer)
dispider/eval/model_videomme_long.py:145
↓ 1 callersFunctionprocess_data
(video_id, scene_sep, question, model_config, tokenizer, processor, processor_large, time_tokenizer)
inference.py:138
↓ 1 callersFunctionprocess_data
(video_id, scene_sep, question, candidates, model_config, image_folder, tokenizer, processor, processor_large,
dispider/eval/model_videomme_long.py:171
next →1–100 of 286, ranked by callers