MCPcopy Create free account

hub / github.com/VITA-MLLM/VITA / types & classes

Types & classes320 in github.com/VITA-MLLM/VITA

↓ 13 callersClassKeywordsStoppingCriteria
vita/util/mm_utils.py:121
↓ 9 callersClassConversation
A class that keeps all conversation history.
vita/conversation.py:18
↓ 6 callersClassQuantizer_module
vita/model/vita_tts/decoder/ticodec/models.py:525
↓ 5 callersClassDiscriminatorP
vita/model/vita_tts/decoder/ticodec/models.py:257
↓ 5 callersClassGroupScale
Rescales the input PIL.Image to the given 'size'. 'size' will be the size of the smaller edge. For example, if height > width, then image wil
VLMEvalKit/vlmeval/dataset/utils/mvbench.py:150
↓ 4 callersClassCrossEntropyLoss
vita/model/vita_tts/decoder/decoder.py:16
↓ 3 callersClassBlock
vita/model/multimodal_encoder/eva_clip/eva_vit.py:430
↓ 3 callersClassDiscriminatorS
vita/model/vita_tts/decoder/ticodec/models.py:337
↓ 3 callersClassDropPath
Drop paths (Stochastic Depth) per sample (when applied in main path of residual blocks).
vita/model/multimodal_encoder/eva_clip/eva_vit.py:181
↓ 2 callersClassAttention
vita/model/multimodal_encoder/eva_clip/eva_vit.py:263
↓ 2 callersClassGroupCenterCrop
VLMEvalKit/vlmeval/dataset/utils/mvbench.py:106
↓ 2 callersClassGroupNormalize
VLMEvalKit/vlmeval/dataset/utils/mvbench.py:134
↓ 2 callersClassInternRMSNorm
vita/model/multimodal_encoder/internvit/modeling_intern_vit.py:34
↓ 2 callersClassNumberValue
VLMEvalKit/vlmeval/dataset/utils/tablevqabench.py:284
↓ 2 callersClassQwen2Model
web_demo/vllm_tools/vllm_file/qwen2.py:571
↓ 2 callersClassStack
VLMEvalKit/vlmeval/dataset/utils/mvbench.py:405
↓ 2 callersClassStoppingCriteriaSub
VLMEvalKit/vlmeval/vlm/xcomposer/xcomposer.py:10
↓ 2 callersClassStreamToLogger
Fake file-like stream object that redirects writes to a logger instance.
vita/util/utils.py:68
↓ 2 callersClassToTorchFormatTensor
Converts a PIL.Image (RGB) or numpy.ndarray (H x W x C) in the range [0, 255] to a torch.FloatTensor of shape (C x H x W) in the range [0.0, 1.0]
VLMEvalKit/vlmeval/dataset/utils/mvbench.py:424
↓ 2 callersClassVADIterator
web_demo/wakeup_and_vad/wakeup_and_vad.py:12
↓ 2 callersClassllm2TTS
vita/model/vita_tts/decoder/llm2tts.py:17
↓ 1 callersClassAttrDict
vita/model/vita_tts/decoder/ticodec/vqvae.py:10
↓ 1 callersClassAudioLLM
vita/model/vita_tts/audioLLM.py:20
↓ 1 callersClassCLIPVisionCfg
vita/model/multimodal_encoder/eva_clip/eva_vit.py:877
↓ 1 callersClassCLIPVisionTower
vita/model/multimodal_encoder/clip/clip_encoder.py:6
↓ 1 callersClassCNNAdapter
vita/model/vita_tts/adapter.py:10
↓ 1 callersClassCNNAdapter
vita/model/multimodal_encoder/whale/adapter.py:6
↓ 1 callersClassCNNSubsampling
vita/model/vita_tts/adapter.py:72
↓ 1 callersClassCNNSubsampling
vita/model/multimodal_encoder/whale/adapter.py:68
↓ 1 callersClassCOCO_Caption_Scorer
VLMEvalKit/vlmeval/dataset/image_caption.py:5
↓ 1 callersClassConv2dSubsampling4
Convolutional 2D subsampling (to 1/4 length). Args: idim (int): Input dimension. odim (int): Output dimension. dropout_ra
vita/model/vita_tts/encoder/subsampling.py:15
↓ 1 callersClassConv2dSubsampling4
Convolutional 2D subsampling (to 1/4 length). Args: idim (int): Input dimension. odim (int): Output dimension. dropout_ra
vita/model/multimodal_encoder/whale/module/component/subsampling.py:15
↓ 1 callersClassCustomMCQDataset
VLMEvalKit/vlmeval/dataset/image_mcq.py:629
↓ 1 callersClassCustomTextMCQDataset
VLMEvalKit/vlmeval/dataset/text_mcq.py:112
↓ 1 callersClassCustomVQADataset
VLMEvalKit/vlmeval/dataset/image_vqa.py:473
↓ 1 callersClassDataCollatorForSupervisedDataset
Collate examples for supervised fine-tuning.
vita/util/data_utils_video_audio_patch.py:1248
↓ 1 callersClassDataCollatorForSupervisedDataset
Collate examples for supervised fine-tuning.
vita/util/data_utils_video_audio_neg_patch.py:1390
↓ 1 callersClassDataCollatorForSupervisedDataset
Collate examples for supervised fine-tuning.
vita/util/data_utils_video_audio_neg_patch_fo.py:1390
↓ 1 callersClassDataCollatorForSupervisedDataset
Collate examples for supervised fine-tuning.
vita/util/data_utils_video_patch_audio.py:1298
↓ 1 callersClassDataCollatorForSupervisedDataset
Collate examples for supervised fine-tuning.
vita/util/data_utils_video_audio_neg_frameCat.py:1127
↓ 1 callersClassDataCollatorForSupervisedDataset
Collate examples for supervised fine-tuning.
vita/util/data_utils_video_audio.py:754
↓ 1 callersClassDataCollatorForSupervisedDataset
Collate examples for supervised fine-tuning.
vita/util/data_utils_video_audio_patch_sf.py:1254
↓ 1 callersClassDateValue
VLMEvalKit/vlmeval/dataset/utils/tablevqabench.py:339
↓ 1 callersClassDownloadProgressBar
VLMEvalKit/vlmeval/smp/file.py:184
↓ 1 callersClassEVAVisionTransformer
Vision Transformer with support for patch or hybrid CNN input stage
vita/model/multimodal_encoder/eva_clip/eva_vit.py:591
↓ 1 callersClassEncoder
vita/model/vita_tts/decoder/ticodec/models.py:429
↓ 1 callersClassEva2LargePlusEncoder
vita/model/multimodal_encoder/eva_clip/eva_vit.py:945
↓ 1 callersClassEvaClipImageTrainProcessor
vita/model/multimodal_encoder/eva_clip/eva_clip_processors.py:34
↓ 1 callersClassEvaClipVisionTower
vita/model/multimodal_encoder/eva_clip/eva_clip_encoder.py:8
↓ 1 callersClassFlashAttention
Implement the scaled dot product attention with softmax. Arguments --------- softmax_scale: The temperature to use for the softmax att
vita/model/multimodal_encoder/internvit/flash_attention.py:16
↓ 1 callersClassGenerator
vita/model/vita_tts/decoder/ticodec/models.py:169
↓ 1 callersClassGlobalCMVN
vita/model/vita_tts/encoder/cmvn.py:7
↓ 1 callersClassGlobalCMVN
vita/model/multimodal_encoder/whale/cmvn.py:7
↓ 1 callersClassGlobalParams
web_demo/vita_html/web/parms.py:7
↓ 1 callersClassGlobalTokenEncoder
vita/model/vita_tts/decoder/ticodec/models.py:22
↓ 1 callersClassGroupRandomCrop
VLMEvalKit/vlmeval/dataset/utils/mvbench.py:50
↓ 1 callersClassIdentityMap
vita/model/multimodal_projector/builder.py:12
↓ 1 callersClassInternAttention
Multi-headed attention from 'Attention Is All You Need' paper
vita/model/multimodal_encoder/internvit/modeling_intern_vit.py:125
↓ 1 callersClassInternMLP
vita/model/multimodal_encoder/internvit/modeling_intern_vit.py:205
↓ 1 callersClassInternViTVisionTower
vita/model/multimodal_encoder/internvit/internvit_encoder.py:8
↓ 1 callersClassInternVisionConfig
r""" This is the configuration class to store the configuration of a [`InternVisionModel`]. It is used to instantiate a vision encoder accordi
web_demo/vllm_tools/qwen2p5_model_weight_file/configuration_intern_vit.py:15
↓ 1 callersClassInternVisionEmbeddings
vita/model/multimodal_encoder/internvit/modeling_intern_vit.py:68
↓ 1 callersClassInternVisionEncoder
Transformer encoder consisting of `config.num_hidden_layers` self attention layers. Each layer is a [`InternEncoderLayer`]. Args:
vita/model/multimodal_encoder/internvit/modeling_intern_vit.py:256
↓ 1 callersClassInternVisionEncoderLayer
vita/model/multimodal_encoder/internvit/modeling_intern_vit.py:220
↓ 1 callersClassInternVisionModel
vita/model/multimodal_encoder/internvit/modeling_intern_vit.py:321
↓ 1 callersClassLDPBlock
vita/model/multimodal_projector/builder.py:75
↓ 1 callersClassLDPNetProjector
vita/model/multimodal_projector/builder.py:105
↓ 1 callersClassLLM2TTSCodecAR
E2E module. Args: idim (int): dimension of inputs odim (int): dimension of outputs args (namespace): argument Namespace c
vita/model/vita_tts/decoder/decoder.py:32
↓ 1 callersClassLazySupervisedDataset
Dataset for supervised fine-tuning.
vita/util/data_utils_video_audio_patch.py:685
↓ 1 callersClassLazySupervisedDataset
Dataset for supervised fine-tuning.
vita/util/data_utils_video_audio_neg_patch.py:827
↓ 1 callersClassLazySupervisedDataset
Dataset for supervised fine-tuning.
vita/util/data_utils_video_audio_neg_patch_fo.py:825
↓ 1 callersClassLazySupervisedDataset
Dataset for supervised fine-tuning.
vita/util/data_utils_video_patch_audio.py:731
↓ 1 callersClassLazySupervisedDataset
Dataset for supervised fine-tuning.
vita/util/data_utils_video_audio_neg_frameCat.py:559
↓ 1 callersClassLazySupervisedDataset
Dataset for supervised fine-tuning.
vita/util/data_utils_video_audio.py:371
↓ 1 callersClassLazySupervisedDataset
Dataset for supervised fine-tuning.
vita/util/data_utils_video_audio_patch_sf.py:685
↓ 1 callersClassLengthGroupedSampler
r""" Sampler that samples indices in a way that groups together features of the dataset of roughly the same length while keeping a bit of rand
vita/train/vita_trainer.py:117
↓ 1 callersClassLinearAdapter
vita/model/vita_tts/adapter.py:59
↓ 1 callersClassLinearAdapter
vita/model/multimodal_encoder/whale/adapter.py:54
↓ 1 callersClassMMAlaya2
This implementation fine-tunes 20 LoRA modules based on the InternVL-Chat-V1-5 model. The fine-tuned LoRA modules are then merged with the In
VLMEvalKit/vlmeval/vlm/mmalaya.py:193
↓ 1 callersClassMambaBlock
vita/model/multimodal_encoder/whale/module/component/mamba.py:22
↓ 1 callersClassMambaSSM
vita/model/multimodal_encoder/whale/module/component/mamba.py:83
↓ 1 callersClassMinigpt
vita/model/multimodal_projector/builder.py:24
↓ 1 callersClassMlp
vita/model/multimodal_encoder/eva_clip/eva_vit.py:195
↓ 1 callersClassMultiHeadedAttention
Multi-Head Attention layer. :param int n_head: the number of head s :param int n_feat: the number of features :param float dropout_rate:
vita/model/vita_tts/encoder/attention.py:268
↓ 1 callersClassMultiHeadedAttention
Multi-Head Attention layer. :param int n_head: the number of head s :param int n_feat: the number of features :param float dropout_rate:
vita/model/multimodal_encoder/whale/module/layer/attention.py:273
↓ 1 callersClassMultiSequential
Multi-input multi-output torch.nn.Sequential.
vita/model/vita_tts/encoder/transformer.py:27
↓ 1 callersClassMultiSequential
Multi-input multi-output torch.nn.Sequential.
vita/model/multimodal_encoder/whale/module/component/transformer.py:35
↓ 1 callersClassOpenAIWrapper
VLMEvalKit/vlmeval/api/gpt.py:32
↓ 1 callersClassPCMQueue
web_demo/vita_html/web/queue.py:12
↓ 1 callersClassPatchDropout
https://arxiv.org/abs/2212.00794
vita/model/multimodal_encoder/eva_clip/eva_vit.py:123
↓ 1 callersClassPatchEmbed
Image to Patch Embedding
vita/model/multimodal_encoder/eva_clip/eva_vit.py:525
↓ 1 callersClassQuantizer
vita/model/vita_tts/decoder/ticodec/models.py:540
↓ 1 callersClassQwen2Attention
web_demo/vllm_tools/vllm_file/qwen2.py:432
↓ 1 callersClassQwen2DecoderLayer
web_demo/vllm_tools/vllm_file/qwen2.py:509
↓ 1 callersClassQwen2ImagePixelInputs
web_demo/vllm_tools/vllm_file/qwen2.py:72
↓ 1 callersClassQwen2MLP
web_demo/vllm_tools/vllm_file/qwen2.py:402
↓ 1 callersClassQwen2MultiModalAudioProjector
web_demo/vllm_tools/vllm_file/qwen2.py:803
↓ 1 callersClassQwen2MultiModalVisionProjector
web_demo/vllm_tools/vllm_file/qwen2.py:788
↓ 1 callersClassRelPositionalEncoding
Relative positional encoding module. See : Appendix B in https://arxiv.org/abs/1901.02860 Args: d_model (int): Embedding dimension.
web_demo/vllm_tools/vllm_file/whale.py:274
↓ 1 callersClassRelativePositionBias
vita/model/multimodal_encoder/eva_clip/eva_vit.py:550
next →1–100 of 320, ranked by callers