MCPcopy Create free account

hub / github.com/HumanMLLM/ViSpeak / functions

Functions1,447 in github.com/HumanMLLM/ViSpeak

Method__getitem__
(self, idx)
VLMEvalKit/vlmeval/dataset/text_base.py:26
Method__hash__
(self)
VLMEvalKit/vlmeval/dataset/utils/tablevqabench.py:270
Method__hash__
(self)
VLMEvalKit/vlmeval/dataset/utils/tablevqabench.py:304
Method__hash__
(self)
VLMEvalKit/vlmeval/dataset/utils/tablevqabench.py:366
Method__init__
(self)
OVO-Bench/utils/OVOBenchScore.py:2
Method__init__
(self, args, results)
OVO-Bench/utils/OVOBenchScore.py:9
Method__init__
(self)
OVO-Bench/utils/OVOBench.py:9
Method__init__
(self, args)
OVO-Bench/utils/OVOBench.py:16
Method__init__
(self, args)
OVO-Bench/models/ViSpeak.py:24
Method__init__
(self, config)
vispeak/model/vispeak_arch.py:14
Method__init__
( self, enc_out_dim: int = 512, llm_embed_dim: int = 4096, )
vispeak/model/vita_tts/adapter.py:60
Method__init__
( self, enc_out_dim: int = 512, llm_embed_dim: int = 4096, kernel_size: int =
vispeak/model/vita_tts/adapter.py:73
Method__init__
(self, args)
vispeak/model/vita_tts/pipeline.py:9
Method__init__
( self, encoder: torch.nn.Module, llm_path: str, freeze_llm: bool = True,
vispeak/model/vita_tts/audioLLM.py:21
Method__init__
(self)
vispeak/model/vita_tts/encoder/subsampling.py:6
Method__init__
Construct an Conv2dSubsampling4 object.
vispeak/model/vita_tts/encoder/subsampling.py:24
Method__init__
Args: mean (torch.Tensor): mean stats istd (torch.Tensor): inverse std, std which is 1.0 / std
vispeak/model/vita_tts/encoder/cmvn.py:8
Method__init__
Construct an PositionalEncoding object.
vispeak/model/vita_tts/encoder/attention.py:15
Method__init__
Initialize class.
vispeak/model/vita_tts/encoder/attention.py:78
Method__init__
Construct an PositionwiseFeedForward object.
vispeak/model/vita_tts/encoder/attention.py:130
Method__init__
Initialize MultiLayeredConv1d module. Args: in_chans (int): Number of input channels. hidden_chans (int): Number of h
vispeak/model/vita_tts/encoder/attention.py:158
Method__init__
Construct an MultiHeadedAttention object.
vispeak/model/vita_tts/encoder/attention.py:276
Method__init__
Construct an TransformerLayer object.
vispeak/model/vita_tts/encoder/transformer.py:57
Method__init__
( self, input_dim, overview_conf = None, para_conf = None,
vispeak/model/vita_tts/encoder/encoder.py:46
Method__init__
(self, ignore_index=-1)
vispeak/model/vita_tts/decoder/decoder.py:17
Method__init__
(self, model_path)
vispeak/model/vita_tts/decoder/llm2tts.py:18
Method__init__
(self, in_channels, hidden_channels, out_channels, kernel_size=3, stride=1)
vispeak/model/vita_tts/decoder/ticodec/models.py:23
Method__init__
(self, h, channels, kernel_size=3, dilation=(1, 3, 5))
vispeak/model/vita_tts/decoder/ticodec/models.py:60
Method__init__
(self, h, channels, kernel_size=3, dilation=(1, 3))
vispeak/model/vita_tts/decoder/ticodec/models.py:134
Method__init__
Initializes the Generator module. Parameters: - h (object): Configuration object containing hyperparameters for the generato
vispeak/model/vita_tts/decoder/ticodec/models.py:170
Method__init__
(self, period, kernel_size=5, stride=3, use_spectral_norm=False)
vispeak/model/vita_tts/decoder/ticodec/models.py:258
Method__init__
(self)
vispeak/model/vita_tts/decoder/ticodec/models.py:311
Method__init__
(self, use_spectral_norm=False)
vispeak/model/vita_tts/decoder/ticodec/models.py:338
Method__init__
(self)
vispeak/model/vita_tts/decoder/ticodec/models.py:366
Method__init__
(self, n_e, e_dim)
vispeak/model/vita_tts/decoder/ticodec/models.py:526
Method__init__
(self, h)
vispeak/model/vita_tts/decoder/ticodec/models.py:541
Method__init__
(self, config_path, model_path, sample_rate=24000)
vispeak/model/vita_tts/decoder/ticodec/vqvae_tester.py:10
Method__init__
(self, *args, **kwargs)
vispeak/model/vita_tts/decoder/ticodec/vqvae.py:11
Method__init__
(self, config)
vispeak/model/language_model/vispeak_qwen2.py:297
Method__init__
(self)
vispeak/model/multimodal_projector/builder.py:13
Method__init__
(self, config=None)
vispeak/model/multimodal_projector/builder.py:25
Method__init__
(self, config=None)
vispeak/model/multimodal_projector/builder.py:48
Method__init__
(self, config=None)
vispeak/model/multimodal_projector/builder.py:78
Method__init__
(self, config=None)
vispeak/model/multimodal_projector/builder.py:106
Method__init__
(self, vision_tower, args, delay_load=False)
vispeak/model/multimodal_encoder/clip/clip_encoder.py:7
Method__init__
(self, vision_tower, args, delay_load=False)
vispeak/model/multimodal_encoder/siglip/siglip_encoder.py:83
Method__init__
( self, dataset_conf: dict = None, )
vispeak/model/multimodal_encoder/whale/init_model.py:29
Method__init__
( self, encoder: torch.nn.Module, llm_path: str, freeze_llm: bool = True,
vispeak/model/multimodal_encoder/whale/init_model.py:70
Method__init__
( self, enc_out_dim: int = 512, llm_embed_dim: int = 4096, )
vispeak/model/multimodal_encoder/whale/adapter.py:55
Method__init__
( self, enc_out_dim: int = 512, llm_embed_dim: int = 4096, kernel_size: int =
vispeak/model/multimodal_encoder/whale/adapter.py:69
Method__init__
Args: mean (torch.Tensor): mean stats istd (torch.Tensor): inverse std, std which is 1.0 / std
vispeak/model/multimodal_encoder/whale/cmvn.py:8
Method__init__
(self)
vispeak/model/multimodal_encoder/whale/module/component/subsampling.py:6
Method__init__
Construct an Conv2dSubsampling4 object.
vispeak/model/multimodal_encoder/whale/module/component/subsampling.py:25
Method__init__
(self, in_channels, n_layer=1, d_state=16, d_conv=4, expand=4, bidirectional=False)
vispeak/model/multimodal_encoder/whale/module/component/mamba.py:23
Method__init__
Construct an TransformerLayer object.
vispeak/model/multimodal_encoder/whale/module/component/transformer.py:81
Method__init__
(self, input_dim, overview_conf=None, para_conf=None, global_cmvn=None)
vispeak/model/multimodal_encoder/whale/module/encoder/encoder.py:56
Method__init__
( self, input_dim, output_dim, kernel_size, stride, causal_con
vispeak/model/multimodal_encoder/whale/module/layer/conv1d.py:7
Method__init__
( self, input_dim, output_dim, kernel_size, stride, causal_conv, dilation, dropout_rate )
vispeak/model/multimodal_encoder/whale/module/layer/dtcblock.py:11
Method__init__
Construct an PositionalEncoding object.
vispeak/model/multimodal_encoder/whale/module/layer/attention.py:18
Method__init__
Initialize class.
vispeak/model/multimodal_encoder/whale/module/layer/attention.py:79
Method__init__
Construct an PositionwiseFeedForward object.
vispeak/model/multimodal_encoder/whale/module/layer/attention.py:138
Method__init__
Initialize MultiLayeredConv1d module. Args: in_chans (int): Number of input channels. hidden_chans (int): Number of h
vispeak/model/multimodal_encoder/whale/module/layer/attention.py:168
Method__init__
Construct an MultiHeadedAttention object.
vispeak/model/multimodal_encoder/whale/module/layer/attention.py:282
Method__init__
(self, in_dim, hidden_dim)
vispeak/model/multimodal_encoder/whale/module/layer/attention.py:534
Method__init__
( self, input_dim, out_dim, hidden_dim, left_frame=1, right_fr
vispeak/model/multimodal_encoder/whale/module/layer/fsmn.py:7
Method__init__
( self, num_channels=3, patch_size=14, image_size=224, qkv_bias=False,
vispeak/model/multimodal_encoder/internvit/configuration_intern_vit.py:63
Method__init__
(self, vision_tower, args, delay_load=False)
vispeak/model/multimodal_encoder/internvit/internvit_encoder.py:9
Method__init__
(self, hidden_size, eps=1e-6)
vispeak/model/multimodal_encoder/internvit/modeling_intern_vit.py:35
Method__init__
(self, config: InternVisionConfig)
vispeak/model/multimodal_encoder/internvit/modeling_intern_vit.py:69
Method__init__
(self, config: InternVisionConfig)
vispeak/model/multimodal_encoder/internvit/modeling_intern_vit.py:128
Method__init__
(self, config: InternVisionConfig, drop_path_rate: float)
vispeak/model/multimodal_encoder/internvit/modeling_intern_vit.py:221
Method__init__
(self, config: InternVisionConfig)
vispeak/model/multimodal_encoder/internvit/modeling_intern_vit.py:266
Method__init__
(self, config: InternVisionConfig)
vispeak/model/multimodal_encoder/internvit/modeling_intern_vit.py:326
Method__init__
(self, softmax_scale=None, attention_dropout=0.0, device=None, dtype=None)
vispeak/model/multimodal_encoder/internvit/flash_attention.py:27
Method__init__
(self, vision_tower, args, delay_load=False)
vispeak/model/multimodal_encoder/eva_clip/eva_clip_encoder.py:9
Method__init__
(self, mean=None, std=None)
vispeak/model/multimodal_encoder/eva_clip/eva_clip_processors.py:23
Method__init__
(self, image_size=224, mean=None, std=None, min_scale=0.5, max_scale=1.0)
vispeak/model/multimodal_encoder/eva_clip/eva_clip_processors.py:35
Method__init__
( self, dim, pt_seq_len, ft_seq_len=None, custom_freqs=None, f
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:53
Method__init__
(self, prob, exclude_first_token=True)
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:128
Method__init__
(self, drop_prob=None)
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:184
Method__init__
( self, in_features, hidden_features=None, out_features=None, act_laye
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:230
Method__init__
( self, dim, num_heads=8, qkv_bias=False, qk_scale=None, attn_
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:264
Method__init__
( self, dim, num_heads, mlp_ratio=4.0, qkv_bias=False, qk_scal
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:431
Method__init__
(self, img_size=224, patch_size=16, in_chans=3, embed_dim=768)
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:528
Method__init__
(self, window_size, num_heads)
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:551
Method__init__
( self, img_size=224, patch_size=16, in_chans=3, num_classes=1000,
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:594
Method__init__
(self, vision_tower_path)
vispeak/model/multimodal_encoder/eva_clip/eva_vit.py:946
Method__init__
( self, batch_size: int, world_size: int, lengths: Optional[List[int]] = None,
vispeak/train/vispeak_trainer.py:123
Method__init__
(self, logger, log_level=logging.INFO)
vispeak/util/utils.py:73
Method__init__
(self, tokenizer: transformers.PreTrainedTokenizer, data_args: DataArguments)
vispeak/util/data_utils.py:681
Method__init__
(self, keywords, tokenizer, input_ids)
vispeak/util/mm_utils.py:129
Method__init__
(self)
StreamingBench/src/model/ViSpeak.py:18
Method__init__
Initialize the model
StreamingBench/src/model/modelclass.py:2
Method__init__
(self, data, video_root)
StreamingBench/src/benchmark/StreamingBench.py:24
Method__init__
Initialize the benchmark based on the given data. data: data input
StreamingBench/src/benchmark/Benchmark.py:2
Method__init__
(self, data, video_root)
StreamingBench/src/benchmark/StreamingBenchOmni.py:24
Method__init__
(self, data, video_root)
StreamingBench/src/benchmark/StreamingBenchProactive.py:18
Method__init__
(self, data, video_root)
StreamingBench/src/benchmark/StreamingBenchSQA.py:25
Method__init__
(self, ds)
audio_eval/eval_asr.py:77
Method__init__
(self, size)
audio_eval/eval_asr.py:135
← previousnext →701–800 of 1,447, ranked by callers