MCPcopy Create free account

hub / github.com/UCSC-VLAA/OpenVision / types & classes

Types & classes90 in github.com/UCSC-VLAA/OpenVision

↓ 7 callersClassDropPath
src/models/common.py:659
↓ 4 callersClassLayerScale
src/convert_upload/open_clip/transformer.py:39
↓ 4 callersClassPreprocessCfg
src/convert_upload/open_clip/transform.py:17
↓ 3 callersClassAttentionalPooler
src/convert_upload/open_clip/transformer.py:187
↓ 3 callersClassCLIPTextCfg
src/convert_upload/open_clip/model.py:60
↓ 3 callersClassCLIPVisionCfg
src/convert_upload/open_clip/model.py:28
↓ 3 callersClassEncoder
Transformer Model Encoder for sequence to sequence translation.
src/models/text_transformer.py:509
↓ 3 callersClassHFTokenizer
HuggingFace tokenizer wrapper
src/convert_upload/open_clip/tokenizer.py:404
↓ 3 callersClassHParams
Parameters for AutoAugment and RandAugment.
src/transforms/autoaugment.py:47
↓ 3 callersClassMlpBlock
Transformer MLP / feed-forward block.
src/models/text_transformer.py:91
↓ 2 callersClassAugmentationCfg
src/convert_upload/open_clip/transform.py:62
↓ 2 callersClassBigVisionMetricWriter
A class for logging metrics.
src/helpers/utils.py:836
↓ 2 callersClassBottleneck
src/convert_upload/open_clip/modified_resnet.py:10
↓ 2 callersClassCLIP
src/convert_upload/open_clip/model.py:222
↓ 2 callersClassCarry
src/models/bpt.py:158
↓ 2 callersClassLayerScale
src/models/vit.py:227
↓ 2 callersClassMlpBlock
Transformer MLP / feed-forward block.
src/models/vit.py:181
↓ 2 callersClassMultimodalCfg
src/convert_upload/open_clip/coca_model.py:47
↓ 2 callersClassResidualAttentionBlock
src/convert_upload/open_clip/transformer.py:210
↓ 2 callersClassResizeKeepRatio
Resize and Keep Ratio Copy & paste from `timm`
src/convert_upload/open_clip/transform.py:88
↓ 2 callersClassSimpleTokenizer
src/convert_upload/open_clip/tokenizer.py:134
↓ 2 callersClassTransformer
src/convert_upload/open_clip/transformer.py:319
↓ 1 callersClassAttention
src/convert_upload/open_clip/transformer.py:89
↓ 1 callersClassAttentionPool2d
src/convert_upload/open_clip/modified_resnet.py:58
↓ 1 callersClassCLIPS_Tokenizer
HuggingFace tokenizer wrapper
src/convert_upload/open_clip/tokenizer.py:552
↓ 1 callersClassCenterCropOrPad
Crops the given image at the center. If the image is torch Tensor, it is expected to have [..., H, W] shape, where ... means an arbitrary numb
src/convert_upload/open_clip/transform.py:207
↓ 1 callersClassChrono
Measures time and reports progress, hyper-specific to our train loops. Some concepts: 1. This differentiates between three "types" of time: -
src/helpers/utils.py:266
↓ 1 callersClassClipLoss
src/convert_upload/open_clip/loss.py:66
↓ 1 callersClassCoCa
src/convert_upload/open_clip/coca_model.py:89
↓ 1 callersClassCoCaLoss
src/convert_upload/open_clip/loss.py:134
↓ 1 callersClassCrossAttnEncoder
A Transformer Encoder with interleaved self-attention and cross-attention. This architecture processes a primary sequence `x` (e.g., text) by alt
src/models/text_decoder_v2.py:285
↓ 1 callersClassCrossAttnEncoder
Transformer Model Encoder for sequence to sequence translation.
src/models/text_decoder.py:335
↓ 1 callersClassCustomMultiheadAttention
src/models/vit.py:43
↓ 1 callersClassCustomResidualAttentionBlock
src/convert_upload/open_clip/transformer.py:268
↓ 1 callersClassCustomTextCLIP
src/convert_upload/open_clip/model.py:320
↓ 1 callersClassCustomTokenizer
Custom tokenizer using WordPiece-based subword tokenization
src/convert_upload/open_clip/tokenizer.py:522
↓ 1 callersClassDistillClipLoss
src/convert_upload/open_clip/loss.py:180
↓ 1 callersClassEncoder
Transformer Model Encoder for sequence to sequence translation.
src/models/vit.py:337
↓ 1 callersClassHFTextEncoder
HuggingFace model adapter
src/convert_upload/open_clip/hf_model.py:96
↓ 1 callersClassLayerNorm
Subclass torch's LayerNorm (with cast back to input dtype).
src/convert_upload/open_clip/transformer.py:24
↓ 1 callersClassMAPHead
Multihead Attention Pooling.
src/models/vit.py:404
↓ 1 callersClassMixupAndCutmix
Applies Mixup and/or Cutmix to a batch of images. - Mixup: https://arxiv.org/abs/1710.09412 - Cutmix: https://arxiv.org/abs/1905.04899 Implement
src/transforms/mixup.py:29
↓ 1 callersClassModifiedResNet
A ResNet class that is similar to torchvision's but contains the following changes: - There are now 3 "stem" convolutions as opposed to 1, wi
src/convert_upload/open_clip/modified_resnet.py:95
↓ 1 callersClassMsg
src/helpers/utils.py:611
↓ 1 callersClassMultiHeadDotProductAttention
src/models/text_transformer.py:133
↓ 1 callersClassMultiHeadDotProductAttention
Multi-head dot-product attention with optional TPU Flash Attention. This class extends Flax's default MHA to include support for a highly opt
src/models/text_decoder_v2.py:61
↓ 1 callersClassMultiHeadDotProductAttention
src/models/text_decoder.py:51
↓ 1 callersClassMultimodalTransformer
src/convert_upload/open_clip/transformer.py:820
↓ 1 callersClassPatchDropout
https://arxiv.org/abs/2212.00794
src/convert_upload/open_clip/transformer.py:49
↓ 1 callersClassRandomErasing
Applies RandomErasing to a single image. Reference: https://arxiv.org/abs/1708.04896 Implementation is inspired by https://github.com/rwightman/
src/transforms/random_erasing.py:99
↓ 1 callersClassSigLipLoss
Sigmoid Loss for Language Image Pre-Training (SigLIP) - https://arxiv.org/abs/2303.15343 @article{zhai2023sigmoid, title={Sigmoid loss for
src/convert_upload/open_clip/loss.py:307
↓ 1 callersClassTextTransformer
src/convert_upload/open_clip/transformer.py:670
↓ 1 callersClassTimmModel
timm model adapter
src/convert_upload/open_clip/timm_model.py:28
↓ 1 callersClassVisionTransformer
src/convert_upload/open_clip/transformer.py:434
↓ 1 callersClass_CacheablePartial
partial(fn, **kwargs) that defines hash and eq - to help with jit caches. This is particularly common in evaluators when one has many evaluator i
src/evaluators/common.py:82
↓ 1 callersClass_Model
ViT model.
src/models/vit.py:427
↓ 1 callersClass_Model
ViT model.
src/models/text_transformer.py:589
↓ 1 callersClass_Model
Core implementation of the image-text autoregressive Transformer. Attributes: fusion_style: Method to combine image and text features.
src/models/text_decoder_v2.py:361
↓ 1 callersClass_Model
A image-text autoregression Transformer model.
src/models/text_decoder.py:414
↓ 1 callersClasscolor_jitter
Apply Color Jitter to the PIL image with a specified probability.
src/convert_upload/open_clip/transform.py:242
↓ 1 callersClassgray_scale
Apply Gray Scale to the PIL image with a specified probability.
src/convert_upload/open_clip/transform.py:258
ClassAddPositionEmbs
Adds positional embeddings to the inputs, supports caching for decode. Attributes: decode: whether to run in single-position autoregressive mod
src/models/common.py:618
ClassAttentionalPooler
src/models/vit.py:90
ClassBaseModelOutput
src/convert_upload/open_clip/hf_model.py:20
ClassClsLastHiddenStatePooler
CLS token pooling NOTE: this is equivalent to ClsPooler above with use_pooler_output=False
src/convert_upload/open_clip/hf_model.py:83
ClassClsPooler
CLS token pooling
src/convert_upload/open_clip/hf_model.py:64
ClassCrossAttnEncoder1DBlock
A Transformer block with cross-attention followed by an MLP. This block takes two inputs: `x` (typically text embeddings) which acts as the q
src/models/text_decoder_v2.py:208
ClassCrossAttnEncoder1DBlock
Single transformer encoder block (MHSA + MLP).
src/models/text_decoder.py:249
ClassCustomTransformer
A custom transformer that can use different block types.
src/convert_upload/open_clip/transformer.py:369
ClassDataSource
The API that any data source should implement.
src/datasets/core.py:22
ClassDataSource
Use TFDS as a data source.
src/datasets/tfds.py:26
ClassEncoder1DBlock
Single transformer encoder block (MHSA + MLP).
src/models/vit.py:245
ClassEncoder1DBlock
Single transformer encoder block (MHSA + MLP).
src/models/text_transformer.py:384
ClassEvaluator
Image/text retrieval evaluator.
src/evaluators/proj/image_text/retrieval.py:154
ClassEvaluator
Contrastive evaluator.
src/evaluators/proj/image_text/contrastive.py:73
ClassEvaluator
Zero-shot classification evaluator.
src/evaluators/proj/image_text/discriminative_classifier.py:178
ClassImageAugment
Image augmentation class for applying image distortions.
src/transforms/random_erasing.py:64
ClassInKeyOutKey
Decorator for preprocessing ops, which adds `inkey` and `outkey` arguments. Note: Only supports single-input single-output ops.
src/helpers/registry.py:41
ClassLayerNormFp32
Subclass torch's LayerNorm to handle fp16 (by casting to float32 and back).
src/convert_upload/open_clip/transformer.py:15
ClassMaxPooler
Max pooling
src/convert_upload/open_clip/hf_model.py:55
ClassMeanPooler
Mean pooling
src/convert_upload/open_clip/hf_model.py:46
ClassModel
src/models/two_towers.py:35
ClassModel
A multi-modal model combining an image encoder and a text decoder. This class serves as a container that orchestrates the forward pass through
src/models/openvision2_model.py:50
ClassMultiHeadDotProductAttention
Multi-head dot-product attention. Attributes: num_heads: number of attention heads. Features (i.e. inputs_q.shape[-1]) should be di
src/models/common.py:203
ClassNeighbourExchange
src/convert_upload/open_clip/loss.py:272
ClassNeighbourExchangeBidir
src/convert_upload/open_clip/loss.py:289
ClassPretrainedConfig
src/convert_upload/open_clip/hf_model.py:24
ClassQuickGELU
src/convert_upload/open_clip/transformer.py:33
ClassRegistry
Implements global Registry. Authors: Joan Puigcerver (jpuigcerver@), Alexander Kolesnikov (akolesnikov@)
src/helpers/registry.py:128
ClassSigLipTokenizer
HuggingFace tokenizer wrapper for SigLIP T5 compatible sentencepiece vocabs
src/convert_upload/open_clip/tokenizer.py:464