Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/UCSC-VLAA/OpenVision
/ types & classes
Types & classes
90 in github.com/UCSC-VLAA/OpenVision
⨍
Functions
716
◇
Types & classes
90
↳
Endpoints
1
↓ 7 callers
Class
DropPath
src/models/common.py:659
↓ 4 callers
Class
LayerScale
src/convert_upload/open_clip/transformer.py:39
↓ 4 callers
Class
PreprocessCfg
src/convert_upload/open_clip/transform.py:17
↓ 3 callers
Class
AttentionalPooler
src/convert_upload/open_clip/transformer.py:187
↓ 3 callers
Class
CLIPTextCfg
src/convert_upload/open_clip/model.py:60
↓ 3 callers
Class
CLIPVisionCfg
src/convert_upload/open_clip/model.py:28
↓ 3 callers
Class
Encoder
Transformer Model Encoder for sequence to sequence translation.
src/models/text_transformer.py:509
↓ 3 callers
Class
HFTokenizer
HuggingFace tokenizer wrapper
src/convert_upload/open_clip/tokenizer.py:404
↓ 3 callers
Class
HParams
Parameters for AutoAugment and RandAugment.
src/transforms/autoaugment.py:47
↓ 3 callers
Class
MlpBlock
Transformer MLP / feed-forward block.
src/models/text_transformer.py:91
↓ 2 callers
Class
AugmentationCfg
src/convert_upload/open_clip/transform.py:62
↓ 2 callers
Class
BigVisionMetricWriter
A class for logging metrics.
src/helpers/utils.py:836
↓ 2 callers
Class
Bottleneck
src/convert_upload/open_clip/modified_resnet.py:10
↓ 2 callers
Class
CLIP
src/convert_upload/open_clip/model.py:222
↓ 2 callers
Class
Carry
src/models/bpt.py:158
↓ 2 callers
Class
LayerScale
src/models/vit.py:227
↓ 2 callers
Class
MlpBlock
Transformer MLP / feed-forward block.
src/models/vit.py:181
↓ 2 callers
Class
MultimodalCfg
src/convert_upload/open_clip/coca_model.py:47
↓ 2 callers
Class
ResidualAttentionBlock
src/convert_upload/open_clip/transformer.py:210
↓ 2 callers
Class
ResizeKeepRatio
Resize and Keep Ratio Copy & paste from `timm`
src/convert_upload/open_clip/transform.py:88
↓ 2 callers
Class
SimpleTokenizer
src/convert_upload/open_clip/tokenizer.py:134
↓ 2 callers
Class
Transformer
src/convert_upload/open_clip/transformer.py:319
↓ 1 callers
Class
Attention
src/convert_upload/open_clip/transformer.py:89
↓ 1 callers
Class
AttentionPool2d
src/convert_upload/open_clip/modified_resnet.py:58
↓ 1 callers
Class
CLIPS_Tokenizer
HuggingFace tokenizer wrapper
src/convert_upload/open_clip/tokenizer.py:552
↓ 1 callers
Class
CenterCropOrPad
Crops the given image at the center. If the image is torch Tensor, it is expected to have [..., H, W] shape, where ... means an arbitrary numb
src/convert_upload/open_clip/transform.py:207
↓ 1 callers
Class
Chrono
Measures time and reports progress, hyper-specific to our train loops. Some concepts: 1. This differentiates between three "types" of time: -
src/helpers/utils.py:266
↓ 1 callers
Class
ClipLoss
src/convert_upload/open_clip/loss.py:66
↓ 1 callers
Class
CoCa
src/convert_upload/open_clip/coca_model.py:89
↓ 1 callers
Class
CoCaLoss
src/convert_upload/open_clip/loss.py:134
↓ 1 callers
Class
CrossAttnEncoder
A Transformer Encoder with interleaved self-attention and cross-attention. This architecture processes a primary sequence `x` (e.g., text) by alt
src/models/text_decoder_v2.py:285
↓ 1 callers
Class
CrossAttnEncoder
Transformer Model Encoder for sequence to sequence translation.
src/models/text_decoder.py:335
↓ 1 callers
Class
CustomMultiheadAttention
src/models/vit.py:43
↓ 1 callers
Class
CustomResidualAttentionBlock
src/convert_upload/open_clip/transformer.py:268
↓ 1 callers
Class
CustomTextCLIP
src/convert_upload/open_clip/model.py:320
↓ 1 callers
Class
CustomTokenizer
Custom tokenizer using WordPiece-based subword tokenization
src/convert_upload/open_clip/tokenizer.py:522
↓ 1 callers
Class
DistillClipLoss
src/convert_upload/open_clip/loss.py:180
↓ 1 callers
Class
Encoder
Transformer Model Encoder for sequence to sequence translation.
src/models/vit.py:337
↓ 1 callers
Class
HFTextEncoder
HuggingFace model adapter
src/convert_upload/open_clip/hf_model.py:96
↓ 1 callers
Class
LayerNorm
Subclass torch's LayerNorm (with cast back to input dtype).
src/convert_upload/open_clip/transformer.py:24
↓ 1 callers
Class
MAPHead
Multihead Attention Pooling.
src/models/vit.py:404
↓ 1 callers
Class
MixupAndCutmix
Applies Mixup and/or Cutmix to a batch of images. - Mixup: https://arxiv.org/abs/1710.09412 - Cutmix: https://arxiv.org/abs/1905.04899 Implement
src/transforms/mixup.py:29
↓ 1 callers
Class
ModifiedResNet
A ResNet class that is similar to torchvision's but contains the following changes: - There are now 3 "stem" convolutions as opposed to 1, wi
src/convert_upload/open_clip/modified_resnet.py:95
↓ 1 callers
Class
Msg
src/helpers/utils.py:611
↓ 1 callers
Class
MultiHeadDotProductAttention
src/models/text_transformer.py:133
↓ 1 callers
Class
MultiHeadDotProductAttention
Multi-head dot-product attention with optional TPU Flash Attention. This class extends Flax's default MHA to include support for a highly opt
src/models/text_decoder_v2.py:61
↓ 1 callers
Class
MultiHeadDotProductAttention
src/models/text_decoder.py:51
↓ 1 callers
Class
MultimodalTransformer
src/convert_upload/open_clip/transformer.py:820
↓ 1 callers
Class
PatchDropout
https://arxiv.org/abs/2212.00794
src/convert_upload/open_clip/transformer.py:49
↓ 1 callers
Class
RandomErasing
Applies RandomErasing to a single image. Reference: https://arxiv.org/abs/1708.04896 Implementation is inspired by https://github.com/rwightman/
src/transforms/random_erasing.py:99
↓ 1 callers
Class
SigLipLoss
Sigmoid Loss for Language Image Pre-Training (SigLIP) - https://arxiv.org/abs/2303.15343 @article{zhai2023sigmoid, title={Sigmoid loss for
src/convert_upload/open_clip/loss.py:307
↓ 1 callers
Class
TextTransformer
src/convert_upload/open_clip/transformer.py:670
↓ 1 callers
Class
TimmModel
timm model adapter
src/convert_upload/open_clip/timm_model.py:28
↓ 1 callers
Class
VisionTransformer
src/convert_upload/open_clip/transformer.py:434
↓ 1 callers
Class
_CacheablePartial
partial(fn, **kwargs) that defines hash and eq - to help with jit caches. This is particularly common in evaluators when one has many evaluator i
src/evaluators/common.py:82
↓ 1 callers
Class
_Model
ViT model.
src/models/vit.py:427
↓ 1 callers
Class
_Model
ViT model.
src/models/text_transformer.py:589
↓ 1 callers
Class
_Model
Core implementation of the image-text autoregressive Transformer. Attributes: fusion_style: Method to combine image and text features.
src/models/text_decoder_v2.py:361
↓ 1 callers
Class
_Model
A image-text autoregression Transformer model.
src/models/text_decoder.py:414
↓ 1 callers
Class
color_jitter
Apply Color Jitter to the PIL image with a specified probability.
src/convert_upload/open_clip/transform.py:242
↓ 1 callers
Class
gray_scale
Apply Gray Scale to the PIL image with a specified probability.
src/convert_upload/open_clip/transform.py:258
Class
AddPositionEmbs
Adds positional embeddings to the inputs, supports caching for decode. Attributes: decode: whether to run in single-position autoregressive mod
src/models/common.py:618
Class
AttentionalPooler
src/models/vit.py:90
Class
BaseModelOutput
src/convert_upload/open_clip/hf_model.py:20
Class
ClsLastHiddenStatePooler
CLS token pooling NOTE: this is equivalent to ClsPooler above with use_pooler_output=False
src/convert_upload/open_clip/hf_model.py:83
Class
ClsPooler
CLS token pooling
src/convert_upload/open_clip/hf_model.py:64
Class
CrossAttnEncoder1DBlock
A Transformer block with cross-attention followed by an MLP. This block takes two inputs: `x` (typically text embeddings) which acts as the q
src/models/text_decoder_v2.py:208
Class
CrossAttnEncoder1DBlock
Single transformer encoder block (MHSA + MLP).
src/models/text_decoder.py:249
Class
CustomTransformer
A custom transformer that can use different block types.
src/convert_upload/open_clip/transformer.py:369
Class
DataSource
The API that any data source should implement.
src/datasets/core.py:22
Class
DataSource
Use TFDS as a data source.
src/datasets/tfds.py:26
Class
Encoder1DBlock
Single transformer encoder block (MHSA + MLP).
src/models/vit.py:245
Class
Encoder1DBlock
Single transformer encoder block (MHSA + MLP).
src/models/text_transformer.py:384
Class
Evaluator
Image/text retrieval evaluator.
src/evaluators/proj/image_text/retrieval.py:154
Class
Evaluator
Contrastive evaluator.
src/evaluators/proj/image_text/contrastive.py:73
Class
Evaluator
Zero-shot classification evaluator.
src/evaluators/proj/image_text/discriminative_classifier.py:178
Class
ImageAugment
Image augmentation class for applying image distortions.
src/transforms/random_erasing.py:64
Class
InKeyOutKey
Decorator for preprocessing ops, which adds `inkey` and `outkey` arguments. Note: Only supports single-input single-output ops.
src/helpers/registry.py:41
Class
LayerNormFp32
Subclass torch's LayerNorm to handle fp16 (by casting to float32 and back).
src/convert_upload/open_clip/transformer.py:15
Class
MaxPooler
Max pooling
src/convert_upload/open_clip/hf_model.py:55
Class
MeanPooler
Mean pooling
src/convert_upload/open_clip/hf_model.py:46
Class
Model
src/models/two_towers.py:35
Class
Model
A multi-modal model combining an image encoder and a text decoder. This class serves as a container that orchestrates the forward pass through
src/models/openvision2_model.py:50
Class
MultiHeadDotProductAttention
Multi-head dot-product attention. Attributes: num_heads: number of attention heads. Features (i.e. inputs_q.shape[-1]) should be di
src/models/common.py:203
Class
NeighbourExchange
src/convert_upload/open_clip/loss.py:272
Class
NeighbourExchangeBidir
src/convert_upload/open_clip/loss.py:289
Class
PretrainedConfig
src/convert_upload/open_clip/hf_model.py:24
Class
QuickGELU
src/convert_upload/open_clip/transformer.py:33
Class
Registry
Implements global Registry. Authors: Joan Puigcerver (jpuigcerver@), Alexander Kolesnikov (akolesnikov@)
src/helpers/registry.py:128
Class
SigLipTokenizer
HuggingFace tokenizer wrapper for SigLIP T5 compatible sentencepiece vocabs
src/convert_upload/open_clip/tokenizer.py:464