MCPcopy Create free account

hub / github.com/JIA-Lab-research/VisionReasoner / types & classes

Types & classes48 in github.com/JIA-Lab-research/VisionReasoner

↓ 12 callersClassQwenVLModel
QwenVL model implementing all task interfaces with custom prompts
vision_reasoner/models/qwen_vl.py:17
↓ 9 callersClassVisionReasonerModel
VisionReasoner model implementing all task interfaces
vision_reasoner/models/vision_reasoner_model.py:38
↓ 4 callersClassDinoVisionTransformer
vision_reasoner/models/vggt/layers/vision_transformer.py:42
↓ 4 callersClassMlp
MLP as used in Vision Transformer, MLP-Mixer and related networks
vision_reasoner/models/vggt/heads/track_modules/modules.py:97
↓ 4 callersClassViSurfModel
VisionReasoner model implementing all task interfaces
vision_reasoner/models/visurf_model.py:39
↓ 3 callersClassDPTHead
DPT Head for dense prediction tasks. This implementation follows the architecture described in "Vision Transformers for Dense Prediction"
vision_reasoner/models/vggt/heads/dpt_head.py:21
↓ 3 callersClassQwenVLCoTModel
QwenVLCoT model implementing all task interfaces with custom prompts
vision_reasoner/models/qwen_vl_cot.py:41
↓ 3 callersClassResidualBlock
ResidualBlock: construct a block of two conv layers with residual connections
vision_reasoner/models/vggt/dependency/track_modules/modules.py:39
↓ 2 callersClassAttnBlock
vision_reasoner/models/vggt/heads/track_modules/modules.py:133
↓ 2 callersClassAttnBlock
vision_reasoner/models/vggt/dependency/track_modules/modules.py:133
↓ 2 callersClassBaseTrackerPredictor
vision_reasoner/models/vggt/dependency/track_modules/base_track_predictor.py:15
↓ 2 callersClassCrossAttnBlock
vision_reasoner/models/vggt/heads/track_modules/modules.py:173
↓ 2 callersClassCrossAttnBlock
vision_reasoner/models/vggt/dependency/track_modules/modules.py:172
↓ 2 callersClassDropPath
Drop paths (Stochastic Depth) per sample (when applied in main path of residual blocks).
vision_reasoner/models/vggt/layers/drop_path.py:26
↓ 2 callersClassLayerScale
vision_reasoner/models/vggt/layers/layer_scale.py:15
↓ 2 callersClassMlp
MLP as used in Vision Transformer, MLP-Mixer and related networks
vision_reasoner/models/vggt/dependency/track_modules/modules.py:97
↓ 2 callersClassResidualConvUnit
Residual convolution module.
vision_reasoner/models/vggt/heads/dpt_head.py:344
↓ 2 callersClassTaskRouter
vision_reasoner/models/task_router.py:5
↓ 1 callersClassAggregator
The Aggregator applies alternating-attention over input frames, as described in VGGT: Visual Geometry Grounded Transformer. Remember to
vision_reasoner/models/vggt/models/aggregator.py:25
↓ 1 callersClassBaseTrackerPredictor
vision_reasoner/models/vggt/heads/track_modules/base_track_predictor.py:17
↓ 1 callersClassBasicEncoder
vision_reasoner/models/vggt/dependency/track_modules/blocks.py:25
↓ 1 callersClassBlock
vision_reasoner/models/vggt/layers/block.py:27
↓ 1 callersClassBlockChunk
vision_reasoner/models/vggt/layers/vision_transformer.py:35
↓ 1 callersClassCameraHead
CameraHead predicts camera parameters from token representations using iterative refinement. It applies a series of transformer blocks (the
vision_reasoner/models/vggt/heads/camera_head.py:19
↓ 1 callersClassCorrBlock
vision_reasoner/models/vggt/heads/track_modules/blocks.py:137
↓ 1 callersClassCorrBlock
vision_reasoner/models/vggt/dependency/track_modules/blocks.py:264
↓ 1 callersClassEfficientUpdateFormer
Transformer model that updates track estimates.
vision_reasoner/models/vggt/heads/track_modules/blocks.py:19
↓ 1 callersClassEfficientUpdateFormer
Transformer model that updates track estimates.
vision_reasoner/models/vggt/dependency/track_modules/blocks.py:155
↓ 1 callersClassFeatureFusionBlock
Feature fusion block.
vision_reasoner/models/vggt/heads/dpt_head.py:389
↓ 1 callersClassPatchEmbed
2D image to patch embedding: (B,C,H,W) -> (B,N,D) Args: img_size: Image size. patch_size: Patch token size. in_chans
vision_reasoner/models/vggt/layers/patch_embed.py:25
↓ 1 callersClassPositionGetter
Generates and caches 2D spatial positions for patches in a grid. This class efficiently manages the generation of spatial coordinates for patches
vision_reasoner/models/vggt/layers/rope.py:24
↓ 1 callersClassRotaryPositionEmbedding2D
2D Rotary Position Embedding implementation. This module applies rotary position embeddings to input tokens based on their 2D spatial positio
vision_reasoner/models/vggt/layers/rope.py:62
↓ 1 callersClassShallowEncoder
vision_reasoner/models/vggt/dependency/track_modules/blocks.py:90
↓ 1 callersClassTrackHead
Track head that uses DPT head to process tokens and BaseTrackerPredictor for tracking. The tracking is performed iteratively, refining predic
vision_reasoner/models/vggt/heads/track_head.py:12
↓ 1 callersClassTrackerPredictor
vision_reasoner/models/vggt/dependency/vggsfm_tracker.py:25
ClassAttention
vision_reasoner/models/vggt/layers/attention.py:21
ClassBaseVisionModel
Abstract base class for vision models that process images and instructions
vision_reasoner/models/base_model.py:3
ClassCountingModel
Interface for counting tasks
vision_reasoner/models/base_model.py:105
ClassDetectionModel
Interface for object detection tasks
vision_reasoner/models/base_model.py:35
ClassMemEffAttention
vision_reasoner/models/vggt/layers/attention.py:75
ClassMlp
vision_reasoner/models/vggt/layers/mlp.py:16
ClassNestedTensorBlock
vision_reasoner/models/vggt/layers/block.py:198
ClassQAModel
Interface for visual question answering tasks
vision_reasoner/models/base_model.py:140
ClassResidualBlock
ResidualBlock: construct a block of two conv layers with residual connections
vision_reasoner/models/vggt/heads/track_modules/modules.py:39
ClassSegmentationModel
Interface for segmentation tasks
vision_reasoner/models/base_model.py:70
ClassSwiGLUFFN
vision_reasoner/models/vggt/layers/swiglu_ffn.py:14
ClassSwiGLUFFNFused
vision_reasoner/models/vggt/layers/swiglu_ffn.py:54
ClassVGGT
vision_reasoner/models/vggt/models/vggt.py:17