MCPcopy Create free account

hub / github.com/JIA-Lab-research/VisionReasoner / functions

Functions358 in github.com/JIA-Lab-research/VisionReasoner

↓ 1 callersMethodprocess_single_image
Process a single image with given instruction Args: image (PIL.Image): Input image instruction (str)
vision_reasoner/models/qwen_vl_cot.py:234
↓ 1 callersMethodprocess_single_image
Process a single image with given instruction Args: image (PIL.Image): Input image instruction (str)
vision_reasoner/models/visurf_model.py:339
↓ 1 callersMethodprocess_single_image
Process a single image with given instruction Args: image (PIL.Image): Input image instruction (str)
vision_reasoner/models/qwen_vl.py:201
↓ 1 callersFunctionproject_3D_points
Transforms 3D points to 2D using extrinsic and intrinsic parameters. Args: points3D (torch.Tensor): 3D points of shape Px3. e
vision_reasoner/models/vggt/dependency/projection.py:105
↓ 1 callersFunctionquat_to_mat
Quaternion Order: XYZW or say ijkr, scalar-last Convert rotations given as quaternions to rotation matrices. Args: quaternions:
vision_reasoner/models/vggt/utils/rotation.py:14
↓ 1 callersFunctionrefine_track
Refines the tracking of images using a fine track predictor and a fine feature network. Check https://arxiv.org/abs/2312.04563 for more detai
vision_reasoner/models/vggt/dependency/track_modules/track_refine.py:22
↓ 1 callersMethodroute_task
Route task based on instruction
vision_reasoner/models/vision_reasoner_model.py:304
↓ 1 callersMethodroute_task
Route task based on instruction
vision_reasoner/models/visurf_model.py:331
↓ 1 callersMethodsample
(self, coords)
vision_reasoner/models/vggt/dependency/track_modules/blocks.py:282
↓ 1 callersMethodscratch_forward
Forward pass through the fusion blocks. Args: features (List[Tensor]): List of feature maps from different layers.
vision_reasoner/models/vggt/heads/dpt_head.py:261
↓ 1 callersMethodsegment_objects
Segment objects in an image based on a query Args: image: Input image query: Text query describing w
vision_reasoner/models/visurf_model.py:551
↓ 1 callersFunctionsingle_undistortion
Apply undistortion to the normalized tracks using the given distortion parameters once. Args: params (torch.Tensor or numpy.ndarray)
vision_reasoner/models/vggt/dependency/distortion.py:32
↓ 1 callersFunctionstandardize_quaternion
Convert a unit quaternion to a standard form: one in which the real part is non negative. Args: quaternions: Quaternions with re
vision_reasoner/models/vggt/utils/rotation.py:120
↓ 1 callersFunctionstrip_json_comments
(text)
vision_reasoner/models/qwen_vl_cot.py:17
↓ 1 callersMethodtrunk_fn
Iteratively refine camera pose predictions. Args: pose_tokens (torch.Tensor): Normalized camera tokens with shape [B, 1,
vision_reasoner/models/vggt/heads/camera_head.py:95
↓ 1 callersFunctionvisualize_depth_estimation_results_enhanced
(image, result, task_type, output_path)
vision_reasoner/utils.py:298
↓ 1 callersFunctionvisualize_depth_estimation_results_video
Create a video for depth estimation with three panels shown sequentially
vision_reasoner/utils.py:427
↓ 1 callersFunctionvisualize_pose_estimation_results_enhanced
(image, result, task_type, output_path)
vision_reasoner/utils.py:218
↓ 1 callersFunctionvisualize_pose_estimation_results_video
Create a video for pose estimation with three panels shown sequentially
vision_reasoner/utils.py:332
↓ 1 callersFunctionvisualize_results_enhanced
Enhanced visualization with three-panel layout
vision_reasoner/utils.py:8
↓ 1 callersFunctionvisualize_results_video
Create a video with three panels shown sequentially, no white borders
vision_reasoner/utils.py:73
Method__call__
Generates spatial positions for a batch of patches. Args: batch_size: Number of samples in the batch. height: Height
vision_reasoner/models/vggt/layers/rope.py:39
Method__init__
Initialize the QwenVLCoT model Args: model_path (str): Path to the model
vision_reasoner/models/qwen_vl_cot.py:46
Method__init__
Initialize the VisionReasoner model with reasoning and segmentation components Args: reasoning_model_path (str):
vision_reasoner/models/vision_reasoner_model.py:42
Method__init__
Initialize the VisionReasoner model with reasoning and segmentation components Args: reasoning_model_path (str):
vision_reasoner/models/visurf_model.py:43
Method__init__
Initialize the QwenVL model Args: model_path (str): Path to the model
vision_reasoner/models/qwen_vl.py:22
Method__init__
Initialize task router
vision_reasoner/models/task_router.py:6
Method__init__
Initializes the 2D RoPE module.
vision_reasoner/models/vggt/layers/rope.py:79
Method__init__
(self, drop_prob=None)
vision_reasoner/models/vggt/layers/drop_path.py:29
Method__init__
( self, dim: int, num_heads: int, mlp_ratio: float = 4.0, qkv_bias: bo
vision_reasoner/models/vggt/layers/block.py:28
Method__init__
(self, dim: int, init_values: Union[float, Tensor] = 1e-5, inplace: bool = False)
vision_reasoner/models/vggt/layers/layer_scale.py:16
Method__init__
( self, dim: int, num_heads: int = 8, qkv_bias: bool = True, proj_bias
vision_reasoner/models/vggt/layers/attention.py:22
Method__init__
( self, in_features: int, hidden_features: Optional[int] = None, out_features:
vision_reasoner/models/vggt/layers/mlp.py:17
Method__init__
( self, in_features: int, hidden_features: Optional[int] = None, out_features:
vision_reasoner/models/vggt/layers/swiglu_ffn.py:55
Method__init__
( self, img_size: Union[int, Tuple[int, int]] = 224, patch_size: Union[int, Tuple[int,
vision_reasoner/models/vggt/layers/patch_embed.py:37
Method__init__
Args: img_size (int, tuple): input image size patch_size (int, tuple): patch size in_chans (int): number
vision_reasoner/models/vggt/layers/vision_transformer.py:43
Method__init__
Init. Args: features (int): number of features
vision_reasoner/models/vggt/heads/dpt_head.py:347
Method__init__
Init. Args: features (int): number of features
vision_reasoner/models/vggt/heads/dpt_head.py:392
Method__init__
( self, dim_in: int = 2048, trunk_depth: int = 4, pose_encoding_type: str = "a
vision_reasoner/models/vggt/heads/camera_head.py:26
Method__init__
Initialize the TrackHead module. Args: dim_in (int): Input dimension of tokens from the backbone. patch_size
vision_reasoner/models/vggt/heads/track_head.py:18
Method__init__
( self, space_depth=6, time_depth=6, input_dim=320, hidden_size=384,
vision_reasoner/models/vggt/heads/track_modules/blocks.py:24
Method__init__
( self, stride=1, corr_levels=5, corr_radius=4, latent_dim=128,
vision_reasoner/models/vggt/heads/track_modules/base_track_predictor.py:18
Method__init__
(self, in_planes, planes, norm_fn="group", stride=1, kernel_size=3)
vision_reasoner/models/vggt/heads/track_modules/modules.py:44
Method__init__
Self attention block
vision_reasoner/models/vggt/heads/track_modules/modules.py:134
Method__init__
Cross attention block
vision_reasoner/models/vggt/heads/track_modules/modules.py:174
Method__init__
( self, img_size=518, patch_size=14, embed_dim=1024, depth=24,
vision_reasoner/models/vggt/models/aggregator.py:52
Method__init__
(self, img_size=518, patch_size=14, embed_dim=1024, enable_camera=True, enable_point=True, en
vision_reasoner/models/vggt/models/vggt.py:18
Method__init__
(self, **extra_args)
vision_reasoner/models/vggt/dependency/vggsfm_tracker.py:26
Method__init__
(self, input_dim=3, output_dim=128, stride=4)
vision_reasoner/models/vggt/dependency/track_modules/blocks.py:26
Method__init__
(self, input_dim=3, output_dim=32, stride=1, norm_fn="instance")
vision_reasoner/models/vggt/dependency/track_modules/blocks.py:91
Method__init__
( self, space_depth=6, time_depth=6, input_dim=320, hidden_size=384,
vision_reasoner/models/vggt/dependency/track_modules/blocks.py:160
Method__init__
( self, stride=4, corr_levels=5, corr_radius=4, latent_dim=128,
vision_reasoner/models/vggt/dependency/track_modules/base_track_predictor.py:16
Method__init__
(self, in_planes, planes, norm_fn="group", stride=1, kernel_size=3)
vision_reasoner/models/vggt/dependency/track_modules/modules.py:44
Method__init__
Self attention block
vision_reasoner/models/vggt/dependency/track_modules/modules.py:134
Method__init__
Cross attention block
vision_reasoner/models/vggt/dependency/track_modules/modules.py:173
Method_basic_init
(module)
vision_reasoner/models/vggt/heads/track_modules/blocks.py:81
Method_basic_init
(module)
vision_reasoner/models/vggt/dependency/track_modules/blocks.py:211
Methodanswer_question
Answer a question about an image Args: image: Input image question: Text question
vision_reasoner/models/base_model.py:144
Methodanswer_question_math
Answer a question about an image Args: image: Input image question: Text question
vision_reasoner/models/visurf_model.py:814
Methodanswer_questions_batch
Answer questions about a batch of images Args: images: List of input images questions: List of text
vision_reasoner/models/qwen_vl_cot.py:674
Methodanswer_questions_batch
Answer questions about a batch of images Args: images: List of input images questions: List of text
vision_reasoner/models/base_model.py:160
Methodanswer_questions_batch
Answer questions about a batch of images Args: images: List of input images questions: List of text
vision_reasoner/models/vision_reasoner_model.py:754
Methodanswer_questions_batch
Answer questions about a batch of images Args: images: List of input images questions: List of text
vision_reasoner/models/visurf_model.py:781
Methodanswer_questions_batch
Answer questions about a batch of images Args: images: List of input images questions: List of text
vision_reasoner/models/qwen_vl.py:622
Methodattn_residual_func
(x: Tensor, pos=None)
vision_reasoner/models/vggt/layers/block.py:78
Methodattn_residual_func
(x: Tensor, attn_bias=None)
vision_reasoner/models/vggt/layers/block.py:207
Functionbatch_np_matrix_to_pycolmap
Convert Batched NumPy Arrays to PyCOLMAP Check https://github.com/colmap/pycolmap for more details about its format NOTE that colmap ex
vision_reasoner/models/vggt/dependency/np_to_pycolmap.py:12
Functionbatch_np_matrix_to_pycolmap_wo_track
Convert Batched NumPy Arrays to PyCOLMAP Different from batch_np_matrix_to_pycolmap, this function does not use tracks. It saves points
vision_reasoner/models/vggt/dependency/np_to_pycolmap.py:201
Functioncam_from_img
Normalize predicted tracks based on camera intrinsics. Args: intrinsics (torch.Tensor): The camera intrinsics tensor of shape [batch_size
vision_reasoner/models/vggt/utils/geometry.py:294
Functioncompute_bbox_iou
(bbox1, bbox2)
evaluation/evaluation_gui.py:41
Functioncompute_bbox_iou
Calculate IOU matrix between two sets of bounding boxes bboxes1: shape (N, 4) prediction boxes bboxes2: shape (M, 4) ground truth boxes
evaluation/evaluation_coco.py:33
Functioncompute_iou
(mask1, mask2)
evaluation/evaluation_gui.py:34
Functioncompute_iou
(mask1, mask2)
evaluation/evaluation_anomaly.py:34
Methodcount_objects
Count objects in an image based on a query Args: image: Input image query: Text query describing wha
vision_reasoner/models/base_model.py:109
Methodcount_objects_batch
Count objects in a batch of images Args: images: List of input images queries: List of text queries
vision_reasoner/models/qwen_vl_cot.py:625
Methodcount_objects_batch
Count objects in a batch of images Args: images: List of input images queries: List of text queries
vision_reasoner/models/base_model.py:126
Methodcount_objects_batch
Count objects in a batch of images Args: images: List of input images queries: List of text queries
vision_reasoner/models/vision_reasoner_model.py:676
Methodcount_objects_batch
Count objects in a batch of images Args: images: List of input images queries: List of text queries
vision_reasoner/models/visurf_model.py:703
Functioncreate_pixel_coordinate_grid
Creates a grid of pixel coordinates and frame indices for all frames. Returns: tuple: A tuple containing: - points_xyf (n
vision_reasoner/models/vggt/utils/helper.py:33
Functiondefault
(val, d)
vision_reasoner/models/vggt/heads/track_modules/modules.py:32
Functiondefault
(val, d)
vision_reasoner/models/vggt/dependency/track_modules/modules.py:32
Methoddetect_objects
Detect objects in an image based on a query Args: image: Input image query: Text query describing wh
vision_reasoner/models/base_model.py:39
Methoddetect_objects_batch
Detect objects in a batch of images Args: images: List of input images queries: List of text queries
vision_reasoner/models/qwen_vl_cot.py:370
Methoddetect_objects_batch
Detect objects in a batch of images Args: images: List of input images queries: List of text queries
vision_reasoner/models/base_model.py:56
Methoddetect_objects_batch
Detect objects in a batch of images Args: images: List of input images queries: List of text queries
vision_reasoner/models/vision_reasoner_model.py:473
Methoddetect_objects_batch
Detect objects in a batch of images Args: images: List of input images queries: List of text queries
vision_reasoner/models/visurf_model.py:500
Functionextract_glimpse
( tensor: torch.Tensor, size: Tuple[int, int], offsets, mode="bilinear", padding_mode="zeros", debug=False
vision_reasoner/models/vggt/dependency/track_modules/track_refine.py:381
Functionextri_intri_to_pose_encoding
Convert camera extrinsics and intrinsics to a compact pose encoding. This function transforms camera parameters into a unified pose encoding form
vision_reasoner/models/vggt/utils/pose_enc.py:11
Methodf
(*args, **kwargs)
vision_reasoner/models/vggt/layers/vision_transformer.py:130
Methodffn_residual_func
(x: Tensor)
vision_reasoner/models/vggt/layers/block.py:81
Methodffn_residual_func
(x: Tensor, attn_bias=None)
vision_reasoner/models/vggt/layers/block.py:210
Methodflops
(self)
vision_reasoner/models/vggt/layers/patch_embed.py:80
Methodforward
Applies 2D rotary position embeddings to input tokens. Args: tokens: Input tensor of shape (batch_size, n_heads, n_tokens, dim).
vision_reasoner/models/vggt/layers/rope.py:154
Methodforward
(self, x)
vision_reasoner/models/vggt/layers/drop_path.py:33
Methodforward
(self, x_or_x_list)
vision_reasoner/models/vggt/layers/block.py:239
Methodforward
(self, x: Tensor)
vision_reasoner/models/vggt/layers/layer_scale.py:21
Methodforward
(self, x: Tensor, attn_bias=None, pos=None)
vision_reasoner/models/vggt/layers/attention.py:76
Methodforward
(self, x: Tensor)
vision_reasoner/models/vggt/layers/mlp.py:34
Methodforward
(self, x: Tensor)
vision_reasoner/models/vggt/layers/swiglu_ffn.py:30
Methodforward
(self, x: Tensor)
vision_reasoner/models/vggt/layers/patch_embed.py:65
← previousnext →201–300 of 358, ranked by callers