MCPcopy Create free account

hub / github.com/JaceyHuang/Gen3R / functions

Functions431 in github.com/JaceyHuang/Gen3R

↓ 18 callersMethodfrom_pretrained
Load pipeline, then try to attach `vggt` from subfolder unless explicitly provided.
gen3r/pipeline/pipeline_gen3r.py:231
↓ 11 callersFunctioncheck_and_fix_inf_nan
Checks if 'input_tensor' contains inf or nan values and clamps extreme values. Args: input_tensor (torch.Tensor): The loss tenso
gen3r/utils/loss_utils.py:37
↓ 10 callersMethod_sigma_to_alpha_sigma_t
(self, sigma)
gen3r/utils/fm_solvers.py:333
↓ 10 callersMethoddecode
(self, z: torch.Tensor, return_dict: bool = True)
gen3r/models/videoxfun_wan/wan_vae.py:681
↓ 9 callersMethod__init__
(self, dim, channel_first=True, images=True, bias=False)
gen3r/models/geometry_adapter/geometry_adapter.py:60
↓ 9 callersMethodencode
( self, x: torch.Tensor, return_dict: bool = True )
gen3r/models/videoxfun_wan/wan_vae.py:660
↓ 8 callersMethod__init__
(self, dim, channel_first=True, images=True, bias=False)
gen3r/models/videoxfun_wan/wan_vae.py:48
↓ 8 callersMethod_sigma_to_alpha_sigma_t
(self, sigma)
gen3r/utils/fm_solvers_unipc.py:272
↓ 8 callersFunctionrope_params
(max_seq_len, dim, theta=10000)
gen3r/models/videoxfun_wan/wan_transformer3d.py:254
↓ 7 callersMethod__init__
(self, dim, out_dim, patch_size, eps=1e-6)
gen3r/models/videoxfun_wan/wan_transformer3d.py:672
↓ 7 callersMethod__init__
(self, dim, mid_dim)
gen3r/models/videoxfun_wan/wan_image_encoder.py:99
↓ 7 callersMethodset_timesteps
Sets the discrete timesteps used for the diffusion chain (to be run before inference). Args: num_inference_steps (`int`):
gen3r/utils/fm_solvers.py:226
↓ 6 callersMethod__init__
(self, dim, eps=1e-6)
gen3r/models/videoxfun_wan/wan_text_encoder.py:48
↓ 6 callersFunctiondownsample_and_save_pointcloud
(filename, point_maps, rgbs, voxel_size=0.005, filter_outliers=True, depth_percentile=0, remove_far_points=Fal
gen3r/utils/common_utils.py:134
↓ 6 callersFunctionfilter_kwargs
(cls, kwargs)
gen3r/utils/common_utils.py:14
↓ 6 callersFunctionhalf
(x)
gen3r/models/videoxfun_wan/wan_transformer3d.py:101
↓ 6 callersMethodsample
(self, imgs, deterministic=False)
gen3r/models/videoxfun_wan/wan_vae.py:586
↓ 6 callersFunctionsave_videos_grid
(videos: torch.Tensor, path: str, rescale=False, n_rows=6, fps=12, imageio_backend=True, color_transfer_post_p
gen3r/utils/common_utils.py:49
↓ 5 callersFunctionattention
( q, k, v, q_lens=None, k_lens=None, dropout_p=0., softmax_scale=None, q_scale
gen3r/models/videoxfun_wan/wan_transformer3d.py:175
↓ 5 callersFunctionfp16_clamp
(x)
gen3r/models/videoxfun_wan/wan_text_encoder.py:17
↓ 5 callersFunctionpose_encoding_to_extri_intri
Convert a pose encoding back to camera extrinsics and intrinsics. This function performs the inverse operation of extri_intri_to_pose_encoding,
gen3r/models/vggt/utils/pose_enc.py:65
↓ 4 callersFunction_make_fusion_block
(features: int, size: int = None, has_residual: bool = True, groups: int = 1)
gen3r/models/vggt/heads/dpt_head.py:326
↓ 4 callersFunctioncalculate_adaptive_weight
Calculate adaptive weight as 10^n so that weight * current_loss has the same order of magnitude as target_loss. Args: target_los
gen3r/utils/loss_utils.py:6
↓ 4 callersMethodclear_cache
(self)
gen3r/models/geometry_adapter/geometry_adapter.py:618
↓ 4 callersMethodclear_cache
(self)
gen3r/models/videoxfun_wan/wan_vae.py:593
↓ 4 callersFunctiondecode_vggt_tokens
(vggt, aggregated_token_list, fake_frames, colorize_depth=True, require_unproject=True)
train_dit.py:152
↓ 4 callersFunctionget_aggregated_token_list
(latents: torch.Tensor, patch_size: int)
train_dit.py:168
↓ 4 callersFunctionget_parameter_dtype
Returns the first found floating dtype in parameters if there is one, otherwise returns the last dtype it found.
gen3r/models/vggt/utils/common_utils.py:7
↓ 4 callersMethodprepare_tokens_with_masks
(self, x, masks=None)
gen3r/models/vggt/layers/vision_transformer.py:217
↓ 4 callersMethodsave_pretrained
Save pipeline as usual, then persist `vggt` into a subfolder if available.
gen3r/pipeline/pipeline_gen3r.py:210
↓ 4 callersFunctionset_seed
(seed)
train_geo_adapter_pl.py:749
↓ 4 callersMethodstep
Predict the sample from the previous timestep by reversing the SDE. This function propagates the sample with the multistep DPMSolver.
gen3r/utils/fm_solvers.py:706
↓ 4 callersFunctionstring_to_filename
(s: str)
gen3r/utils/common_utils.py:78
↓ 4 callersFunctionunproject_depth_map_to_point_map
Unproject a batch of depth maps to 3D world coordinates. Args: depth_map (np.ndarray): Batch of depth maps of shape (S, H, W, 1) or
gen3r/models/vggt/utils/geometry.py:12
↓ 4 callersMethodvisualize_features
(self, batch_idx, frames, features, prefix='recon')
train_geo_adapter_pl.py:617
↓ 3 callersMethod_forward_impl
Implementation of the forward pass through the DPT head. This method processes a specific chunk of frames from the sequence.
gen3r/models/vggt/heads/dpt_head.py:196
↓ 3 callersFunctionbase_pose_act
Apply basic activation function to pose parameters. Args: pose_enc: Tensor containing encoded pose parameters act_type: Acti
gen3r/models/vggt/heads/head_act.py:38
↓ 3 callersFunctionbatch_encode_latents
(pixel_values, vggt, geo_adapter, wan_vae)
train_dit.py:456
↓ 3 callersFunctioncenter_crop
Center crops a tensor of frames.
gen3r/utils/data_utils.py:515
↓ 3 callersFunctionclean_prompt
Clean the prompt to remove fixed prefixes.
gen3r/utils/data_utils.py:88
↓ 3 callersFunctioncolorize_depth_map
(depth_maps: torch.Tensor)
gen3r/utils/common_utils.py:105
↓ 3 callersFunctioncompute_rays
Args: c2w (torch.tensor): [v, 4, 4] K (torch.tensor): [v, 3, 3] h (int): height of the image w (int): width of th
gen3r/utils/data_utils.py:555
↓ 3 callersMethodget_aggregated_token_list
(self, reconstructed_cam_tokens, reconstructed_image_tokens, target_cam_tokens, target_tokens_list, ps_idx, B,
train_geo_adapter_pl.py:231
↓ 3 callersFunctioninverse_log_transform
Apply inverse log transform: sign(y) * (exp(|y|) - 1) Args: y: Input tensor Returns: Transformed tensor
gen3r/models/vggt/heads/head_act.py:115
↓ 3 callersFunctionload_extracted_videos
(video_path: Path)
gen3r/utils/data_utils.py:25
↓ 3 callersFunctionlog_validation
( args, config, vggt, geo_adapter, wan_vae, text_encoder, tokenizer, transformer3d_or_path, clip_image_enc
train_dit.py:200
↓ 3 callersFunctionpreprocess_extracted_video_with_resize_crop
Load a clip from an extracted-frame directory, then apply "sampling/padding + aspect-preserving resize + center crop". Two frame-selecti
gen3r/utils/data_utils.py:362
↓ 3 callersFunctionretrieve_timesteps
Calls the scheduler's `set_timesteps` method and retrieves timesteps from the scheduler after the call. Handles custom timesteps. Any kwargs
gen3r/pipeline/pipeline_gen3r.py:47
↓ 3 callersFunctionumeyama_alignment
Align predicted point cloud P to ground truth point cloud G using Umeyama algorithm. Args: P: (F, H, W, 3) predicted point cloud
gen3r/utils/eval_utils.py:9
↓ 2 callersMethod__init__
( self, data_root: str, camera_column: str, caption_column: str, video
gen3r/data/dataset.py:52
↓ 2 callersMethod__init__
( self, dim_in: int, patch_size: int = 14, output_dim: int = 4, activa
gen3r/models/vggt/heads/dpt_head.py:46
↓ 2 callersMethod__init__
(self, vocab_size=250002, max_seq_len=514, type_size=1,
gen3r/models/videoxfun_wan/wan_xlm_roberta.py:81
↓ 2 callersMethod_apply_1d_rope
Applies 1D rotary position embeddings along one dimension. Args: tokens: Input token features. positions: Position in
gen3r/models/vggt/layers/rope.py:133
↓ 2 callersMethod_apply_pos_embed
Apply positional embedding to tensor x.
gen3r/models/vggt/heads/dpt_head.py:276
↓ 2 callersMethod_get_t5_prompt_embeds
( self, prompt: Union[str, List[str]] = None, num_videos_per_prompt: int = 1,
gen3r/pipeline/pipeline_gen3r.py:255
↓ 2 callersMethod_threshold_sample
"Dynamic thresholding: At each sampling step we set s to a certain percentile absolute pixel value in xt0 (the prediction of x_0 at t
gen3r/utils/fm_solvers.py:292
↓ 2 callersMethod_threshold_sample
"Dynamic thresholding: At each sampling step we set s to a certain percentile absolute pixel value in xt0 (the prediction of x_0 at t
gen3r/utils/fm_solvers_unipc.py:230
↓ 2 callersFunctioncompute_camera_loss
( pred_pose_encodings_list, gt_pose_encodings_list, loss_type="l1", # "l1" or "l2" loss
gen3r/utils/loss_utils.py:297
↓ 2 callersFunctioncompute_chamfer_metrics
Compute point-cloud reconstruction metrics after optional alignment and downsampling. This function aligns prediction `P` to ground truth `G
gen3r/utils/eval_utils.py:82
↓ 2 callersFunctioncompute_depth_loss
Compute depth loss. Args: gamma: Weight for confidence loss alpha: Weight for confidence regularization valid_ra
gen3r/utils/loss_utils.py:342
↓ 2 callersFunctioncompute_point_loss
Compute point loss. Args: gamma: Weight for confidence loss alpha: Weight for confidence regularization valid_ra
gen3r/utils/loss_utils.py:362
↓ 2 callersFunctioncount_conv3d
(model)
gen3r/models/geometry_adapter/geometry_adapter.py:503
↓ 2 callersFunctioncount_conv3d
(model)
gen3r/models/videoxfun_wan/wan_vae.py:482
↓ 2 callersFunctioncustom_interpolate
Custom interpolate to avoid INT_MAX issues in nn.functional.interpolate.
gen3r/models/vggt/heads/dpt_head.py:486
↓ 2 callersFunctiondrop_add_residual_stochastic_depth
( x: Tensor, residual_func: Callable[[Tensor], Tensor], sample_drop_ratio: float = 0.0, pos=No
gen3r/models/vggt/layers/block.py:110
↓ 2 callersFunctiondrop_add_residual_stochastic_depth_list
( x_list: List[Tensor], residual_func: Callable[[Tensor, Any], Tensor], sample_drop_ratio: float =
gen3r/models/vggt/layers/block.py:187
↓ 2 callersMethodencode
(self, x, scale)
gen3r/models/geometry_adapter/geometry_adapter.py:547
↓ 2 callersMethodencode
(self, x, scale)
gen3r/models/videoxfun_wan/wan_vae.py:523
↓ 2 callersFunctionfilter_by_quantile
Filter loss tensor by keeping only values below a certain quantile threshold. This helps remove outliers that could destabilize training
gen3r/utils/loss_utils.py:68
↓ 2 callersFunctionfilter_kwargs
(cls, kwargs)
train_dit.py:123
↓ 2 callersFunctionflash_attention
q: [B, Lq, Nq, C1]. k: [B, Lk, Nk, C1]. v: [B, Lk, Nk, C2]. Nq must be divisible by Nk. q_lens
gen3r/models/videoxfun_wan/wan_transformer3d.py:66
↓ 2 callersMethodforward
(self, x)
gen3r/models/geometry_adapter/geometry_adapter.py:70
↓ 2 callersMethodforward
(self, x)
gen3r/models/videoxfun_wan/wan_vae.py:58
↓ 2 callersMethodforward
(self, x)
gen3r/models/videoxfun_wan/wan_image_encoder.py:109
↓ 2 callersFunctionget_attn_bias_and_cat
this will perform the index select, cat the tensors, and provide the attn_bias from cache
gen3r/models/vggt/layers/block.py:163
↓ 2 callersMethodget_geometry
(self, frames, aggregated_token_list, batch_idx, prefix='recon')
train_geo_adapter_pl.py:685
↓ 2 callersFunctionget_mean_and_std
(img)
gen3r/utils/common_utils.py:32
↓ 2 callersMethodindex_for_timestep
(self, timestep, schedule_timesteps=None)
gen3r/utils/fm_solvers.py:679
↓ 2 callersMethodindex_for_timestep
(self, timestep, schedule_timesteps=None)
gen3r/utils/fm_solvers_unipc.py:628
↓ 2 callersFunctionlinear_decay
(initial_value, final_value, total_steps, current_step)
train_dit.py:131
↓ 2 callersFunctionload_cameras
(camera_path: Path)
gen3r/utils/data_utils.py:15
↓ 2 callersFunctionload_prompts
(prompt_path: Path)
gen3r/utils/data_utils.py:20
↓ 2 callersFunctionmake_2tuple
(x)
gen3r/models/vggt/layers/patch_embed.py:16
↓ 2 callersFunctionmake_sincos_pos_embed
This function generates a 1D positional embedding from a given grid using sine and cosine functions. Args: - embed_dim: The embedding di
gen3r/models/vggt/heads/utils.py:36
↓ 2 callersFunctionpreprocess_cameras
( camera_path: Path, max_num_frames: int, height: int, width: int, interval: int = 2,
gen3r/utils/data_utils.py:282
↓ 2 callersFunctionpreprocess_poses
Preprocess the poses to: 1. translate and rotate the scene so that the first frame is the identity
gen3r/utils/data_utils.py:595
↓ 2 callersFunctionregression_loss
Core regression loss function with confidence weighting and optional gradient loss. Computes: 1. gamma * ||pred - gt||^2 * conf - al
gen3r/utils/loss_utils.py:179
↓ 2 callersFunctionslice_expand_and_flatten
Processes specialized tokens with shape (1, 2, X, C) for multi-frame processing: 1) Uses the first position (index=0) for the first frame onl
gen3r/models/vggt/models/aggregator.py:317
↓ 1 callersMethod__build_patch_embed__
Build the patch embed layer. If 'conv', we use a simple PatchEmbed conv layer. Otherwise, we use a vision transformer.
gen3r/models/vggt/models/aggregator.py:155
↓ 1 callersMethod__init__
(self, base_path, num_frames=49, frame_interval=1, height=560, width=560, split='train')
train_geo_adapter_pl.py:40
↓ 1 callersMethod__init__
Initializes the position generator with an empty cache.
gen3r/models/vggt/layers/rope.py:35
↓ 1 callersMethod__init__
( self, in_features: int, hidden_features: Optional[int] = None, out_features:
gen3r/models/vggt/layers/swiglu_ffn.py:15
↓ 1 callersMethod__init__
(self, in_dim, out_dim, kernel_size, stride, num_residual_blocks=1)
gen3r/models/videoxfun_wan/wan_camera_adapter.py:5
↓ 1 callersFunction_clip
(pretrained=False, pretrained_name=None, model_cls=XLMRobertaCLIP, return_transf
gen3r/models/videoxfun_wan/wan_image_encoder.py:437
↓ 1 callersMethod_compute_frequency_components
Computes frequency components for rotary embeddings. Args: dim: Feature dimension (must be even). seq_len: Maximum se
gen3r/models/vggt/layers/rope.py:86
↓ 1 callersMethod_create_optimizer_scheduler
(self, params)
train_geo_adapter_pl.py:134
↓ 1 callersMethod_decode
(self, zs)
gen3r/models/geometry_adapter/geometry_adapter.py:715
↓ 1 callersMethod_decode
(self, zs)
gen3r/models/videoxfun_wan/wan_vae.py:671
↓ 1 callersMethod_encode
(self, x: torch.Tensor)
gen3r/models/geometry_adapter/geometry_adapter.py:695
↓ 1 callersMethod_encode
(self, x: torch.Tensor)
gen3r/models/videoxfun_wan/wan_vae.py:651
next →1–100 of 431, ranked by callers