MCPcopy Create free account

hub / github.com/JaceyHuang/Gen3R / types & classes

Types & classes84 in github.com/JaceyHuang/Gen3R

↓ 11 callersClassCausalConv3d
Causal 3d convolusion.
gen3r/models/geometry_adapter/geometry_adapter.py:36
↓ 11 callersClassCausalConv3d
Causal 3d convolusion.
gen3r/models/videoxfun_wan/wan_vae.py:24
↓ 6 callersClassResidualBlock
gen3r/models/geometry_adapter/geometry_adapter.py:205
↓ 6 callersClassResidualBlock
gen3r/models/videoxfun_wan/wan_vae.py:193
↓ 6 callersClassT5LayerNorm
gen3r/models/videoxfun_wan/wan_text_encoder.py:47
↓ 5 callersClassLayerNorm
gen3r/models/videoxfun_wan/wan_image_encoder.py:50
↓ 5 callersClassRMS_norm
gen3r/models/geometry_adapter/geometry_adapter.py:58
↓ 5 callersClassRMS_norm
gen3r/models/videoxfun_wan/wan_vae.py:46
↓ 4 callersClassAttentionBlock
Causal self-attention with a single head.
gen3r/models/geometry_adapter/geometry_adapter.py:243
↓ 4 callersClassAttentionBlock
Causal self-attention with a single head.
gen3r/models/videoxfun_wan/wan_vae.py:230
↓ 4 callersClassDinoVisionTransformer
gen3r/models/vggt/layers/vision_transformer.py:42
↓ 4 callersClassResample
gen3r/models/geometry_adapter/geometry_adapter.py:84
↓ 4 callersClassWanLayerNorm
gen3r/models/videoxfun_wan/wan_transformer3d.py:420
↓ 3 callersClassT5Attention
gen3r/models/videoxfun_wan/wan_text_encoder.py:62
↓ 3 callersClassT5RelativeEmbedding
gen3r/models/videoxfun_wan/wan_text_encoder.py:211
↓ 3 callersClassWanRMSNorm
gen3r/models/videoxfun_wan/wan_transformer3d.py:401
↓ 2 callersClassDPTHead
DPT Head for dense prediction tasks. This implementation follows the architecture described in "Vision Transformers for Dense Prediction"
gen3r/models/vggt/heads/dpt_head.py:24
↓ 2 callersClassDropPath
Drop paths (Stochastic Depth) per sample (when applied in main path of residual blocks).
gen3r/models/vggt/layers/drop_path.py:26
↓ 2 callersClassGen3RPipeline
r""" Pipeline for text-to-video generation using Wan. This model inherits from [`DiffusionPipeline`]. Check the superclass documentation for
gen3r/pipeline/pipeline_gen3r.py:163
↓ 2 callersClassGen3RPipelineOutput
r""" Output class for CogVideo pipelines. Args: video (`torch.Tensor`, `np.ndarray`, or List[List[PIL.Image.Image]]): Lis
gen3r/pipeline/pipeline_gen3r.py:144
↓ 2 callersClassLayerScale
gen3r/models/vggt/layers/layer_scale.py:15
↓ 2 callersClassQuickGELU
gen3r/models/videoxfun_wan/wan_image_encoder.py:44
↓ 2 callersClassResample
gen3r/models/videoxfun_wan/wan_vae.py:73
↓ 2 callersClassResidualConvUnit
Residual convolution module.
gen3r/models/vggt/heads/dpt_head.py:371
↓ 2 callersClassT5FeedForward
gen3r/models/videoxfun_wan/wan_text_encoder.py:115
↓ 2 callersClassUpsample
gen3r/models/geometry_adapter/geometry_adapter.py:75
↓ 2 callersClassUpsample
gen3r/models/videoxfun_wan/wan_vae.py:64
↓ 2 callersClassVideoDataset
train_geo_adapter_pl.py:39
↓ 1 callersClassAggregator
The Aggregator applies alternating-attention over input frames, as described in VGGT: Visual Geometry Grounded Transformer. Args:
gen3r/models/vggt/models/aggregator.py:26
↓ 1 callersClassAttentionBlock
gen3r/models/videoxfun_wan/wan_xlm_roberta.py:49
↓ 1 callersClassAttentionBlock
gen3r/models/videoxfun_wan/wan_image_encoder.py:115
↓ 1 callersClassAttentionPool
gen3r/models/videoxfun_wan/wan_image_encoder.py:159
↓ 1 callersClassAutoencoderKLWan_
gen3r/models/videoxfun_wan/wan_vae.py:490
↓ 1 callersClassBalancedDatasetWithResizeCrop
A dataset class that provides balanced sampling across multiple datasets. This class creates multiple SGDatasetWithResizeCrop instances
gen3r/data/dataset.py:207
↓ 1 callersClassBlock
gen3r/models/vggt/layers/block.py:27
↓ 1 callersClassBlockChunk
gen3r/models/vggt/layers/vision_transformer.py:35
↓ 1 callersClassCameraHead
CameraHead predicts camera parameters from token representations using iterative refinement. It applies a series of transformer blocks (the
gen3r/models/vggt/heads/camera_head.py:21
↓ 1 callersClassDatasetWithResizeCrop
A dataset class for text-to-video generation that resizes inputs to fixed dimensions. This class preprocesses videos by resizing them to spe
gen3r/data/dataset.py:157
↓ 1 callersClassDecoder3d
gen3r/models/geometry_adapter/geometry_adapter.py:389
↓ 1 callersClassDecoder3d
gen3r/models/videoxfun_wan/wan_vae.py:376
↓ 1 callersClassDiscreteSampling
gen3r/utils/discrete_sampler.py:5
↓ 1 callersClassEncoder3d
gen3r/models/geometry_adapter/geometry_adapter.py:278
↓ 1 callersClassEncoder3d
gen3r/models/videoxfun_wan/wan_vae.py:272
↓ 1 callersClassFeatureFusionBlock
Feature fusion block.
gen3r/models/vggt/heads/dpt_head.py:416
↓ 1 callersClassGELU
gen3r/models/videoxfun_wan/wan_text_encoder.py:41
↓ 1 callersClassGeometryAdapter
gen3r/models/geometry_adapter/geometry_adapter.py:654
↓ 1 callersClassGeometryAdapterTrainer
train_geo_adapter_pl.py:81
↓ 1 callersClassGeometryAdapter_
gen3r/models/geometry_adapter/geometry_adapter.py:511
↓ 1 callersClassHead
gen3r/models/videoxfun_wan/wan_transformer3d.py:670
↓ 1 callersClassMLPProj
gen3r/models/videoxfun_wan/wan_transformer3d.py:698
↓ 1 callersClassMlp
gen3r/models/vggt/layers/mlp.py:16
↓ 1 callersClassPatchEmbed
2D image to patch embedding: (B,C,H,W) -> (B,N,D) Args: img_size: Image size. patch_size: Patch token size. in_chans
gen3r/models/vggt/layers/patch_embed.py:25
↓ 1 callersClassPositionGetter
Generates and caches 2D spatial positions for patches in a grid. This class efficiently manages the generation of spatial coordinates for patches
gen3r/models/vggt/layers/rope.py:24
↓ 1 callersClassResidualBlock
gen3r/models/videoxfun_wan/wan_camera_adapter.py:43
↓ 1 callersClassRotaryPositionEmbedding2D
2D Rotary Position Embedding implementation. This module applies rotary position embeddings to input tokens based on their 2D spatial positio
gen3r/models/vggt/layers/rope.py:62
↓ 1 callersClassSelfAttention
gen3r/models/videoxfun_wan/wan_xlm_roberta.py:10
↓ 1 callersClassSelfAttention
gen3r/models/videoxfun_wan/wan_image_encoder.py:56
↓ 1 callersClassSimpleAdapter
gen3r/models/videoxfun_wan/wan_camera_adapter.py:4
↓ 1 callersClassSwiGLU
gen3r/models/videoxfun_wan/wan_image_encoder.py:97
↓ 1 callersClassT5SelfAttention
gen3r/models/videoxfun_wan/wan_text_encoder.py:136
↓ 1 callersClassTeaCache
Timestep Embedding Aware Cache, a training-free caching approach that estimates and leverages the fluctuating differences among model outputs
gen3r/models/videoxfun_wan/cache_utils.py:19
↓ 1 callersClassVisionTransformer
gen3r/models/videoxfun_wan/wan_image_encoder.py:212
↓ 1 callersClassWanAttentionBlock
gen3r/models/videoxfun_wan/wan_transformer3d.py:589
↓ 1 callersClassWanSelfAttention
gen3r/models/videoxfun_wan/wan_transformer3d.py:433
↓ 1 callersClassXLMRoberta
XLMRobertaModel with no pooler and no LM head.
gen3r/models/videoxfun_wan/wan_xlm_roberta.py:76
↓ 1 callersClassXLMRobertaWithHead
gen3r/models/videoxfun_wan/wan_image_encoder.py:306
ClassAttention
gen3r/models/vggt/layers/attention.py:21
ClassAutoencoderKLWan
gen3r/models/videoxfun_wan/wan_vae.py:624
ClassBaseDataset
Base dataset class for geometry-aware video training. The dataset reads three metadata files (camera paths, prompt-file paths, and extra
gen3r/data/dataset.py:21
ClassCLIPModel
gen3r/models/videoxfun_wan/wan_image_encoder.py:504
ClassFlowDPMSolverMultistepScheduler
`FlowDPMSolverMultistepScheduler` is a fast dedicated high-order solver for diffusion ODEs. This model inherits from [`SchedulerMixin`] and [
gen3r/utils/fm_solvers.py:69
ClassFlowUniPCMultistepScheduler
`UniPCMultistepScheduler` is a training-free framework designed for the fast sampling of diffusion models. This model inherits from [`Schedu
gen3r/utils/fm_solvers_unipc.py:20
ClassInterpolate
gen3r/models/geometry_adapter/geometry_adapter.py:27
ClassMemEffAttention
gen3r/models/vggt/layers/attention.py:80
ClassNestedTensorBlock
gen3r/models/vggt/layers/block.py:210
ClassSwiGLUFFN
gen3r/models/vggt/layers/swiglu_ffn.py:14
ClassSwiGLUFFNFused
gen3r/models/vggt/layers/swiglu_ffn.py:54
ClassT5CrossAttention
gen3r/models/videoxfun_wan/wan_text_encoder.py:169
ClassVGGT
gen3r/models/vggt/models/vggt.py:18
ClassWanI2VCrossAttention
gen3r/models/videoxfun_wan/wan_transformer3d.py:526
ClassWanT2VCrossAttention
gen3r/models/videoxfun_wan/wan_transformer3d.py:495
ClassWanT5EncoderModel
gen3r/models/videoxfun_wan/wan_text_encoder.py:259
ClassWanTransformer3DModel
r""" Wan diffusion backbone supporting both text-to-video and image-to-video.
gen3r/models/videoxfun_wan/wan_transformer3d.py:714
ClassXLMRobertaCLIP
gen3r/models/videoxfun_wan/wan_image_encoder.py:331