Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/JaceyHuang/Gen3R
/ types & classes
Types & classes
84 in github.com/JaceyHuang/Gen3R
⨍
Functions
431
◇
Types & classes
84
↓ 11 callers
Class
CausalConv3d
Causal 3d convolusion.
gen3r/models/geometry_adapter/geometry_adapter.py:36
↓ 11 callers
Class
CausalConv3d
Causal 3d convolusion.
gen3r/models/videoxfun_wan/wan_vae.py:24
↓ 6 callers
Class
ResidualBlock
gen3r/models/geometry_adapter/geometry_adapter.py:205
↓ 6 callers
Class
ResidualBlock
gen3r/models/videoxfun_wan/wan_vae.py:193
↓ 6 callers
Class
T5LayerNorm
gen3r/models/videoxfun_wan/wan_text_encoder.py:47
↓ 5 callers
Class
LayerNorm
gen3r/models/videoxfun_wan/wan_image_encoder.py:50
↓ 5 callers
Class
RMS_norm
gen3r/models/geometry_adapter/geometry_adapter.py:58
↓ 5 callers
Class
RMS_norm
gen3r/models/videoxfun_wan/wan_vae.py:46
↓ 4 callers
Class
AttentionBlock
Causal self-attention with a single head.
gen3r/models/geometry_adapter/geometry_adapter.py:243
↓ 4 callers
Class
AttentionBlock
Causal self-attention with a single head.
gen3r/models/videoxfun_wan/wan_vae.py:230
↓ 4 callers
Class
DinoVisionTransformer
gen3r/models/vggt/layers/vision_transformer.py:42
↓ 4 callers
Class
Resample
gen3r/models/geometry_adapter/geometry_adapter.py:84
↓ 4 callers
Class
WanLayerNorm
gen3r/models/videoxfun_wan/wan_transformer3d.py:420
↓ 3 callers
Class
T5Attention
gen3r/models/videoxfun_wan/wan_text_encoder.py:62
↓ 3 callers
Class
T5RelativeEmbedding
gen3r/models/videoxfun_wan/wan_text_encoder.py:211
↓ 3 callers
Class
WanRMSNorm
gen3r/models/videoxfun_wan/wan_transformer3d.py:401
↓ 2 callers
Class
DPTHead
DPT Head for dense prediction tasks. This implementation follows the architecture described in "Vision Transformers for Dense Prediction"
gen3r/models/vggt/heads/dpt_head.py:24
↓ 2 callers
Class
DropPath
Drop paths (Stochastic Depth) per sample (when applied in main path of residual blocks).
gen3r/models/vggt/layers/drop_path.py:26
↓ 2 callers
Class
Gen3RPipeline
r""" Pipeline for text-to-video generation using Wan. This model inherits from [`DiffusionPipeline`]. Check the superclass documentation for
gen3r/pipeline/pipeline_gen3r.py:163
↓ 2 callers
Class
Gen3RPipelineOutput
r""" Output class for CogVideo pipelines. Args: video (`torch.Tensor`, `np.ndarray`, or List[List[PIL.Image.Image]]): Lis
gen3r/pipeline/pipeline_gen3r.py:144
↓ 2 callers
Class
LayerScale
gen3r/models/vggt/layers/layer_scale.py:15
↓ 2 callers
Class
QuickGELU
gen3r/models/videoxfun_wan/wan_image_encoder.py:44
↓ 2 callers
Class
Resample
gen3r/models/videoxfun_wan/wan_vae.py:73
↓ 2 callers
Class
ResidualConvUnit
Residual convolution module.
gen3r/models/vggt/heads/dpt_head.py:371
↓ 2 callers
Class
T5FeedForward
gen3r/models/videoxfun_wan/wan_text_encoder.py:115
↓ 2 callers
Class
Upsample
gen3r/models/geometry_adapter/geometry_adapter.py:75
↓ 2 callers
Class
Upsample
gen3r/models/videoxfun_wan/wan_vae.py:64
↓ 2 callers
Class
VideoDataset
train_geo_adapter_pl.py:39
↓ 1 callers
Class
Aggregator
The Aggregator applies alternating-attention over input frames, as described in VGGT: Visual Geometry Grounded Transformer. Args:
gen3r/models/vggt/models/aggregator.py:26
↓ 1 callers
Class
AttentionBlock
gen3r/models/videoxfun_wan/wan_xlm_roberta.py:49
↓ 1 callers
Class
AttentionBlock
gen3r/models/videoxfun_wan/wan_image_encoder.py:115
↓ 1 callers
Class
AttentionPool
gen3r/models/videoxfun_wan/wan_image_encoder.py:159
↓ 1 callers
Class
AutoencoderKLWan_
gen3r/models/videoxfun_wan/wan_vae.py:490
↓ 1 callers
Class
BalancedDatasetWithResizeCrop
A dataset class that provides balanced sampling across multiple datasets. This class creates multiple SGDatasetWithResizeCrop instances
gen3r/data/dataset.py:207
↓ 1 callers
Class
Block
gen3r/models/vggt/layers/block.py:27
↓ 1 callers
Class
BlockChunk
gen3r/models/vggt/layers/vision_transformer.py:35
↓ 1 callers
Class
CameraHead
CameraHead predicts camera parameters from token representations using iterative refinement. It applies a series of transformer blocks (the
gen3r/models/vggt/heads/camera_head.py:21
↓ 1 callers
Class
DatasetWithResizeCrop
A dataset class for text-to-video generation that resizes inputs to fixed dimensions. This class preprocesses videos by resizing them to spe
gen3r/data/dataset.py:157
↓ 1 callers
Class
Decoder3d
gen3r/models/geometry_adapter/geometry_adapter.py:389
↓ 1 callers
Class
Decoder3d
gen3r/models/videoxfun_wan/wan_vae.py:376
↓ 1 callers
Class
DiscreteSampling
gen3r/utils/discrete_sampler.py:5
↓ 1 callers
Class
Encoder3d
gen3r/models/geometry_adapter/geometry_adapter.py:278
↓ 1 callers
Class
Encoder3d
gen3r/models/videoxfun_wan/wan_vae.py:272
↓ 1 callers
Class
FeatureFusionBlock
Feature fusion block.
gen3r/models/vggt/heads/dpt_head.py:416
↓ 1 callers
Class
GELU
gen3r/models/videoxfun_wan/wan_text_encoder.py:41
↓ 1 callers
Class
GeometryAdapter
gen3r/models/geometry_adapter/geometry_adapter.py:654
↓ 1 callers
Class
GeometryAdapterTrainer
train_geo_adapter_pl.py:81
↓ 1 callers
Class
GeometryAdapter_
gen3r/models/geometry_adapter/geometry_adapter.py:511
↓ 1 callers
Class
Head
gen3r/models/videoxfun_wan/wan_transformer3d.py:670
↓ 1 callers
Class
MLPProj
gen3r/models/videoxfun_wan/wan_transformer3d.py:698
↓ 1 callers
Class
Mlp
gen3r/models/vggt/layers/mlp.py:16
↓ 1 callers
Class
PatchEmbed
2D image to patch embedding: (B,C,H,W) -> (B,N,D) Args: img_size: Image size. patch_size: Patch token size. in_chans
gen3r/models/vggt/layers/patch_embed.py:25
↓ 1 callers
Class
PositionGetter
Generates and caches 2D spatial positions for patches in a grid. This class efficiently manages the generation of spatial coordinates for patches
gen3r/models/vggt/layers/rope.py:24
↓ 1 callers
Class
ResidualBlock
gen3r/models/videoxfun_wan/wan_camera_adapter.py:43
↓ 1 callers
Class
RotaryPositionEmbedding2D
2D Rotary Position Embedding implementation. This module applies rotary position embeddings to input tokens based on their 2D spatial positio
gen3r/models/vggt/layers/rope.py:62
↓ 1 callers
Class
SelfAttention
gen3r/models/videoxfun_wan/wan_xlm_roberta.py:10
↓ 1 callers
Class
SelfAttention
gen3r/models/videoxfun_wan/wan_image_encoder.py:56
↓ 1 callers
Class
SimpleAdapter
gen3r/models/videoxfun_wan/wan_camera_adapter.py:4
↓ 1 callers
Class
SwiGLU
gen3r/models/videoxfun_wan/wan_image_encoder.py:97
↓ 1 callers
Class
T5SelfAttention
gen3r/models/videoxfun_wan/wan_text_encoder.py:136
↓ 1 callers
Class
TeaCache
Timestep Embedding Aware Cache, a training-free caching approach that estimates and leverages the fluctuating differences among model outputs
gen3r/models/videoxfun_wan/cache_utils.py:19
↓ 1 callers
Class
VisionTransformer
gen3r/models/videoxfun_wan/wan_image_encoder.py:212
↓ 1 callers
Class
WanAttentionBlock
gen3r/models/videoxfun_wan/wan_transformer3d.py:589
↓ 1 callers
Class
WanSelfAttention
gen3r/models/videoxfun_wan/wan_transformer3d.py:433
↓ 1 callers
Class
XLMRoberta
XLMRobertaModel with no pooler and no LM head.
gen3r/models/videoxfun_wan/wan_xlm_roberta.py:76
↓ 1 callers
Class
XLMRobertaWithHead
gen3r/models/videoxfun_wan/wan_image_encoder.py:306
Class
Attention
gen3r/models/vggt/layers/attention.py:21
Class
AutoencoderKLWan
gen3r/models/videoxfun_wan/wan_vae.py:624
Class
BaseDataset
Base dataset class for geometry-aware video training. The dataset reads three metadata files (camera paths, prompt-file paths, and extra
gen3r/data/dataset.py:21
Class
CLIPModel
gen3r/models/videoxfun_wan/wan_image_encoder.py:504
Class
FlowDPMSolverMultistepScheduler
`FlowDPMSolverMultistepScheduler` is a fast dedicated high-order solver for diffusion ODEs. This model inherits from [`SchedulerMixin`] and [
gen3r/utils/fm_solvers.py:69
Class
FlowUniPCMultistepScheduler
`UniPCMultistepScheduler` is a training-free framework designed for the fast sampling of diffusion models. This model inherits from [`Schedu
gen3r/utils/fm_solvers_unipc.py:20
Class
Interpolate
gen3r/models/geometry_adapter/geometry_adapter.py:27
Class
MemEffAttention
gen3r/models/vggt/layers/attention.py:80
Class
NestedTensorBlock
gen3r/models/vggt/layers/block.py:210
Class
SwiGLUFFN
gen3r/models/vggt/layers/swiglu_ffn.py:14
Class
SwiGLUFFNFused
gen3r/models/vggt/layers/swiglu_ffn.py:54
Class
T5CrossAttention
gen3r/models/videoxfun_wan/wan_text_encoder.py:169
Class
VGGT
gen3r/models/vggt/models/vggt.py:18
Class
WanI2VCrossAttention
gen3r/models/videoxfun_wan/wan_transformer3d.py:526
Class
WanT2VCrossAttention
gen3r/models/videoxfun_wan/wan_transformer3d.py:495
Class
WanT5EncoderModel
gen3r/models/videoxfun_wan/wan_text_encoder.py:259
Class
WanTransformer3DModel
r""" Wan diffusion backbone supporting both text-to-video and image-to-video.
gen3r/models/videoxfun_wan/wan_transformer3d.py:714
Class
XLMRobertaCLIP
gen3r/models/videoxfun_wan/wan_image_encoder.py:331