↓ 1 callersFunction_make_vit_b_rn50_backbone(
model,
features=[256, 512, 768, 768],
size=[384, 384],
hooks=[0, 1, 8, 11],
vit_features
ldm/modules/midas/midas/vit.py:343
↓ 1 callersFunctiondiffuse(
pipe,
cond_embeddings, # text conditioning, should be (1, 77, 768)
cond_latents, # image condi
webui/streamlit/scripts/txt2vid.py:1047