PPO loss obs: dict with key state/rgb; more recent obs at the end state: (B, To, Do) rgb: (B, To, C, H, W) chains: (B, K+1, Ta, Da) returns: (B, ) values: (B, ) advantages: (B,) oldlogprobs: (B, K, Ta, Da) use_
(
self,
obs,
chains_prev,
chains_next,
denoising_inds,
returns,
oldvalues,
advantages,
oldlogprobs,
use_bc_loss=False,
reward_horizon=4,
)
source not stored for this graph (policy: none)
nothing calls this directly
no test coverage detected