(mu_0T, rng)
| 128 | |
| 129 | # run reverse |
| 130 | def update(mu_0T, rng): |
| 131 | sigma = 1.0 |
| 132 | mu_0t = mu_0T |
| 133 | mu_0ts = [] |
| 134 | with tqdm(range(args.Nrefine - 1, 0, -1), desc="Path Integrating") as pbar: |
| 135 | for t in pbar: |
| 136 | carry_once = (t, rng, mu_0t, sigma) |
| 137 | (t, rng, mu_0t, sigma), rew = update_once(carry_once, None) |
| 138 | mu_0ts.append(mu_0t) |
| 139 | # Update the progress bar's suffix to show the current reward |
| 140 | pbar.set_postfix({"rew": f"{rew:.2e}"}) |
| 141 | return mu_0ts |
| 142 | |
| 143 | rng_exp, rng = jax.random.split(rng) |
| 144 | mu_0ts = update(mu_0T, rng_exp) |
no test coverage detected