(step_env, sys, state, us)
| 21 | |
| 22 | |
| 23 | def render_us(step_env, sys, state, us): |
| 24 | rollout = [] |
| 25 | rew_sum = 0.0 |
| 26 | Hsample = us.shape[0] |
| 27 | for i in range(Hsample): |
| 28 | rollout.append(state.pipeline_state) |
| 29 | state = step_env(state, us[i]) |
| 30 | rew_sum += state.reward |
| 31 | # rew_mean = rew_sum / (Hsample) |
| 32 | # print(f"evaluated reward mean: {rew_mean:.2e}") |
| 33 | return html.render(sys, rollout) |
| 34 |