(agent, env, is_train)
| 323 | |
| 324 | |
| 325 | def play_one_episode(agent, env, is_train): |
| 326 | # note: after transforming states are already 1xD |
| 327 | state = env.reset() |
| 328 | state = scaler.transform([state]) |
| 329 | done = False |
| 330 | |
| 331 | while not done: |
| 332 | action = agent.act(state) |
| 333 | next_state, reward, done, info = env.step(action) |
| 334 | next_state = scaler.transform([next_state]) |
| 335 | if is_train == 'train': |
| 336 | agent.update_replay_memory(state, action, reward, next_state, done) |
| 337 | agent.replay(batch_size) |
| 338 | state = next_state |
| 339 | |
| 340 | return info['cur_val'] |
| 341 | |
| 342 | |
| 343 |
no test coverage detected