(agent, env, is_train)
| 330 | |
| 331 | |
| 332 | def play_one_episode(agent, env, is_train): |
| 333 | # note: after transforming states are already 1xD |
| 334 | state = env.reset() |
| 335 | state = scaler.transform([state]) |
| 336 | done = False |
| 337 | |
| 338 | while not done: |
| 339 | action = agent.act(state) |
| 340 | next_state, reward, done, info = env.step(action) |
| 341 | next_state = scaler.transform([next_state]) |
| 342 | if is_train == 'train': |
| 343 | agent.update_replay_memory(state, action, reward, next_state, done) |
| 344 | agent.replay(batch_size) |
| 345 | state = next_state |
| 346 | |
| 347 | return info['cur_val'] |
| 348 | |
| 349 | |
| 350 |
no test coverage detected