| 272 | return self.env.reset() |
| 273 | |
| 274 | def step(self, action): |
| 275 | observation, reward, done, info = self.env.step(action) |
| 276 | self.rewards.append(reward) |
| 277 | self.total_reward.append(reward) |
| 278 | if done: |
| 279 | # print("Done! R = %s, N = %s" % (sum(self.rewards), len(self.rewards))) |
| 280 | self.summaries_dict['reward'] = sum(self.rewards) |
| 281 | self.summaries_dict['episode_length'] = len(self.rewards) |
| 282 | |
| 283 | if self.episodic_env.was_real_done: |
| 284 | self.summaries_dict['total_reward'] = sum(self.total_reward) |
| 285 | self.summaries_dict['total_episode_length'] = len(self.total_reward) |
| 286 | info = self.summaries_dict.copy() # otherwise it will be overwritten |
| 287 | # if done: |
| 288 | # print("info:", info) |
| 289 | return observation, reward, done, info |