| 95 | |
| 96 | |
| 97 | class MaxAndSkipEnv(gym.Wrapper): |
| 98 | def __init__(self, env, skip=4): |
| 99 | """Return only every `skip`-th frame""" |
| 100 | gym.Wrapper.__init__(self, env) |
| 101 | # most recent raw observations (for max pooling across time steps) |
| 102 | self._obs_buffer = np.zeros((2,) + env.observation_space.shape, dtype='uint8') |
| 103 | self._skip = skip |
| 104 | |
| 105 | def step(self, action): |
| 106 | """Repeat action, sum reward, and max over last observations.""" |
| 107 | total_reward = 0.0 |
| 108 | done = None |
| 109 | for i in range(self._skip): |
| 110 | obs, reward, done, info = self.env.step(action) |
| 111 | if i == self._skip - 2: |
| 112 | self._obs_buffer[0] = obs |
| 113 | if i == self._skip - 1: |
| 114 | self._obs_buffer[1] = obs |
| 115 | total_reward += reward |
| 116 | if done: |
| 117 | break |
| 118 | # Note that the observation on the done=True frame |
| 119 | # doesn't matter |
| 120 | max_frame = self._obs_buffer.max(axis=0) |
| 121 | |
| 122 | return max_frame, total_reward, done, info |
| 123 | |
| 124 | def reset(self, **kwargs): |
| 125 | return self.env.reset(**kwargs) |
| 126 | |
| 127 | |
| 128 | class ClipRewardEnv(gym.RewardWrapper): |