()
| 164 | |
| 165 | |
| 166 | def driver(): |
| 167 | steps = 200 |
| 168 | cueSim = CueRewardSimulator() |
| 169 | cueSim.reset() |
| 170 | |
| 171 | observations = np.zeros((steps, 24), dtype="int32") |
| 172 | for t in range(steps): |
| 173 | observations[t], reward, done, info = cueSim.step(0) |
| 174 | |
| 175 | meanReward = observations[:, -1][observations[:, -1] != 0].mean() |
| 176 | print("Mean reward:", meanReward) |
| 177 | |
| 178 | |
| 179 | if __name__ == "__main__": |
no test coverage detected