(self, s, eps)
| 85 | self.models[a].partial_fit(X, [G]) |
| 86 | |
| 87 | def sample_action(self, s, eps): |
| 88 | if np.random.random() < eps: |
| 89 | return self.env.action_space.sample() |
| 90 | else: |
| 91 | return np.argmax(self.predict(s)) |
| 92 | |
| 93 | |
| 94 | def play_one(env, model, eps, gamma): |