(state)
| 52 | |
| 53 | |
| 54 | def select_action(state): |
| 55 | state = torch.from_numpy(state).float().unsqueeze(0) |
| 56 | probs = policy(state) |
| 57 | m = Categorical(probs) |
| 58 | action = m.sample() |
| 59 | policy.saved_log_probs.append(m.log_prob(action)) |
| 60 | return action.item() |
| 61 | |
| 62 | |
| 63 | def finish_episode(): |