A learning schedule to choose between agent control and teacher control lim_{episode->inf} P(control=agent_control|episode) = 1 to make sure it converges
(agent_control, teacher_control, episode, beta=0.95)
source not stored for this graph (policy: none)