MCPcopy Create free account

hub / github.com/DartML/PPO-Stein-Control-Variate / functions

Functions157 in github.com/DartML/PPO-Stein-Control-Variate

↓ 21 callersMethodlog
(self, *args, level=INFO)
evaluation/tb_logger.py:240
↓ 14 callersMethodlog
(self, *args, level=INFO)
optimization/tb_logger.py:240
↓ 6 callersFunctionlog
Write the sequence of args, with no separators, to the console and output files (if you've configured an output file).
optimization/tb_logger.py:174
↓ 6 callersFunctionlog
Write the sequence of args, with no separators, to the console and output files (if you've configured an output file).
evaluation/tb_logger.py:174
↓ 5 callersMethodshuffle
(self)
evaluation/utils.py:69
↓ 5 callersMethodvariable
(self,shape, f)
optimization/phi_functions/ContinousMLPPhiFunction.py:67
↓ 5 callersMethodvariable
(self,shape,f)
evaluation/phi_functions/ContinousMLPPhiFunction.py:30
↓ 4 callersFunctionadd_disc_sum_rew
(trajectories, gamma)
evaluation/main_algo.py:104
↓ 4 callersFunctionadd_gae
(trajectories, gamma, lam)
evaluation/main_algo.py:123
↓ 4 callersFunctionadd_value
(trajectories, val_func)
evaluation/main_algo.py:115
↓ 4 callersFunctionbuild_train_set
(trajectories)
evaluation/main_algo.py:137
↓ 4 callersFunctionrun_policy
(env, policy, scaler, num_episodes, max_timesteps, mode)
evaluation/main_algo.py:68
↓ 3 callersMethodpredict
Predict method
optimization/value_function.py:99
↓ 3 callersMethodpredict
Predict method
evaluation/value_function.py:124
↓ 2 callersFunction_show
(_i)
optimization/utils.py:61
↓ 2 callersMethod_truncate
(self, s)
optimization/tb_logger.py:71
↓ 2 callersMethod_truncate
(self, s)
evaluation/tb_logger.py:71
↓ 2 callersMethodclose
(self)
optimization/tb_logger.py:252
↓ 2 callersFunctiondiscount
Calculate discounted forward sum of a sequence at each point
optimization/main_algo.py:163
↓ 2 callersFunctiondiscount
Calculate discounted forward sum of a sequence at each point
evaluation/main_algo.py:99
↓ 2 callersMethodfit
Fit model to current data batch + previous data batch Args: x: features y: target
evaluation/value_function.py:88
↓ 2 callersMethodget_batch_gradient
(self, observes, actions, advantages, c)
evaluation/policy.py:335
↓ 2 callersFunctioninit_gym
(env_name)
evaluation/main_algo.py:19
↓ 2 callersFunctionprogressbar
(it, prefix = "", size = 60)
optimization/utils.py:59
↓ 2 callersFunctionrun_policy
Run policy and collect data for a minimum of min_steps and min_episodes Args: env: ai gym environment policy: policy object with
optimization/main_algo.py:122
↓ 2 callersFunctionset_global_seeds
(i)
evaluation/main_algo.py:27
↓ 2 callersMethodupdate
(self, load_policy, observes, actions, advantages, use_lr_adjust, ada_
evaluation/policy.py:370
↓ 1 callersMethod_build_graph
Build and initialize TensorFlow graph
optimization/policy.py:74
↓ 1 callersMethod_build_graph
Construct TensorFlow graph, including loss function, init op and train op
optimization/value_function.py:29
↓ 1 callersMethod_build_graph
Build and initialize TensorFlow graph
evaluation/policy.py:51
↓ 1 callersMethod_build_graph
Construct TensorFlow graph, including loss function, init op and train op
evaluation/value_function.py:29
↓ 1 callersMethod_do_log
(self, args)
optimization/tb_logger.py:258
↓ 1 callersMethod_do_log
(self, args)
evaluation/tb_logger.py:258
↓ 1 callersMethod_init_session
Launch TensorFlow session and initialize variables
optimization/policy.py:329
↓ 1 callersMethod_init_session
Launch TensorFlow session and initialize variables
evaluation/policy.py:359
↓ 1 callersMethod_kl_entropy
Add to Graph: 1. KL divergence between old and new distributions 2. Entropy of present policy given states and action
optimization/policy.py:199
↓ 1 callersMethod_kl_entropy
Add to Graph: 1. KL divergence between old and new distributions 2. Entropy of present policy given states and action
evaluation/policy.py:193
↓ 1 callersMethod_logprob
Calculate log probabilities of a batch of observations & actions
optimization/policy.py:179
↓ 1 callersMethod_logprob
Calculate log probabilities of a batch of observations & actions
evaluation/policy.py:173
↓ 1 callersMethod_loss_train_op
(self)
optimization/policy.py:231
↓ 1 callersMethod_loss_train_op
(self)
evaluation/policy.py:223
↓ 1 callersMethod_placeholders
Input placeholders
optimization/policy.py:87
↓ 1 callersMethod_placeholders
Input placeholders
evaluation/policy.py:87
↓ 1 callersMethod_policy_nn
Neural net for policy approximation function
optimization/policy.py:106
↓ 1 callersMethod_policy_nn
(self)
evaluation/policy.py:107
↓ 1 callersMethod_sample
Sample from distribution, given observation
optimization/policy.py:221
↓ 1 callersMethod_sample
Sample from distribution, given observation
evaluation/policy.py:216
↓ 1 callersFunctionadd_disc_sum_rew
Adds discounted sum of rewards to all time steps of all trajectories Args: trajectories: as returned by run_policy() gamma: disc
optimization/main_algo.py:168
↓ 1 callersFunctionadd_gae
Add generalized advantage estimator. https://arxiv.org/pdf/1506.02438.pdf Args: trajectories: as returned by run_policy(), must incl
optimization/main_algo.py:204
↓ 1 callersFunctionadd_value
Adds estimated value to all time steps of all trajectories Args: trajectories: as returned by run_policy() val_func: object with
optimization/main_algo.py:187
↓ 1 callersFunctionbuild_train_set
Args: trajectories: trajectories after processing by add_disc_sum_rew(), add_value(), and add_gae() Returns: 4-tuple of
optimization/main_algo.py:231
↓ 1 callersMethodclose_sess
Close TensorFlow session
optimization/policy.py:401
↓ 1 callersMethodclose_sess
Close TensorFlow session
optimization/value_function.py:106
↓ 1 callersFunctionconfigure
(dir=None, format_strs=None)
optimization/tb_logger.py:264
↓ 1 callersFunctionconfigure
(dir=None, format_strs=None)
evaluation/tb_logger.py:264
↓ 1 callersMethoddumpkvs
(self)
optimization/tb_logger.py:234
↓ 1 callersMethoddumpkvs
(self)
evaluation/tb_logger.py:234
↓ 1 callersFunctioneval_models
(env_name, num_episodes, gamma, lam, kl_targ, coef, use_lr_adjust, ada_kl_penalty,
evaluation/main_algo.py:237
↓ 1 callersMethodfit
Fit model to current data batch + previous data batch Args: x: features y: target
optimization/value_function.py:64
↓ 1 callersMethodget
returns 2-tuple: (scale, offset)
optimization/utils.py:54
↓ 1 callersMethodget
returns 2-tuple: (scale, offset)
evaluation/utils.py:55
↓ 1 callersMethodget_dir
(self)
optimization/tb_logger.py:249
↓ 1 callersMethodget_dir
(self)
evaluation/tb_logger.py:249
↓ 1 callersFunctioninit_gym
Initialize gym environment, return dimension of observation and action spaces. Args: env_name: str environment name (e.g. "Human
optimization/main_algo.py:56
↓ 1 callersMethoditerate_once
(self, batch_size)
evaluation/utils.py:93
↓ 1 callersMethodload_model
(self, log_dir='log_dir/')
evaluation/policy.py:78
↓ 1 callersFunctionload_sample_grads
(batch_range, prefix_dir)
evaluation/traj_visualize.py:18
↓ 1 callersMethodload_val_model
(self, log_dir='log_dir/')
evaluation/value_function.py:78
↓ 1 callersFunctionlog_batch_stats
Log batch statistics
optimization/main_algo.py:254
↓ 1 callersFunctionlogkv
Log a value of some diagnostic Call this once for each diagnostic quantity, each iteration
optimization/tb_logger.py:147
↓ 1 callersFunctionlogkv
Log a value of some diagnostic Call this once for each diagnostic quantity, each iteration
evaluation/tb_logger.py:147
↓ 1 callersMethodlogkv
(self, key, val)
optimization/tb_logger.py:231
↓ 1 callersMethodlogkv
(self, key, val)
evaluation/tb_logger.py:231
↓ 1 callersFunctionmain
Main training loop Args: env_name: OpenAI Gym environment name, e.g. 'Hopper-v1' num_iterations: maximum number of iterations to
optimization/main_algo.py:276
↓ 1 callersFunctionmake_output_format
(format, ev_dir)
optimization/tb_logger.py:128
↓ 1 callersFunctionmake_output_format
(format, ev_dir)
evaluation/tb_logger.py:128
↓ 1 callersFunctionmkdir_p
(path)
evaluation/traj_visualize.py:9
↓ 1 callersMethodnext_batch
(self, batch_size)
evaluation/utils.py:80
↓ 1 callersFunctionrun_episode
Run single episode with option to animate Args: env: ai gym environment policy: policy object with sample() method scale
optimization/main_algo.py:76
↓ 1 callersFunctionrun_episode
(env, policy, scaler, max_timesteps, animate=False)
evaluation/main_algo.py:37
↓ 1 callersMethodsample
Draw sample from policy distribution
optimization/policy.py:334
↓ 1 callersMethodsample
Draw sample from policy distribution
evaluation/policy.py:364
↓ 1 callersMethodsave_policy
(self, model_dir="models/policy_models")
evaluation/policy.py:422
↓ 1 callersMethodsave_val_func
(self, model_dir="models/val_models")
evaluation/value_function.py:131
↓ 1 callersFunctionset_global_seeds
(i)
optimization/main_algo.py:46
↓ 1 callersMethodset_level
(self, level)
optimization/tb_logger.py:246
↓ 1 callersMethodset_level
(self, level)
evaluation/tb_logger.py:246
↓ 1 callersFunctiontrain_models
(env_name, num_episodes, gamma, lam, kl_targ, coef, use_lr_adjust, ada_kl_penalty,
evaluation/main_algo.py:171
↓ 1 callersMethodupdate
Update running mean and variance (this is an exact method) Args: x: NumPy array, shape = (N, obs_dim) see: https://stats
optimization/utils.py:28
↓ 1 callersMethodupdate
Update policy based on observations, actions and advantages Args: observes: observations, shape = (N, obs_dim) actio
optimization/policy.py:340
↓ 1 callersMethodupdate
Update running mean and variance (this is an exact method) Args: x: NumPy array, shape = (N, obs_dim) see: https://stats
evaluation/utils.py:29
↓ 1 callersMethodwritekvs
Write key-value pairs
optimization/tb_logger.py:21
↓ 1 callersMethodwritekvs
Write key-value pairs
evaluation/tb_logger.py:21
↓ 1 callersMethodwriteseq
Write a sequence of other data (e.g. a logging message)
optimization/tb_logger.py:27
↓ 1 callersMethodwriteseq
Write a sequence of other data (e.g. a logging message)
evaluation/tb_logger.py:27
Method__call__
(self, obs_ph, act_ph, reuse=True)
optimization/phi_functions/ContinousMLPPhiFunction.py:34
Method__call__
(self, obs_ph, act_ph, reuse=True)
evaluation/phi_functions/ContinousMLPPhiFunction.py:34
Method__init__
(self, file)
optimization/tb_logger.py:38
Method__init__
(self, file)
optimization/tb_logger.py:81
Method__init__
(self, dir)
optimization/tb_logger.py:96
next →1–100 of 157, ranked by callers