Tags a3c1 actor-critic1 advantage1 applications1 asynchronous1 cartpole1 classic-control1 clipped-surrogate1 continuous-control1 curiosity1 ddpg1 debugging tips2 deep-q-networks1 deterministic-policy1 differential-evolution1 distributed-rl1 double-dqn1 dqn1 dqn-improvements1 dueling-dqn1 dyna-q1 eligibility-traces1 environments1 evolutionary-computation2 experience-replay1 exploration1 function-approximation1 future-trends1 genetic-algorithm1 heuristic-algorithms1 intrinsic-motivation1 maze1 model-based-rl1 modern-rl1 mountaincar1 multi-objective-optimization1 multi-step1 nsga-ii1 off-policy1 on-policy1 openai-gym1 optimization6 parallel-learning1 pareto-front1 policy-gradients1 policy-optimization1 power electronics1 ppo1 prioritized-replay1 PSIM1 pso1 Python3 python6 q-learning2 reinforcement-learning1 research-directions1 rl-summary1 robotics1 sarsa1 sarsa-lambda1 simulated-annealing1 simulation1 startwords1 stochastic-search1 swarm-intelligence1 tabular-methods1 temporal-credit1 temporal-difference1 tutorial1 value-functions1