Evolved Policy Gradients
blog.openai.com
blog.openai.com
Parametrize your loss function and wrap a normal policy optimization with a random search to find a better loss function. Don't call it "random search," call it "evolution strategies" to make it sound sophisticated.
Neat idea.
Any suggestion is welcome
See for example: http://sdk.rethinkrobotics.com/intera/Gazebo_Tutorial, http://wiki.ros.org/ur_gazebo, http://wiki.ros.org/katana_gazebo_plugins