Variational policy search using sparse Gaussian process priors for learning multimodal optimal actions. (November 2021)