Momentum methods# Nesterov’s accelerated gradient and the Adam optimizer. Nesterov acceleration: O(1/k^2) versus O(1/k) Nesterov acceleration: O(1/k^2) versus O(1/k) Adam on a badly scaled problem Adam on a badly scaled problem