On the variance of the adaptive learning rate and beyond
Claim
warmup은 초기 몇 스텝에서 적응적 학습률의 분산이 커지는 것을 보상해 준다. 그 분산을 직접 보정하면 warmup 자체가 필요 없어진다.
Where it's shaky
분산 유도가 gradient i.i.d. 가정에 의존하는데, 그 가정이 가장 안 맞는 구간이 바로 이 논문이 다루는 학습 초반이다. 실험은 그럼에도 잘 맞고, 그래서 메커니즘은 옳되 유도는 사후적으로 붙인 설명이라는 인상을 받았다.