Reading · RDG-2026-02-19

적응적 학습률의 분산에 관하여

Their claim

warmup이 통하는 이유는 초기 몇 스텝에서 적응적 학습률의 분산이 발산하기 때문이며, 그 분산을 직접 보정하면 warmup이 필요 없어진다.

Where I think it's wrong

보정항의 유도가 gradient i.i.d. 가정 위에 서 있는데, 그 가정이 가장 크게 깨지는 구간이 바로 이 논문이 다루는 학습 초반이다. 그런데도 실험 결과는 잘 맞는다. 메커니즘은 맞고 유도는 사후적으로 붙인 것 아닐까 싶다.

warmup의 메커니즘을 가장 깔끔하게 진술한 글이고, Warmup은 adaptive optimizer의 초기 분산을 억제한다는 여기에 기대고 있다.

이 논문이 다루지 않는 것도 적어둘 만하다. 큰 배치 학습에 대해서는 아무 말도 하지 않는데, 내 열린 질문은 정확히 거기 있다.

esc