Seed·Speculativeupdated Feb 20, 2026

학습 불안정은 대개 분모의 문제다

loss가 튀면 보통 데이터 탓, 학습률 탓, 아니면 운 탓으로 돌린다. 그런데 내가 실제로 끝까지 추적해 본 사례에서는 매번 직접적인 원인이 adaptive 업데이트의 분모가 무너지는 것이었다. 2차 모멘트가 정말로 작아졌거나, 축소된 정밀도에서 수치가 깨졌거나 둘 중 하나였다.

이렇게 다시 놓고 보면 쓸모 있는 진단 지표는 loss 곡선이 아니라 mintv^t\min_t \sqrt{\hat v_t}와 gradient norm 분포의 꼬리다.

관련: Warmup은 adaptive optimizer의 초기 분산을 억제한다.

상태: 내가 다루는 모델에 대해서는 이렇게 믿고 있다. transformer 계열 언어 모델 밖에서도 성립하는지는 확인하지 않았으니 국소적인 규칙으로 취급할 것.

esc