고UTD SAC에서 표현 붕괴는 회복되지만 Q 성장은 발산을 예고한다

Rank Collapse Is Recoverable, Growing $|Q|$ Is Not: Out-of-Sample Early Warning for Value Divergence in High-UTD Soft Actor-Critic

arXiv2609.32819v1

Tianqi Bu2026-09-26조회 2

무엇인가

이 논문은 업데이트 대 데이터 비율(UTD)을 높인 오프폴리시 강화학습에서 큰 critic이 왜, 언제 발산하는지를 조기에 예측하는 문제를 다룬다. 기존에는 표현 붕괴와 |Q| 폭주를 묶어 플라스티시티 손실로 부르고 리셋이나 정규화로 매 런마다 대응하거나 표현의 dormant unit을 감시했지만, 한 런이 얼마나 빨리 발산할지는 알려주지 못했다. 저자들은 SAC와 TD3의 612개 런, MuJoCo 5개 태스크, UTD 2·4·8·16, 너비 2048의 정규화 없는 critic과 배치 2048 설정으로 이 문제를 분리해 본다. 표준 256×2 네트워크와 배치 256에서는 Walker2d UTD 16의 24개 런이 40k 스텝 동안 하나도 플래그되지 않았지만, 2048×2 phase-map 런 10개는 모두 플래그됐고 중앙 g가 약 4배 컸다는 점에서 이는 큰 critic을 쓰는 고UTD 방법에서 특히 중요하다.

어떻게 동작하나

방법의 핵심은 훈련 가드와 조기 성장 신호 g다. 훈련 가드는 critic 손실이 10^8을 넘거나 배치 평균 |Q1|이 10^6을 넘거나 값이 비유한해지는 첫 그래디언트 스텝에서 런을 중단하고, 그 스텝을 T_flag로 부른다. 예산 H=80k까지 플래그되지 않은 런은 우측 중도절단으로 처리한다. 텔레메트리로 리턴, critic 손실, |Q|를 기록하고, 별도 프로브 배치에서 첫 critic 은닉층의 유효 랭크와 dormant fraction을 잰다. 표현 붕괴는 시드 중앙값 기준 최종 대 최대 유효 랭크 비율이 0.6 미만이고 최종 dormant fraction 중앙값이 0.5를 넘는 구성으로 정의한다. 조기 성장 신호 g는 워밍업 5k 이후 (5k,15k] 구간에서 log10|Q|를 환경 스텝에 대해 최소제곱 회귀한 기울기이며, 결정 시점 t_d=15k에 읽는다. 이 창은 첫 Walker2d 반복 실험 뒤 고정됐다. 평가는 구성 내부에서 leave-one-seed-out 로지스틱 회귀로 하고 AUC와 Harrell의 C로 순위 성능을 본다. 성장 중단 컨트롤러는 15k에서 g가 미리 보정한 중단 임계값 θ를 넘으면 런을 중단한다.

무엇과 다른가

결과의 첫 번째 주장은 표현 붕괴는 생존 가능하지만 빠른 |Q| 성장은 그렇지 않다는 것이다. HalfCheetah critic은 UTD 16에서 단위의 4분의 3 이상이 dormant가 되어도 가드가 한 런도 플래그하지 않았고, 리턴은 60k까지 계속 상승했으며 |Q|는 10^2 수준에 머물렀다. dormancy 기반 critic 리셋은 주기적 리셋처럼 작동해 6개 짝지은 시드 모두에서 더 앞선 리턴을 냈다. 반면 플래그된 런들은 |Q|가 빠르게 성장한다. r≥8의 24개 이벤트 타이밍 런에서 |Q|는 플래그 전 10k 구간의 자기 기준선에서 벗어나는데, 그 시점은 플래그보다 중앙값 6.31k 스텝 앞섰고 최대 7.5k로 설계됐다. 15k의 dormant fraction은 플래그를 우연 수준으로만 예측했고, 학습 시작 후 랭크 하락은 |Q| 성장과 거의 동시에 나타났다. 24개 런 중 14개에서 랭크가 기준선을 벗어난 시점은 |Q|보다 중앙값 0.5k 스텝 늦었다.

어떻게 쓰나

두 번째 주장은 15k의 초기 |Q| 성장이 가드가 런을 플래그할 시점을 순위화한다는 것이다. 시드가 갈리는 두 SAC 구성인 Walker2d와 Ant의 r=4에서 g의 Harrell C는 각각 0.783과 0.983이었다. 예산 내 플래그에 대한 AUC는 Walker2d에서 40k 기준 0.956이었고 80k 기준 0.780으로 떨어졌는데, 늦게 플래그되는 런들의 초기 성장이 끝까지 플래그되지 않는 런들과 비슷해지기 때문이다. 15k에서 플래그된 런의 |Q|는 플래그 수준보다 중앙값 100배 이상 낮았고, 이후 Walker2d에서 중앙값 122배(20~255배, 18.1k~65.0k 스텝 뒤), Ant에서 389배(164~570배) 더 성장했다. 임계값 외삽은 통하지 않는다. 플래그되지 않은 Walker2d 런 33개 중 18개가 예산 끝에 가장 낮은 플래그 수준 이상에서 끝났고, 15k의 직선을 연장하면 플래그 수준에 Walker2d에서 중앙값 32k, Ant에서 16k 스텝 너무 일찍 도달해 상수 예측보다 나빴다. 15k의 log10|Q| 수준 자체도 g만큼 잘 예측했는데, 시작점들이 서로 가까워 수준이 누적된 성장률이기 때문이다. 공유 프로파일 모델은 log10|Q|_i(t)=a_i+g_i h(t), T_flag,i=h^{-1}((log10 τ-a_i)/g_i)로 표현되며, g와 플래그 스텝의 Spearman 상관은 -0.64에서 -0.96 사이였다.

전제와 한계

세 번째 주장은 이 예측이 실제 컴퓨트 절약으로 이어진다는 것이다. 성장 중단 컨트롤러는 구성별로 한 번 보정한 θ를 사용해 15k에서 g가 θ를 넘는 런을 중단한다. 8겹 교차검증에서 Walker2d 코호트 64개 런의 컴퓨트를 9.9% 절약했고, 이는 오라클 절약량의 31.9%였다. Ant에서는 오라클 절약량의 66.4%를 절약했다. 레이블 없는 변형으로 다른 런들의 g 75백분위수를 넘으면 중단하는 규칙도 두 split 구성에서 컴퓨트를 절약했다. 새 Walker2d 시드 21개를 실제로 돌린 실험에서는 오라클 절약량의 25.4%를 절약했고, θ는 통제되지 않은 새 런 28개 모두에서 컴퓨트를 절약했다. 같은 회계 기준에서 dormant fraction 규칙과 리턴 중앙값 조기 중단 규칙은 두 태스크 모두에서 컴퓨트를 잃었고, 저수익 규칙은 Walker2d에서 g보다 훨씬 적게 절약하고 Ant에서는 손해였다. 학습 후 랭크 하락은 Walker2d에서 g에 거의 맞먹게 절약했지만 Ant에서는 덜했고, 프로브 배치와 SVD가 필요하다. |Q|는 critic 업데이트마다 이미 계산되므로 경고에 추가 순전파가 필요 없다.

LayerNorm critic 실험은 안정화와 성능의 상충을 보여준다. Walker2d r=4에서 32개 새 시드를 짝지어 돌린 결과 가드는 LayerNorm 런 32개 중 하나도 플래그하지 않았고 일반 critic 런은 32개 중 17개를 플래그했다. LayerNorm은 32쌍 중 31쌍에서 g를 낮췄고 중앙값은 0.160에서 0.121로 내려갔으며, 최종 dormant fraction도 거의 0에 가까웠다. 그러나 두 팔 모두 플래그되지 않은 쌍에서 LayerNorm critic의 최종 리턴은 일반 critic의 약 3분의 1이었다. 저자들이 밝힌 한계는 분명하다. 실용적 절약 근거는 주로 Walker2d에 있고, Ant r=4에서는 양의 리턴에 도달한 런이 없었다. 예측 자체는 Ant에서 가장 선명해 critic 자체를 추적한다는 증거이긴 하다. TD3에서는 Walker2d r=16에서만 가드가 플래그했고 그마저 예측이 우연과 구분되지 않았으며 컨트롤러는 컴퓨트를 잃었다. CrossQ, BRO, SimBa, MAD-TD, r=4 초과의 LayerNorm, 이산 행동은 다음 테스트 대상이다. 또한 컨트롤러는 80k까지 가드가 플래그하지 않았을 런을 중단할 수 있고 반대로 플래그할 런을 놓칠 수 있어 과신 위험이 있으며, 보정한 구성 밖에서는 일반적 안정성 보장이 없다. 코드와 시드별 로그는 요청 시 교신저자에게 받을 수 있다고만 밝혀져 있다.

개발자 관점에서 이 논문은 고UTD SAC나 TD3에서 큰 정규화 없는 critic을 쓸 때 무엇을 감시해야 하는지 바꾼다. dormant unit 수나 유효 랭크만 보면 발산을 놓칠 수 있으므로, 워밍업 후 첫 10k 스텝의 log10|Q| 기울기를 로그에서 바로 계산해 조기 경보로 쓰는 것이 낫다. 다만 중단 임계값은 구성별로 보정하고 held-out 시드와 실제 런에서 거짓 중단 비용을 반드시 확인해야 한다. LayerNorm은 플래그를 없앨 수 있지만 리턴을 크게 낮출 수 있으므로, 안정성과 성능의 교환을 측정한 뒤 선택해야 한다.