16만 개 정책 학습으로 오프라인 정책 학습 순위가 튜닝에 좌우됨을 보인다

JumpStart Your Policy Learning with Lessons from 160,000 Training Runs

HF Daily2609.13730

Nabil Omi, Eric Bae, Chung Yik Edward Yeung2026-09-25

무엇인가

오프라인 정책 학습(offline policy learning)은 고정된 데이터셋만으로 정책을 학습한다는 점에서 매력적이지만, 알고리즘 비교는 일반적인 벤치마크 표가 시사하는 것보다 훨씬 어렵다. 성능은 데이터셋 선택, 환경, 하이퍼파라미터, 평가 프로토콜, 집계 규칙에 따라 크게 달라지는데, 기존 연구들은 이 요인들을 개별적으로만 다뤘을 뿐 결론을 어떻게 뒤흔드는지 대규모로 함께 조사하지 않았다. 이 논문은 약 100만 GPU-시간을 들여 114개 데이터셋(연속 제어 57개, 이산 제어 57개, 퇴화 데이터셋 필터링 후 이산 52개·연속 57개)에서 16만 개가 넘는 정책을 학습시켜 이 민감도를 가시화한다. 다루는 알고리즘은 BC, BCP(BC%), BCQ, CQL, Decision Transformer, VQ-BeT, ACT, IQL, ReBRAC, Diffusion Policy 등 10종이며, 연속 제어·로봇 조작·내비게이션·Atari를 아우른다.

어떻게 동작하나

학습 파이프라인은 검증된 구현을 제공하는 d3rlpy와 분산 하이퍼파라미터 튜닝용 Ray Tune 위에 구축됐고, 랜덤 서치와 TPE(OptunaSearch 래퍼)를 함께 사용한다. 값 기반 방법(CQL, BCQ, IQL, ReBRAC)은 연속 환경에서 50만 그래디언트 스텝, 이산 환경에서 25만 스텝을, BC·BCP·DT는 50 에폭, Diffusion과 ACT는 100 에폭, VQ-BeT는 300 스텝을 학습한다. 평가는 최종 체크포인트를 100 에피소드로 굴린 뒤, 데이터셋을 생성한 정책을 expert로, 무작위 정책 100개 궤적을 random으로 삼아 R_norm = (R_eval − R_random)/(R_expert − R_random)으로 정규화한다. 집계 지표로는 상·하위 25%를 버리는 IQM과 목표 성능 대비 부족분을 재는 optimality gap(γ=1)을 쓰고, 리더보드 간 순위 일치도는 Kendall's τ로 측정한다. 알고리즘–데이터셋 쌍마다 200회의 하이퍼파라미터 시행을 기준선으로 두고, 상위 25% 설정의 평균 점수와 95퍼센타일 설정·5개 시드 조합을 분석 단위로 삼는다.

무엇과 다른가

가장 중요한 결과는 하이퍼파라미터 선택이 시드 변동보다 훨씬 큰 변동 원인이라는 점이다. 설정 간 변동이 시드 간 변동을 초과한 비율은 알고리즘–데이터셋 셀의 92%(이상치 제거 후 83%)에 달했다. 튜닝을 하면 절대 성능뿐 아니라 순위 자체가 바뀐다. 49개 공통 데이터셋에서 튜닝 후 IQL이 IQM과 optimality gap 모두에서 BCQ를 앞질렀고, 기존 통합 리더보드에서 바닥권이던 BC도 튜닝 후에는 상당히 경쟁력 있는 위치로 올라온다. 연속 제어에서는 정규화 점수의 대부분이 25~50회 시행 안에 개선되지만 순위 일치도는 훨씬 느리게 수렴해, 성능이 평탄해진 뒤에도 리더보드는 튜닝 예산에 민감하게 흔들린다. 이산 제어는 10~25회 시행에서 순위 일치도가 빠르게 올라간다. 검색 범위가 성능을 제약했는지도 확인했는데, 상위 10% 시행이 검색 경계 5% 이내에 몰리는 경향은 중앙값 +0.1%p에 불과해 범위 자체는 충분히 넓었다.

어떻게 쓰나

저자들은 이 스윕을 재활용해 전이 가능한 기본 설정과 추천기를 만든다. 여러 환경의 고성능 설정에 좌표별 중앙값을 취한 기본값을 25개 홀드아웃 환경에 적용하면 IQM이 0.47에서 0.70으로, optimality gap이 0.55에서 0.41로 개선되어, 대상별 탐색 없이 전체 튜닝 이득의 약 절반을 회수한다. 추천기는 연속 행동 데이터셋의 관측 가능한 속성(데이터셋 크기, 에피소드 통계, 관측·행동 차원, 태스크 도메인, expert 출처, 보상 유형, 수익률 분포 통계)만으로 10개 알고리즘의 상위 25% 정규화 성능을 예측해 상위 3개를 반환한다. 데이터셋 이름·생성 알고리즘·벤치마크 결과는 특징에서 제외했고, 30개 환경 패밀리의 57개 데이터셋에 대해 환경 패밀리 단위 leave-one-out으로 평가했다. 랜덤 포레스트는 전역 평균 리더보드 베이스라인 대비 top-3 겹침을 0.409에서 0.485로, 실제 우승 알고리즘 포함률을 47.4%에서 63.2%로, best-of-three regret을 0.091에서 0.030으로, NDCG@3를 0.769에서 0.847로, Kendall's τ를 0.324에서 0.401로 개선했다. ExtraTrees는 겹침 0.503, regret 0.023으로 점추정치는 조금 더 좋지만 랜덤 포레스트와 통계적으로 구분되지 않으며, 보정 품질(Brier 0.188 대 0.213, ECE 0.072 대 0.133)이 더 나은 랜덤 포레스트가 최종 추천기로 선택됐다. expert 출처를 통째로 홀드아웃한 스트레스 테스트에서도 랜덤 포레스트는 겹침 0.427, 우승 포함률 64.0%, regret 0.073으로 베이스라인(0.387/32.0%/0.194)을 앞섰고, 특징의 50%를 가려도 겹침 0.497·regret 0.037을 유지했다.

전제와 한계

개발자 관점에서 이 논문의 실용적 산출물은 JumpStart 코퍼스다. 학습된 모든 정책, 모델별 점수와 하이퍼파라미터, 전 환경의 강한 베이스라인, 학습·평가 코드, 결과를 조회·분석·기여할 수 있는 웹사이트를 공개해, 새 방법을 제안할 때 대규모 튜닝 스윕을 다시 돌리지 않고도 경쟁력 있는 기준점과 비교할 수 있게 한다. 저자들의 권고는 명확하다. 하이퍼파라미터를 구현 세부사항이 아니라 방법 평가의 일부로 취급하고 검색 공간·탐색 절차·튜닝 예산·모델 선택 규칙을 보고할 것, 시드 반복은 설정 탐색을 대체하지 못한다는 것, 실무적으로는 25~50회 시행이 유용한 타협점이라는 것, 환경 버전이 다르면 기존 논문 수치를 그대로 복사하지 말 것, human·scripted·planner·RL 생성 데이터는 풀링된 집계 대신 출처별로 나눠 보고할 것, IQM과 optimality gap에 불확실성 추정을 붙일 것 등이다. 추천기는 확신이 높을 때 파일럿에 시도할 알고리즘 수를 줄여주고, 확신이 낮거나 태스크 정보가 부족하면 전역 리더보드로 되돌아가는 것이 안전하다.

한계도 분명히 밝힌다. Minari 데이터셋은 D4RL과 비트 단위로 동일하지 않아 AntMaze의 CQL 같은 일부 절대 수치가 기존 보고와 다를 수 있다. RL 생성 데이터(57개 중 32개)에 대해서는 출처 홀드아웃 테스트를 하지 않았는데, 이들을 제거하면 expert 출처 이동과 태스크 도메인·특징 지원 이동이 뒤섞이기 때문이다. 전이된 기본 설정은 강한 출발점일 뿐 정확한 비교가 필요할 때 전체 튜닝을 대체하지 못하며, 연속 제어 리더보드는 여전히 튜닝 예산에 민감하다. 추천기는 연속 행동 데이터셋 57개 예시에만 기반하고 신경망 예측기는 표본 부족으로 제외했으며, 특징이 크게 결측되면 명시적 전역 리더보드 폴백으로 수렴한다.