RoboFollow는 장면 엔트로피로 로봇 에이전트의 지시 따르기 환상을 해부한다
RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents
무엇인가
언어 조건 로봇 정책(VLA, WAM)은 조작 벤치마크에서 높은 성공률을 보고하지만, 이 논문은 그 숫자가 실제 지시 수행 능력을 과장한다고 주장한다. 저자들은 원인을 '낮은 장면 엔트로피(low scene entropy)'라는 구조적 성질로 규정한다. 시각 장면이 유효한 과제를 하나만 허용하면 언어는 잉여 정보가 되고, 정책은 언어를 거의 쓰지 않고도 높은 점수를 얻는다는 것이다. 배포 가능한 로봇에서 이 구분은 결정적이다. 시각적으로는 성공한 행동이 의미적으로는 틀릴 수 있기 때문이다. 기존 벤치마크는 최종 과제 성공만 강조해 시각 인식, 언어 그라운딩, 계획, 저수준 제어를 뒤섞고, 많은 에피소드가 초기 관측만으로 추론 가능한 정답 행동을 담고 있어 언어를 부분적으로 불필요하게 만든다.
어떻게 동작하나
RoboFollow는 언어를 선택이 아니라 필수로 만드는 진단 벤치마크다. 핵심 설계 원리는 하나의 장면이 의미적으로 유효하고 기구학적으로 실행 가능한 여러 과제 분기를 동시에 지지하도록 만드는 것이다. 이 모호성을 장면 엔트로피 H_scene = H_train(T|S) = -Σ_s p(s) Σ_t p(t|s) log2 p(t|s)로 정량화한다. 여기서 T는 훈련 과제 레이블, S는 지시와 목표를 제외한 과제 독립적 초기 장면 명세다. 과제당 시연 수가 같으면 H_scene = Σ_s (K_s/K) log2 K_s가 되고, RoboFollow는 K_s = (16,16,16,16,7,4), K = 75로 3.782비트를 얻는다. 같은 정의로 LIBERO의 Spatial/Object/Goal/Long 스위트를 균등 가중하면 0.880비트다. 벤치마크는 4개 진단 장면군, 75개 훈련 과제 레이블, 6개 과제 독립 초기 장면 구성으로 이루어진다. 장면군은 외재적 공간 관계('왼쪽', '오른쪽', '뒤'), 내재적 물체 속성(색·크기·형태와 pick/push/stack/place 조합), 세밀한 행동 변조(경유점과 최종 방향 같은 절차 제약), 기초 논리 그라운딩(시간 순서, 명시적 부정, 관측 가능한 조건 분기)이다.
무엇과 다른가
평가 프로토콜은 네 단계다. L0는 훈련 분포를 따르는 분포 내 성능, L1은 지시는 그대로 두고 물체 위치를 바꿔 언어를 올바른 물리적 개체에 결속하는지 보는 시각 그라운딩, L2는 레이아웃은 고정하고 훈련에서 본 속성들의 새 조합을 쓰는 의미 조합성, L3는 시각과 의미를 동시에 교란한다. 저자들은 이 단계가 엄격한 난이도 순서가 아니라 서로 다른 일반화 차원을 분리하기 위한 것이라고 밝힌다. 채점은 최종 상태 기반 이진 성공 대신 다단계 의도-실행 프레임워크를 쓴다. 의도 점수(Intent Score)는 정책이 각 단계에서 올바른 의미적 목표, 즉 의도된 물체·관계·경유점·행동 원시동작·방향·논리 분기를 선택했는지 측정하고, 실행 점수(Execution Score)는 선택된 하위 목표가 물리적으로 완료됐는지 측정한다. 마무리 단계가 점수의 20%를 차지하며, 요청된 과제를 끝낸 뒤 지시와 무관한 추가 행동을 하지 않아야 만점을 받는다. 완료율(CR)은 장면·난이도별 과제 완료율의 비가중 평균으로 보완 지표다.
어떻게 쓰나
실험은 VLA와 WAM 패러다임을 대표하는 9개 파운데이션 모델을 쓴다. VLA는 π0, π0.5, NVIDIA GR00T N1.6, openvla-oft, xvla, ACoT-VLA, Lingbot-VLA이고 WAM은 Motus, FAST-WAM이다. 네 장면 합계 3,750개 훈련 에피소드가 있고, 분석 실험은 Scene 2의 16개 과제(800 에피소드)만 파인튜닝에 사용했다. 결과는 일관되다. Scene 1과 2에서 π 계열은 L0에서 거의 포화 수준이다. π0.5는 의도 점수 99.1%와 100.0%, π0는 98.2%와 95.6%를 기록한다. 그러나 Scene 1에서 π0는 L0 98.2%에서 L1 0.0%로 떨어지고, π0.5는 99.1%에서 L1 45.5%, L3 44.9%로 하락한다. Scene 2에서 π0.5는 L0 100.0%에서 L3 34.2%로 내려간다. 모든 장면 평균에서 모든 모델이 L0에서 L1~L3로 의도 점수가 뚜렷하게 하락하며, 이 하락은 저수준 실행 실패만으로 설명되지 않는다. π0, GR00T N1.6, Motus는 Scene 1의 L1 시각 그라운딩에서 급격히 무너지는데, 저자들은 이를 제한된 공간 그라운딩과 학습된 장면-과제 연관 의존으로 해석한다. 반대로 π0와 Motus는 Scene 1의 외재적 공간 관계보다 Scene 2의 내재적 물체 속성에서 더 견고한 의미 그라운딩을 보인다. 실로봇 파일럿에서 π0.5는 같은 물체 집합에 대해 훈련 지시 8개와 홀드아웃 지시 8개를 각 5회씩 시험했고, 성공이 20/40(50%)에서 6/40(15%)로 감소했다.
전제와 한계
분석은 실패의 두 층 구조를 드러낸다. Scene 2의 물체 정체·색·공간 관계를 겨냥한 20문항 시각 QA 프로브에서 기본 PaliGemma는 1/20, 사전학습 π0.5는 2/20, 파인튜닝된 π0.5 백본은 3/20으로 장면 이해 정확도가 계속 낮았다. 파인튜닝된 VLM이 정답을 맞힌 문항에서도 해당 에피소드의 약 절반은 잘못된 조작 행동으로 이어진다. 즉 VLM 백본의 장면 이해 부족과, 이해가 성공해도 행동 생성 파이프라인이 이를 충실히 옮기지 못하는 이해-실행 격차가 겹친다. VLM 백본이 훈련 내내 완전히 동결된 Motus에서도 정확한 시각 이해와 성공적 조작 실행 사이의 유사한 단절이 관찰된다. 완화책도 효과가 없었다. Qwen3-VL-4B는 같은 QA 프로브에서 19/20을 달성했지만, 이를 GR00T 확산 행동 헤드와 결합하고 QA 공동 학습으로 언어 능력 망각을 막은 Qwen-GR00T조차 고엔트로피 장면의 L1~L3 지시 수행이 붕괴했다. 텍스트-행동 상관을 강화하는 LangForce는 미미한 변화만 냈고, 저자들은 이 방법이 통계적 상관은 키우지만 진정한 조합적 의미 이해에 대한 명시적 감독이 없다고 해석한다. 확산 정책의 조건 신호를 키우는 Classifier-Free Guidance는 오히려 역효과였다. 가이던스 스케일을 1.2와 1.5로 올리면 L0 성능까지 떨어지고 궤적이 불규칙해진다. 저엔트로피 벤치마크에서는 무조건부 예측이 안정적 기준선을 주지만, 고엔트로피 장면에서는 언어 입력을 버리면 모델이 다중모드 추측에 빠져 CFG 잔차가 깨끗한 의미 신호 대신 잡음에 지배된다는 설명이다.
파인튜닝 설정을 바꾼 통제 실험도 격차를 좁히지 못했다. Scene 2의 16개 과제에서 π0.5로 시연 수를 과제당 25개에서 50개로 두 배로 늘리면 모든 의도 점수가 개선되지만 L0-L2 격차는 54.9%포인트에서 55.8%포인트, L0-L3 격차는 48.6%포인트에서 47.8%포인트로 큰 차이가 남는다. 지시 변형을 1개에서 5개로 늘리면 L1은 72.8%에서 79.0%, L3는 41.5%에서 53.0%로 좋아지지만 L2는 31.6%, 37.8%, 32.0%로 비단조적으로 변한다. 훈련 스텝을 2k에서 6k로 늘리면 L0와 L2는 개선되고 L1은 하락하며 L3는 4k에서 정점을 찍는다. 6k에서도 L0-L2/L3 격차는 55.8%포인트와 47.8%포인트로 남는다. 저자들은 구조적 레이아웃 다양성은 시험하지 않았고, 이를 평가하려면 새 훈련 레이아웃이 필요하며 기존 L1 테스트 레이아웃으로 훈련하면 분할이 무효가 된다고 밝힌다.
개발자 관점에서 이 논문은 벤치마크 성공률을 지시 수행 능력의 증거로 읽으면 안 된다는 경고다. 특히 훈련 장면이 하나의 정답 행동만 허용하는 저엔트로피 환경이라면, 높은 성공률은 언어를 무시한 시각적 지름길의 결과일 수 있다. 정책을 평가할 때는 같은 장면에 여러 유효한 과제 분기를 두고 지시만 바꿨을 때 행동이 실제로 달라지는지, 물체 위치를 바꿨을 때 언어가 올바른 개체에 결속되는지, 훈련에서 본 속성의 새 조합을 이해하는지를 확인해야 한다. 또한 최종 성공이 아니라 의도 선택과 실행을 분리해 측정해야 의미 오해와 제어 실패를 구분할 수 있다. 더 강한 VLM 백본, QA 공동 학습, LangForce, CFG 같은 기성 완화책이 이 격차를 메우지 못했다는 점도 실무 선택에 직접적인 시사점을 준다.
저자들이 밝힌 한계는 분명하다. RoboFollow는 진단 벤치마크이지 구현 능력 전반의 종합 시험이 아니다. 고엔트로피 장면은 물체 기하, 과제 지평, 상호작용 동역학을 단순화해 지시 수행 실패를 실행 교란에서 분리하므로, 장기 지평 계획, 접촉이 많은 조작, 개방 어휘 다양성, 대규모 실세계 배포를 충분히 다루지 못한다. 통제 실험은 시연 수, 지시 변형, 훈련 기간을 바꿨지만 훈련 중 구조적 레이아웃 다양성 증가는 시험하지 않았다. 실로봇 파일럿은 서로 다른 지시 집합을 비교한 것으로 짝지은 과제 쌍이 아니며, 시뮬레이터 간 전이나 더 복잡한 실세계 과제로의 전이도 확립되지 않았다. 저자들은 언어 필수 설계 원리를 유지한 채 더 풍부한 구현체와 실세계 시나리오로 확장하는 것을 향후 과제로 제시한다.