CRL이 개별 변수 대신 개입 블록을 식별해 라벨 없이 로봇 상태를 추정한다

Block Disentanglement in CRL: Bridging Identifiability and Visual State Estimation

arXiv2610.06809v1

Emre Acartürk2026-10-05

무엇인가

물리 시스템의 상태 변수는 직접 관측되지 않고 이미지·비디오 같은 고차원 센서 데이터로만 간접 관측되는 경우가 많다. 라벨 없이 잠재 인과 변수를 복원하는 인과 표현 학습(CRL)은 이런 상황의 자연스러운 해법이지만, 기존 식별가능성(identifiability) 보장은 매우 강한 가정에 기대고 있다. 논문은 그 가정을 여섯 범주로 정리한다. C1 원자적 개입 대상(개입이 정확히 한 잠재 좌표만 바꿈), C2 do/하드 개입(부모 의존성을 끊음), C3 페어링(노드마다 짝지은 개입 환경), C4 개입 간 충분한 차이, C5 샘플 독립(i.i.d.), C6 잠재 차원을 아는 것. 실제 비디오에서는 시간적 의존, 불완전하고 서로 얽힌 개입, 알 수 없는 차원 때문에 이들이 동시에 성립하기 어렵다.

어떻게 동작하나

이론적 기여는 식별 목표 자체를 낮추는 것이다. 개별 변수 단위 분리(elementwise disentanglement) 대신 블록 분리(block disentanglement)를 목표로 삼고, C1~C4를 두 개의 집단적 조건으로 대체한다. 정의 2는 활성 블록(모든 개입 대상의 합집합, 크기 m)이 그래프에서 조상 폐쇄(ancestrally closed)일 것을, 정의 3은 집단적 랭크 다양성(collective rank diversity)을 요구한다. 즉 개입별 score difference들을 모은 행렬 D(z)의 랭크가 활성 블록 크기 |I|와 같아야 한다. 정리 1에 따르면, 인코더-디코더 쌍 (h,g)가 X를 완전 복원하고 추정 score difference 행렬 D_Ẑ(ẑ) = [J_h(x)^†]^T D_X(x)가 |Î|=|I|인 행 집합 Î에만 지지되면, 정의 2·3과 C5·C6 아래에서 Ẑ=h(X)가 참 활성 블록 Z_I를 블록 분리한다. 잠재 공간의 score difference는 d^(k)(z) = s^(k)(z) − s(z) = Σ_{i∈I_k} ∇_z log(q_i^(k)/p_i)로 정의되고, 관측 공간의 것과는 f의 야코비안 유사역행렬 전치로 연결된다. 핵심은 개입 하나하나에 원자성·하드성·페어링·차이를 요구하지 않고, 개입들의 score difference 방향이 활성 부분공간을 집합적으로 스팬하기만 하면 된다는 점이다. 비페어링, 다중 노드, 소프트 개입이 허용된다.

무엇과 다른가

실험 파이프라인은 세 단계다. 1단계 AE1이 128×128 회색조 이미지를 재구성 손실로 학습해 8×8×1 특징 Y로 압축하고 동결한다. 2단계 LDR은 각 개입 환경 k마다 이진 분류기를 교차엔트로피로 학습하는데, 이 분류기가 로그 밀도비를 추정하므로 로짓의 그래디언트 ∇_y f_LDR^(k)(y)가 특징 공간의 score difference 추정치가 된다. 3단계 AE2는 Y 위에서 목적식 (10)으로 Ẑ∈R^{d_b}를 학습한다. 목적식은 재구성 항에 λ를 곱한 블록 희소성 항(활성 블록 밖 좌표에서 E[|J_g(ẑ)^T D_X(x)|]의 프로베니우스 노름)과 λ_s를 곱한 스케일 항 (E[||h(x)||]−1)^2을 더한 형태다. 잠재 차원 n은 몰라도 되지만 활성 블록 크기 m은 안다고 가정한다.

어떻게 쓰나

데이터는 Panda-Gym으로 생성한다. 로봇팔의 관절 각도만 변화시키고 링크 형상·카메라 자세·조명·배경은 고정하며, 렌더링 함수 f의 단사성 가정을 지키기 위해 두 개의 서로 다른 시점에서 자세를 기록한다. assumption-matched 벤치마크는 C1~C6을 모두 만족한다. 개입은 원자적·하드이고, 관절마다 짝지은 환경이 있으며, 관절 각도는 i.i.d.로 샘플링되고, 변하는 관절 수를 안다. embodied 설정은 여기서 더 나아가 C5·C6까지 위반한다. i.i.d. 렌더링 대신 비례 제어기가 시작 자세에서 목표 자세로 팔을 움직이는 연속 비디오를 쓰고(시간적 의존), 각 환경은 지정 관절의 변위를 우선하는 목표 샘플링 분포를 갖되 나머지 관절은 동역학에 따라 움직이며(불완전·결합 개입), 학습된 병목 차원이 실제 잠재 차원과 어긋난다.

전제와 한계

결과 수치는 다음과 같다. assumption-matched 설정에서 MSE를 주 지표로 삼아, 별도 1000개 샘플로 affine 보정한 뒤 홀드아웃 평가셋에서 측정했다. 감독 베이스라인 RoboPEPP가 데이터셋의 5%(약 6.5K 라벨 포즈, 두 카메라 시점 기준 13K 라벨 이미지)로 학습했을 때와 비슷한 성능을 라벨 없이 달성했다. embodied 설정에서는 d_b=32일 때 λ=0인 재구성 전용 목적식의 active predictability가 0.23인 반면 λ=50에서는 0.61로 올라 all-latent predictability 0.67에 근접했다. 병목 차원을 d_b∈{8,12,16,32}로 키워도 활성 블록 복원 수준은 사실상 그대로였고, 전체 표현만 재구성에 도움이 되는 추가 특징을 더 학습했다. 평가는 비선형 커널 릿지 회귀 기반 R²로 세 가지를 본다. R²(Z_I | Ẑ_Î)는 활성 블록에서의 복원력, R²(Z_I | Ẑ)는 전체 잠재 표현, R²(Z_I | Y)는 1단계 압축 후 특징이 담은 정보량으로, 파이프라인 어느 단계에서 정보가 소실되는지 진단한다.

개발자 관점에서 이 논문은 라벨 없는 비디오에서 로봇이나 시뮬레이터의 상태를 복원하려는 파이프라인에 직접 쓸 수 있는 설계 지침을 준다. 첫째, 성능은 어떤 개입 환경을 수집하느냐에 달려 있다. 활성 블록은 개입 대상의 합집합으로 정의되므로, 원하는 물리 변수를 겨냥한 개입을 설계해야 그 변수가 식별 블록에 들어온다. 둘째, score difference 추정은 밀도비 분류기 학습으로 구현되므로 환경 수만큼 분류기를 돌리는 비용을 감수해야 한다. 셋째, 활성 블록 크기 m은 알아야 하지만 잠재 차원 n은 몰라도 된다. 넷째, 블록 내부는 임의의 미분동형(diffeomorphism)까지만 식별되므로, 추정된 블록을 그대로 물리 단위로 읽지 말고 선형 프로브나 회귀 헤드를 붙여 다운스트림 태스크에 연결해야 한다.

저자들이 밝힌 한계는 분명하다. 이론은 여전히 C5(샘플 독립)와 C6(잠재 차원)을 요구하며, embodied 실험은 이 둘을 위반한 상태에서 경험적으로만 유효성을 보인 것이다. 즉 이론과 실무 사이의 간극이 완전히 닫힌 것이 아니라, 개별 변수에서 개입 블록으로 식별 목표를 낮춘 한 걸음의 진전이다. 저자들은 다음 단계로 시간적 의존이 있는 관측, 근사적인 개입 효과, 알 수 없거나 과완전한 잠재 차원을 다루는 식별가능성 이론의 확장을 제시한다. 또한 활성 블록 크기 m을 안다는 전제와, 개입 효과가 이론만큼 깨끗하지 않다는 점도 실무 적용 시 감안해야 할 조건으로 남는다.