하나의 어휘로 이해·행동·미래 예측을 묶은 8B 물리 파운데이션 모델 PhysBrain 1.5
PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models
무엇인가
로봇이 환경을 관찰하고, 행동하고, 그 결과로 바뀐 세계를 다시 관찰하는 순환을 이 논문은 물리적 루프(physical loop)라고 부른다. 기존 연구는 이 루프의 조각을 따로 다뤄 왔다. 범용 비전-언어 모델(VLM)은 장면 이해와 지시 따르기를, 전용 모델은 공간 추론과 그라운딩, 어포던스, 계획, 실행 평가를 맡았다. VLA 모델인 π 시리즈, GR00T, Qwen-VLA는 로봇 행동을, DreamZero와 Qwen-RobotWorld는 예측적 월드 모델링을 담당했다. 최근 HY-Embodied, RynnBrain 1.1, MiMo-Embodied, UniVLA, RynnVLA-002, Cosmos 3 같은 임바디드 파운데이션 모델이 여러 능력을 묶으려 시도했지만, 저자들이 다루는 문제는 넓은 임바디드 이해를 말단장치(end-effector) 운동 생성 및 다중 모달 미래 상태 예측과 함께 학습하는 것이다. 이해는 언어와 좌표를, 행동은 시간 구조를 가진 운동을, 미래 예측은 조밀한 시각 출력을 감독 신호로 요구한다는 차이가 통합 학습의 핵심 난점이다.
어떻게 동작하나
PhysBrain 1.5는 Qwen3-VL Instruct 계열을 출발점으로 삼아 언어 응답, 말단장치 운동, 조밀 시각 타깃을 모두 이산 시퀀스로 인코딩하고 하나의 자기회귀 다음 토큰 예측으로 공동 최적화한다. 어휘는 V = V_lang ∪ V_act ∪ V_vis로 확장되고, 세 종류 토큰이 같은 임베딩 테이블과 같은 언어모델 출력 헤드를 공유한다. 학습 목표는 마스크된 다음 토큰 예측 L_AR = -Σ_i m_i log p_θ(y_i | x, y_<i) 하나뿐이며, 태스크 포맷과 손실 마스크 m_i가 어떤 토큰을 감독할지 결정한다. 별도의 인식 헤드, 별도의 정책 헤드, 별도의 픽셀 디코더를 두지 않고 하나의 인터페이스로 이해와 행동과 예측을 모두 표현하는 것이 설계의 핵심이다. 임바디드 이해 역시 별도 지각 헤드로 구현하지 않고, 기반 VLM의 이미지·비디오 이해 인터페이스를 유지한 채 임바디드 감독으로 강화한다.
무엇과 다른가
행동 표현은 양쪽 손목의 위치와 자세만 남기고 손가락 움직임은 제외하는 Human-as-Humanoid 파이프라인을 따른다. 각 시점 t에서 다음 16스텝(H=16)의 청크를 현재 관측의 손목 자세를 기준으로 상대 표현하며, 목표는 a_{t,k} = [p_{t+k} - p_t, ρ6(R_t^T R_{t+k}), g_{t+k}] ∈ R^10 (k=1,…,H)이다. 앞 3차원이 상대 병진, 다음 6차원이 6D 회전 표현 ρ6(R) = vec(R[:,1:2]), 마지막 1차원이 0(열림)에서 1(닫힘) 사이의 그리퍼 값이다. 이 궤적을 ActionPiece 토크나이저로 이산화하는데, 이 토크나이저는 2,870만 개의 16스텝 말단장치 궤적 세그먼트, 즉 4억 5,920만 액션 타임스텝으로 학습됐고 512개 액션 어휘를 제공한다. PhysBrain 1.5 설정에서 손목 궤적 하나는 32개의 이산 액션 토큰이 되며 좌우 손목이 같은 어휘와 코드북을 공유한다. 중요한 설계는 전역 좌표 정규화를 하지 않는다는 점이다. 데이터셋마다 로봇과 카메라와 제어 규약이 달라 신뢰할 수 있는 전역 정규화가 어렵기 때문에 각 소스의 원래 좌표축을 유지하고, 대신 현재 관측 직전의 16스텝 액션 청크 z-를 조건으로 넣어 p_θ(z+ | I, u, e, f, z-)를 예측한다. 이는 행동 예측을 독립적 청크 회귀가 아니라 조건부 궤적 연속으로 바꾸고, 최근 행동 이력이 해당 embodiment의 운동 관례와 스케일과 리듬을 추론하는 암묵적 시스템 식별 신호로 작동하게 한다.
어떻게 쓰나
미래 상태는 같은 타임스탬프와 같은 이미지 좌표계를 공유하는 RGB 이미지, 깊이 맵, 로봇 마스크의 조합 S_{t+Δ}로 정의된다. 세 모달리티는 128×128 해상도의 공유 VQ-VAE로 토큰화되며, 코드북 크기 K=16,384, 공간 다운샘플링 8배로 모달리티당 N=256개의 코드가 나온다. 시각 어휘는 코드북 인덱스에 대응하는 토큰 16,384개와 시작·끝 경계 토큰 2개를 합쳐 16,386개다. 직렬화는 각 공간 위치에서 RGB-깊이-마스크 순으로 인터리브해 y_vis = [b_start, q1_rgb, q1_depth, q1_mask, …, qN_rgb, qN_depth, qN_mask, b_end] 형태로 만들고, 총 3N=768개 VQ 토큰에 경계 토큰 2개를 더해 770개 토큰이 된다. 같은 위치의 세 모달리티 토큰을 나란히 두면 자기회귀 생성 중 지역적 교차 모달 문맥을 얻을 수 있다. VLM 학습 중에는 모달리티별 예측 헤드나 픽셀 공간 재구성 손실을 전혀 쓰지 않고, 추론 시 생성된 페이로드를 코드북 인덱스로 되돌려 16×16 그리드 세 개로 역인터리브한 뒤 동결된 VQ 디코더로 각각 복원한다.
전제와 한계
학습은 물리 인식 사전학습과 임바디드 지도 미세조정(SFT) 두 단계로 구성된다. 사전학습의 임바디드 감독은 전부 사람 상호작용 비디오에서 나온다. Xperience-10M, Egocentric-10K, Ego4D, EgoVerse, EgoDex, EgoLife, Ego-Exo4D에 자체 코퍼스 두 개(PhysBrain-Human, PhysBrain-Ego360)를 합쳐 약 3만 시간의 영상을 태스크 단위 에피소드로 분절하고 품질이 낮은 구간을 버린다. 여기서 물리 지각 데이터 2,430만 샘플(검출, 분할, 깊이, 포인팅, 계수, 3D 검출, 시간적·시공간적 그라운딩, 추적, 캡션, VQA), 사람 행동 데이터 3,120만 샘플, 사람 상호작용 미래 상태 데이터 2,680만 샘플을 만든다. 미래 상태 타깃은 목표 시점의 RGB 프레임과 그에 정렬된 깊이 맵, 상호작용하는 손과 팔의 분할 마스크로 구성된다. 여기에 일반 언어·비전-언어 지시 데이터 1,490만 샘플을 더한다. SFT 단계는 17개 실제 로봇·시뮬레이션 소스의 약 2,620시간 궤적과 500시간의 고품질 사람 모션 데이터를 재사용하고, 일반 지시 데이터 100만 샘플을 섞어 임바디드 적응 중에도 범용 능력을 유지한다. 학습은 그래디언트 노름 1.0 클리핑, bfloat16 정밀도, 패킹 후 평균 약 2K 샘플의 전역 배치로 수행된다.
평가는 물리적 루프의 앞 다섯 단계에 대응하는 28개 임바디드 벤치마크를 다섯 그룹, 즉 기초 시각-공간 지각, 공간·다중 시점 이해, 임바디드 인지·추론·계획, 공간 그라운딩·포인팅·어포던스, 시각 흔적·궤적 추론으로 나눠 진행한다. 8B 모델이 평균 72.5점을 기록해 오픈소스 최고 성능을 세웠고, 가장 강한 오픈소스 베이스라인인 Hy-Embodied-VLM-1.0을 6.5점 앞선다. 14개 벤치마크에서 1위, 24개에서 상위 2위 안에 들었고, 베이스 모델인 Qwen3-VL-Instruct(8B)보다 28개 벤치마크 전부에서 앞선다. 다섯 능력 범주 각각에서 동일 가중 평균을 냈을 때 모두 오픈소스 상위 2위 안에 든다. 독점 모델과 비교하면 GPT-6-Astra(73.3)와 Gemini 3.6 Flash(73.0)에 근접하고 Claude Opus 5(67.9)는 4.6점 차로 앞선다. 저자들은 벤치마크마다 단일 표준 지표로 모든 비교 모델을 재평가했기 때문에 표의 점수가 원 논문 보고값과 다를 수 있다고 명시한다. 일반 멀티모달 이해는 MME, MMStar, RealWorldQA, VideoMME, MVBench, POPE, AI2D, ChartQA, DocVQA, TextVQA, V*, ScreenSpot 12개 벤치마크로 평가했고 베이스 모델과 비슷한 수준을 유지한다. 행동 토큰 생성과 미래 시각 예측은 정성적 예시로만 제시되며, 학습에 없던 RoboDojo 같은 OOD 장면에서도 참조 궤적의 큰 운동 경향은 재현하지만 위치 편차가 남는다.
실무 관점에서 이 논문의 쓸모는 세 가지다. 첫째, 로봇 파운데이션 모델을 만들 때 이해와 행동과 예측을 별도 헤드로 나누지 않고 하나의 어휘와 하나의 다음 토큰 목표로 묶는 구성을 참고할 수 있다. 둘째, 행동 데이터를 전역 좌표로 정규화하는 대신 이전 액션 청크를 조건으로 주는 방식은 서로 다른 로봇과 데이터셋을 섞을 때 캘리브레이션 비용을 줄이는 실용적 대안이다. 셋째, 사람 상호작용 비디오만으로 임바디드 사전학습 감독을 구성하는 파이프라인은 로봇 데이터가 부족한 팀에 현실적인 선택지다. 다만 공개된 결과가 오프라인 궤적 예측과 정성적 미래 프레임 예측이라는 점을 확인해야 한다. 폐루프 실행 성공률이나 실제 로봇에서의 태스크 완수율은 이 보고서에 수치로 제시되지 않았고, ActionPiece 토크나이저와 VQ-VAE 같은 외부 이산화 인터페이스의 성능에 결과가 종속된다는 점도 배포 전에 따져야 한다.
저자들이 명시한 전제와 한계는 다음과 같다. 행동 생성과 미래 상태 예측의 근거는 관측된 행동 이력을 조건으로 한 오프라인 궤적 예측이며, 폐루프 실행이나 전체 태스크 성공을 다루지 않는다고 논문은 직접 밝힌다. 미래 시각 예측 결과도 1초 지평의 대표 예시로만 제시되고 정량 지표는 없다. 좌표계는 의도적으로 전역 정규화하지 않기 때문에 같은 이름의 액션 차원이 소스마다 다른 로컬 축과 운동 스케일과 제어 주파수를 가질 수 있고, 이 이질성은 모델이 입력 문맥으로 추론해야 하는 몫으로 남는다. 일부 소스는 완전한 캘리브레이션 메타데이터나 전역 프레임 정보가 없어 변환 자체가 불가능하다는 점도 근거로 든다. 또한 비교 모델 점수는 저자들이 단일 지표로 재평가한 값이라 원 논문 보고치와 직접 비교하면 안 된다. 저자들은 앞으로 학습 데이터 규모와 모달리티 범위, 상호작용 경험의 다양성을 계속 확장하겠다고 밝히고 있다.
관련 논문
- VLM을 로봇 파일럿으로 쓰는 시각 행동 워크스페이스, LIBERO-Pro 평균 75.6% 달성범용 VLM을 재학습 없이 로봇 파일럿으로 쓰는 다중 에이전트 하네스 WAA를 제안한다. 상호작용 중심 Contact view와 실행 전 행동 리허설, 뷰 내 보정을 갖춘 시각 행동 워크스페이스로 LIBERO-Pro 평균 75.6%를 달성하고 robosuite로 전이됐다.
- 예측을 행동으로 잇는 비동기 물리 세계 모델 InternW0상하이 AI 연구소가 공개한 InternW0는 비디오 예측과 로봇 제어를 비대칭 구조로 함께 학습하는 기반 물리 세계 모델이다. 7,200시간 데이터로 학습해 15단계 화학 합성과 힘 인식 조작 과제까지 평가한다.
- DART가 동결 표현을 유지한 채 디코드 경로 감독으로 잊힌 운동을 되살린다.고정된 자기지도 잠재 공간에 flow를 얹은 월드 모델이 조용히 운동성을 잃는 원인을 학습 신호에서 찾아낸다. 표현은 그대로 두고 디코드 경로 감독으로 flow만 재학습하는 DART를 제안해 운동의 시간 구조를 되살리고, 픽셀 오차만 보는 평가가 정지 예측을 보상한다는 발견도 보고한다.