SILSA가 슬라이스 잠재변수로 3D 생성의 위상 보존과 비용을 함께 잡는다
SILSA: Sliding-Window Slice Latents for Topology-Preserving High-Resolution 3D Generation
무엇인가
고해상도 3D 생성은 대개 복셀 잠재변수와 다단계 파이프라인에 의존한다. 먼저 어떤 복셀이 활성인지 예측하고, 그다음 국소 형상을 합성하는 방식이다. 논문은 이 설계가 연속적인 표면을 수많은 국소 토큰으로 조각내고, 생성 비용을 부풀리며, 얇거나 연결이 많은 형상에서 위상적 일관성을 약화시킨다고 지적한다. 실제로 생성된 형상이 전체적인 외형은 맞아도 얇은 지지대, 구멍, 반복 부품을 깨뜨리거나 인접 부품을 합쳐버리는 문제가 남는다. 조밀 복셀은 해상도에 대해 3차로 비용이 늘고, 희소·계층적 토크나이저는 데이터 의존적인 토큰 수를 요구하며, 트라이플레인이나 집합 기반 잠재변수는 토큰과 국소 기하 구조 사이의 대응을 약화시킨다는 것이 논문의 진단이다.
어떻게 동작하나
SILSA의 핵심 아이디어는 형상을 세 개의 정규 축(x, y, z)을 따라 배치한 겹치는 슬라이스 잠재변수로 표현하는 것이다. 두께를 가진 슬라이스 하나가 평면 영역 전체의 위상을 하나의 일관된 단위로 담고, 슬라이스 열은 절단 축을 따라 연결 요소·구멍·부품 경계가 어떻게 변하는지를 그대로 노출한다. 구현상으로는 축마다 128개의 빈(bin)을 두고, 각 빈을 좌우 8개 빈을 포함하는 슬라이딩 윈도로 인코딩한다. 점은 위치·법선과 함께 중심 빈으로부터의 상대 깊이 오프셋 δ(p)로 증강되고, 공유 MLP를 거쳐 맥스 풀링으로 특징 h_k^j를 만든 뒤 가우시안 슬라이스 잠재변수의 사후 분포 파라미터 (μ, log σ)로 사상된다. 전체 잠재 표현은 3N = 384개의 슬라이스 토큰이며, 객체의 점유율·표면적·부품 복잡도와 무관하게 고정 길이다. 빈 윈도가 완전히 비면 학습된 빈 임베딩을 할당한다.
무엇과 다른가
복원은 SliceVAE가 담당한다. 세 축의 잠재 열을 공유 3D 특징 그리드(16³)에 흩뿌리는데, 슬라이스 해상도가 그리드보다 높을 수 있으므로 같은 그리드 평면에 매핑되는 슬라이스들을 정규화 합으로 집계한다. 이후 희소 트랜스포머 디코더와 두 번의 자기 가지치기 업샘플링 단계를 거쳐 256³까지 해상도를 올리고, 선형 헤드가 SDF 값·정점 변형·보간 가중치를 예측해 미분 가능한 Dual Marching Cubes로 메시를 추출한다. 학습 목표는 깊이·법선·실루엣에 대한 L1 렌더링 손실, KL 정규화, 그리고 위상 손실의 합이다.
어떻게 쓰나
위상 감독은 두 갈래다. 디코더가 만든 SDF 그리드에서 축마다 균등 간격의 단면을 뽑아 soft occupancy로 바꾸고, 초수준집합 여과(superlevel-set filtration)의 지속성 다이어그램을 계산한다. 차원 0은 연결 요소, 차원 1은 구멍에 대응한다. 첫 번째 항 L_PH는 예측과 정답의 지속성 다이어그램을 매칭하며, 대각선으로의 매칭도 허용해 수명이 짧은 가짜 성분·구멍을 억제한다. 두 번째 항 L_trans는 점유 경계(0.5)에서 계산한 베티 수의 인접 슬라이스 간 변화량 ΔB를 정답과 맞춘다. 이는 구멍이 너무 일찍 닫히거나, 얇은 지지대가 끊기거나, 가까운 부품이 가짜 다리로 합쳐지는 오류를 줄이려는 것이다. 베티 수는 이산값이라 순전파에서는 임계값 기반으로 계산하고 역전파에는 straight-through 추정기를 쓴다. 전체 볼륨 위상을 매칭하는 비용을 피하려고 슬라이스 내부 지속성과 인접 슬라이스 간 전이만 감독한다.
전제와 한계
생성 단계에서는 인코더·디코더를 동결하고, 단일 이미지에서 슬라이스 잠재변수를 만드는 rectified flow 트랜스포머를 학습한다. 조건은 동결된 DINOv2 인코더의 이미지 특징이다. 슬라이스 배치가 고정이므로 활성 복셀을 따로 예측하는 단계가 필요 없다. 다축 일관성을 위해 Volumetric Anchor Lattice(VAL)를 도입하는데, D×D×D×C 크기의 3D 특징 그리드를 트랜스포머 내부의 공유 공간 메모리로 두고, 각 슬라이스 토큰이 자신의 축과 깊이에 해당하는 평면에 읽고 쓴다. 블록은 축별 자기 주의, 앵커 읽기(자기 깊이 평면에 교차 주의), 게이트가 달린 앵커 쓰기, 이미지 교차 주의, 피드포워드 순으로 동작하며, VAL은 속도 평가마다 0으로 초기화된 뒤 블록을 쌓으며 축 간 증거를 누적한다.
실험은 Trellis-500K로 학습하고, 학습셋과 겹치지 않는 Toys4K 자산 200개와 야생 이미지 50장으로 평가한다. 재구성 비교 대상은 Dora, XCube, Trellis, SparseFlex이고 지표는 Chamfer Distance, F-score(0.01·0.005), Betti Error다. 이미지→3D 생성은 Shape-E, LN3Diff, Direct3D, 3DTopia-XL, InstantMesh, GaussianAnything, XCube, Dora, SAR3D, Trellis, SparseFlex와 비교하며 CLIP 유사도, FD, KD, PSNR, LPIPS, COV, MMD를 보고한다. 결과적으로 SILSA는 FD, PSNR, COV, MMD에서 최고를 기록하고 KD와 LPIPS는 최고 수준에 맞먹는다. PSNR은 SparseFlex의 30.12에서 32.74로 8.7% 상대 향상, coverage는 73.12%에서 79.08%로 5.96포인트 절대 향상이다. CLIP 점수는 SparseFlex가 약간 높지만 기하·분포 지표는 SILSA가 크게 앞선다. SliceVAE 재구성에서는 CD 0.61→0.59, [email protected] 96.18→96.79, [email protected] 83.62→84.03, IoU 92.54→93.01, Betti-Err 1.743→1.582(9.2% 상대 감소)를 기록했다. 효율은 토큰 384개로 Trellis·XCube·SparseFlex보다 98% 이상, 다음으로 압축적인 베이스라인보다 70.0% 적고, Dora 대비 학습 메모리 14.6GB→8.7GB(40.4% 감소), 학습 시간 0.38→0.21초/이터, 추론 0.82→0.34초/형상(58.5% 감소)이다.
절제 실험은 VAL의 필요성을 뒷받침한다. 세 슬라이스 스트림을 독립 생성하면 CD 5.87, IoU 49.26, Betti-Err 17.91로 무너지고, 축 간 직접 교차 주의는 CD 0.60, Betti-Err 1.64, IoU 93.18까지 회복되지만, VAL이 CD 0.59, Betti-Err 1.58로 가장 좋다. VAL 해상도는 D=16이 최적이며 D=8은 CD 0.65·IoU 91.37·Betti-Err 1.86, D=32는 IoU 93.18로 약간 오르지만 CD 0.60·Betti-Err 1.62로 나빠진다. 위상 손실을 빼면 Betti-Err가 4.43, CD가 0.78로 악화되어, 전체 손실이 1.58과 0.59를 만든다.
개발자 관점에서 이 논문이 유용한 지점은 표현 설계다. 토큰 수가 형상 복잡도에 따라 요동치는 희소 복셀 파이프라인 대신, 축당 고정 개수의 슬라이스 토큰으로 시퀀스 길이를 상수로 묶으면 메모리와 추론 시간을 예측 가능하게 잡을 수 있다. 또 활성 구조 예측과 국소 형상 합성을 한 단계로 합치는 구조는 다단계 파이프라인의 오류 전파를 줄인다. 도입을 검토한다면 확인할 것들은 다음과 같다. 슬라이스 수 N과 윈도 폭 w, VAL 해상도 D가 품질·비용 곡선에서 어디에 놓이는지, 위상 손실의 가중치 λ_PH·λ_trans와 단면 샘플 수 N_s가 학습 안정성에 미치는 영향, 그리고 Betti 수의 straight-through 추정이 학습 초반에 주는 잡음이다. 위상 지표를 자체 평가에 넣을 계획이라면 Betti Error 계산 방식(연결 요소와 구멍 불일치의 평균)을 그대로 재현해 비교 기준을 맞추는 편이 좋다.
한계와 전제는 다음과 같다. 제공된 원문에는 별도의 한계 절이 없고 결론에서도 한계를 명시하지 않는다. 다만 본문에서 확인되는 전제는 분명하다. 표현이 객체 복잡도와 무관하게 384개 토큰으로 고정되므로, 극단적으로 세밀한 형상에서는 이 상수가 병목이 될 수 있다. 위상 손실은 전체 볼륨이 아니라 축마다 균등 간격으로 뽑은 N_s개 단면에서만 계산되어 근사이며, 베티 수가 이산값이라 역전파에 straight-through 추정기를 쓴다는 근사가 남는다. VAL 해상도도 D=32에서 CD와 Betti-Err가 오히려 나빠지는 트레이드오프가 있어 무작정 키우는 방향이 답이 아니다. 평가 범위는 Toys4K 200개 자산과 야생 이미지 50장으로 제한되고, CLIP 유사도에서는 SparseFlex에 소폭 뒤진다. 원문은 추가 절제 실험이 부록 E에 있다고만 밝히며, 제공된 본문에는 그 내용이 포함되어 있지 않다.