해시 충돌을 계산해 주파수 대역별 해상도를 재배분하는 이미지 피팅 기법 CARA
CARA: Collision-Aware Resolution Adaptation for Multiresolution Hash Encoding Based Image Fitting
무엇인가
이 논문은 암시적 신경 표현(INR)으로 이미지를 피팅할 때 쓰이는 다중 해상도 해시 인코딩의 용량 배분 문제를 다룬다. 좌표 기반 MLP는 저주파 성분을 먼저 학습하는 스펙트럼 편향 때문에 세밀한 고주파 디테일 복원이 느리고 부정확한데, Instant-NGP류 방식은 여러 해상도의 학습 가능한 해시 테이블에 특징을 저장하고 가벼운 MLP로 디코딩해 이 문제를 완화한다. 저자들이 지적하는 한계는 두 가지다. 첫째, 해상도 스케줄이 데이터와 무관하게 기하급수적으로 고정되어 있어 이미지마다 다른 주파수 정보 분포를 반영하지 못한다. 둘째, 여러 격자 정점이 같은 테이블 항목으로 매핑되는 해시 충돌이 해상도 레벨마다 다르게 정보를 훼손하는데, 기존 설계는 해상도 배정과 충돌을 독립적인 설계 요소로 취급한다. 결과적으로 정보가 적은 대역에 파라미터가 과하게 배정되고 정보가 밀집한 대역은 용량이 부족해진다.
어떻게 동작하나
제안 방법의 출발점은 각 해상도 레벨이 담당하는 주파수 대역을 정량화하는 것이다. 해상도 N_ℓ 격자는 나이퀴스트 한계 f_Nyq = N_ℓ/(2w)를 가지므로 컷오프 주파수 f와 격자 해상도 N_f = 2wf가 대응한다. 저자들은 대역 정보 밀도를 ℑ(f) = H(Y_{≤f+Δf} − Y_{≤f}) · N_f² 로 정의한다. 여기서 H는 대역 통과 잔차 신호의 실험적 섀넌 엔트로피, N_f²는 해당 해상도의 공간 샘플 수다. 엔트로피를 정보량 프록시로 쓰는 근거는 섀넌 소스 코딩 정리이며, ℓ2 에너지나 분산은 대역 잔차의 분포를 반영하지 못한다고 본다. 실제로 Kodak 1은 고주파 대역에, Kodak 22는 저·중주파 대역에 정보가 몰려 있어 두 이미지의 스펙트럼 정보 분포가 크게 다르다.
무엇과 다른가
다음 단계는 해시 충돌을 용량 계산에 넣는 것이다. 레벨 ℓ의 격자 정점 수 n_ℓ = N_ℓ², 테이블 크기 T일 때 부하율 α_ℓ = n_ℓ/T이고, 균일 해싱 가정 아래 삽입된 키당 기대 고유 항목 수는 w_hash = (1 − e^{−α})/α 다. 저장된 B비트 중 실제로 꺼낼 수 있는 정보는 B·w_hash로 줄어든다. 저자들은 후보 해상도 집합 {N^(k)}를 두고 각 후보의 충돌 효율 w_k^hash를 계산한 뒤, 주파수 축을 L개 대역으로 나누어 대역별 유효 정보 ℐ_ℓ = w_{k_ℓ}^hash · Σ_{f∈F_ℓ} ℑ(f)가 되도록 컷오프를 고른다. 정확한 균등 분할은 이산 후보에서는 불가능하므로 max_ℓ ℐ_ℓ를 최소화하는 min–max 문제를 풀어 가장 타이트한 균일 상한을 찾는다. 목적 함수가 순서 있는 분할에 대해 최적 부분 구조를 가지므로 동적 계획법으로 정확해를 구할 수 있고, 복잡도는 O(LK²)로 Pluto 기가픽셀 이미지 기준 전처리에 0.7초만 추가된다.
어떻게 쓰나
해상도 배분과 별개로 남는 충돌 손실은 픽셀 셔플로 줄인다. 셔플 계수 s에 대해 이미지 Y를 h/s × w/s × cs² 형태의 저해상도·고채널 표현으로 재배열하고, INR은 좌표당 cs² 차원 벡터를 예측한 뒤 역변환으로 원해상도를 복원한다. 변환이 가역이라 정보 손실은 없고 좌표 도메인의 공간 해상도만 1/s로 줄어들어, 레벨 ℓ의 부하율이 α_ℓ/s²로 낮아진다. 부하율이 낮아지면 충돌 효율 w_hash가 커지므로 해시 테이블 T를 키우지 않고도 사용 가능한 용량과 복원 화질이 올라간다.
전제와 한계
실험은 Kodak 24장(768×512), 기가픽셀 자연 이미지 3장(Pluto, Tokyo, Girl), 그리고 40배율 H&E 염색 전슬라이드 이미지 4장에서 수행했다. 모든 실험에서 레벨별 특징 차원은 2로 고정하고, 파라미터 예산은 해시 테이블 크기를 바꿔 맞췄으며, 저역통과 필터로는 안티앨리어싱 리사이징을 사용했다. 후보 해상도 수 K는 Kodak에서 30, 기가픽셀과 WSI에서 200이다. Kodak에서는 약 207K 파라미터 조건에서 PSNR과 SSIM 모두 최고를 기록했고, 471K 파라미터로 Gaussian Splatting(3540K)의 13%만 쓰고도 더 높은 PSNR을 냈으며 강한 하이브리드 베이스라인인 MetricGrid보다 2.23dB 높았다. 기가픽셀에서는 MetricGrid가 보고한 최고 화질 37.26dB를 114.61M 파라미터, 즉 MetricGrid 설정(412.8M)의 27.76%로 재현했고, 비슷한 대형 예산에서는 최강 베이스라인 대비 PSNR을 6.11dB 끌어올렸다. 저파라미터 영역에서도 6.31M 파라미터로 MetricGrid의 8.02M보다 21.3% 적은 파라미터를 쓰면서 더 나은 화질을 보였다. WSI에서는 기존 공개 데이터셋이 대부분 JPEG 압축되어 있다는 점을 지적하고, 저자들이 학술 연구용으로는 처음이라고 밝힌 비압축 전슬라이드 이미지 데이터셋을 직접 구축해 4개 INR 베이스라인을 모두 앞섰다.
어블레이션은 설계 선택의 근거를 뒷받침한다. 충돌 계수를 w_hash ≡ 1로 두고 엔트로피 기반 정보 추정기는 그대로 유지하면 PSNR과 SSIM이 일관되게 떨어지고 파라미터 효율도 나빠진다. 정보 프록시를 엔트로피 대신 ℓ2 에너지나 분산으로 바꾼 Kodak 실험에서도 두 지표가 모두 하락했는데, 에너지는 평균 전력만 나타내고 분산은 정보량의 좋은 대리 지표가 아니기 때문이라고 설명한다.
실무 관점에서 이 논문은 해시 그리드 기반 INR을 고해상도 이미지나 병리 전슬라이드에 적용하면서 파라미터·메모리 예산이 빡빡할 때 유용하다. 해상도 스케줄과 해시 테이블 크기를 감으로 정하는 대신, 입력 이미지의 주파수 대역별 엔트로피를 재고 충돌 확률을 곱해 레벨별 해상도를 유도하는 절차를 그대로 가져올 수 있다. 도입 전에 확인할 것은 전처리 비용이 후보 수 K에 대해 O(LK²)라는 점, 특징 차원을 2로 고정한 구성이라는 점, 저역통과 필터로 안티앨리어싱 리사이징을 썼다는 점, 그리고 픽셀 셔플 계수 s의 어블레이션이 본문이 아니라 부록에 있다는 점이다. 파라미터 예산은 해시 테이블 크기를 조절해 맞추는 방식을 취한다.
본문 결론은 한계와 향후 연구를 지면 관계로 부록에 미룬다고만 밝히고 있어, 본문에서 저자들이 명시한 한계 서술은 확인되지 않는다. 다만 방법에 내재한 전제는 드러난다. 충돌 효율 공식은 균일 해싱을 가정하고, 해상도 선택은 이산 후보 집합 위에서 이루어지며, 정보량은 8비트(잔차는 부호 있는 9비트) 양자화 후 히스토그램으로 추정한 실험적 엔트로피에 의존한다. 또한 저역통과 필터 선택의 영향과 셔플 계수 s의 민감도는 부록으로 넘겨 본문 수치로 제시되지 않았다.