[논문리뷰] π³: Permutation-Equivariant Visual Geometry Learning (ICLR 2026)
“첫 번째 프레임”이라는 특별 대우를 없애면 더 강해진다. DUSt3R부터 VGGT까지, feed-forward 3D reconstruction은 첫 view의 카메라 좌표계를 전역 기준으로 삼아 왔다. π³는 이 기준 view 의존이 불필요한 inductive bias임을 보이고, 완전한 permutation-equivariant 구조로 기준 없이 affine-invariant camera pose와 scale-invariant local point map을 예측한다. 입력 순서에 본질적으로 robust하면서 pose·depth·point map 추정 전반에서 VGGT를 앞선다.
논문 정보
| 항목 | 내용 |
|---|---|
| 제목 | π³: Permutation-Equivariant Visual Geometry Learning |
| 저자 | Yifan Wang, Jianjun Zhou, Haoyi Zhu, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Jiangmiao Pang, Chunhua Shen, Tong He |
| 소속 / 연도 | Shanghai Jiao Tong University, Shanghai AI Laboratory, Zhejiang University 등, ICLR 2026 (arXiv:2507.13347) |
| 분야 | CV / visual geometry, 3D reconstruction |
| 코드 | GitHub |
1. Introduction
visual geometry reconstruction은 AR·robotics·자율 주행에 큰 잠재력을 가진 컴퓨터 비전의 오래된 근본 문제다. 전통적으로 Bundle Adjustment(BA) 같은 반복 최적화로 다뤄졌지만, 최근 feed-forward 신경망으로 눈부신 진전이 있었다. DUSt3R와 그 후속 end-to-end 모델들은 이미지 쌍·비디오·multi-view 모음에서 geometry를 재구성하는 딥러닝의 힘을 보여줬다.
이런 발전에도 고전·현대 접근 모두에 중대한 한계가 남아 있다. 단일 고정 기준(reference) view의 선택에 의존한다는 것이다. 선택된 view의 카메라 좌표계를 전역 기준 좌표계로 삼는 관행은 전통적 SfM·MVS에서 물려받은 것인데, 이 논문은 이 설계가 feed-forward 신경망의 성능과 robustness를 근본적으로 제약하는 불필요한 inductive bias라고 주장한다. 실험으로 보이듯, 임의 기준에 대한 의존은 state-of-the-art인 VGGT를 포함한 기존 방법들을 초기 view 선택에 매우 민감하게 만든다. 나쁜 선택은 재구성 품질을 급격히 떨어뜨려 robust한 시스템 개발을 방해한다(Figure 2).
[Figure 2] 기준 프레임 선택에 따른 성능 비교. DINO 기반 선택을 써도 기존 방법들은 결과가 들쭉날쭉한 반면 π³는 일관되게 우수하고 안정적인 성능을 유지
이 한계를 극복하기 위해 visual geometry 학습에서 기준 view 기반 bias를 제거한, robust하고 정확하며 완전히 permutation-equivariant한 방법 π³를 제안한다. π³는 기준 view를 지정하지 않고 단일 이미지·비디오 시퀀스·정적/동적 장면의 unordered 이미지 집합 등 다양한 입력을 받는다. 대신 affine-invariant camera pose와, 각 프레임 자신의 카메라 좌표계에서 정의되는 scale-invariant local point map을 예측한다. 프레임 index positional embedding 같은 순서 의존 구성 요소를 배제하고 view별 attention과 global self-attention을 교대하는 transformer를 써서 진정한 permutation equivariance를 달성한다. 이것이 시각 입력과 재구성된 geometry 사이의 일관된 1대1 대응을 보장해, 입력 순서에 본질적으로 robust하고 기준 view 선택 문제에서 자유롭다.
이 설계의 이점은 크다. 무엇보다 훨씬 robust하다. 기존 방법과 달리 기준 프레임이 바뀌어도 성능 저하가 최소이고 표준편차가 낮다(Figure 2, Table 6). 나아가 기준 view에 의존하는 이전 방법들보다 재구성 정확도도 높인다. 광범위한 실험으로 π³는 수많은 벤치마크·과제에서 새로운 state-of-the-art를 세운다. monocular depth 추정에서 MoGe와 대등하고, 비디오 depth 추정과 camera pose 추정에서 VGGT를 앞선다. Sintel 벤치마크에서 camera pose 추정 ATE를 VGGT의 0.167에서 0.074로 줄이고, scale 정렬 비디오 depth의 절대 상대 오차를 0.299에서 0.233으로 개선한다. 또 가볍고 빨라서 DUSt3R의 1.25 FPS, VGGT의 43.2 FPS 대비 57.4 FPS의 inference 속도를 달성한다. 정적·동적 장면을 모두 재구성할 수 있어 실세계 응용에 robust하고 최적인 해법이다.
기여를 요약하면 다음과 같다.
- visual geometry reconstruction의 고정 기준 view 의존을 체계적으로 규명하고 도전한 첫 연구. 이 흔한 설계 선택이 모델 robustness와 성능을 제한하는 해로운 inductive bias임을 입증
- 이 bias를 제거하는 완전한 permutation-equivariant 구조 π³ 제안. affine-invariant camera pose와 scale-invariant point map을 순수하게 상대적·view별로 예측해 전역 좌표계의 필요를 완전히 제거
- camera pose 추정, monocular/비디오 depth 추정, point map reconstruction의 광범위한 벤치마크에서 기존 선도 방법들을 능가하는 새로운 state-of-the-art 입증
[Figure 1] 실내·실외·항공 view부터 만화까지, 동적·정적 콘텐츠를 아우르는 open-domain 이미지들의 feed-forward 재구성
2. Related Work
2.1 Traditional 3D Reconstruction
이미지에서 3D 장면을 재구성하는 것은 컴퓨터 비전의 기초 문제다. SfM(Structure-from-Motion)·MVS(Multi-View Stereo) 같은 고전적 방법이 상당한 성공을 거뒀다. 이 기법들은 multi-view geometry 원리로 이미지 간 feature 대응을 확립하고, 이로부터 camera pose를 추정하고 dense 3D point cloud를 생성한다. 특히 통제된 환경에서 robust하지만, 보통 복잡한 다단계 pipeline에 의존하고 3D 구조와 camera pose를 함께 정제하는 BA 같은 시간이 많이 드는 반복 최적화 문제를 포함한다.
2.2 Feed-Forward 3D Reconstruction
최근 feed-forward 모델이 이미지 집합에서 장면의 3D 구조를 단일 pass로 직접 regression하는 강력한 대안으로 떠올랐다. 선구적인 DUSt3R는 이미지 쌍을 처리해 첫 카메라 좌표계의 point cloud를 예측했다. 두 view에는 효과적이지만 더 큰 장면으로 확장하려면 이후의 global alignment 단계가 필요한데, 이는 시간이 많이 들고 불안정하기 쉽다. 후속 연구는 이 한계 극복에 집중했다. Fast3R는 수천 장의 이미지에 대한 동시 inference를 가능하게 해 비싸고 취약한 global alignment 단계를 없앤 중요한 진전이다. 학습 문제 자체를 단순화하는 접근도 탐구됐다. FLARE는 camera pose를 먼저 예측하고 장면 geometry를 추정하는 식으로 과제를 분해했고, VGGT는 multi-task 학습과 대규모 데이터셋으로 우수한 정확도와 성능을 달성했다. 이 방법들의 공통 특징은(고전 SfM에서 대체로 물려받은 패러다임인데) 예측된 3D 구조를 지정된 기준 프레임에 고정(anchoring)한다는 것이다. 이 논문은 이 패러다임에서 벗어나 근본적으로 다른 접근을 제시한다.
3. Method
[Figure 3] 특수 token 연결(Type A)이나 학습 가능한 embedding 추가(Type B)로 기준 view를 지정하는 기존 방법들과 달리, 그 요구 자체를 제거하고 상대 supervision을 써서 permutation equivariance를 달성하는 π³
3.1 Permutation-Equivariant Architecture
입력 view의 임의 순서에 모델 출력이 좌우되지 않도록 네트워크 \(\phi\) 를 permutation-equivariant하게 설계한다. 입력을 \(N\) 장의 이미지 시퀀스 \(S = (\mathbf{I}_1, \dots, \mathbf{I}_N)\), \(\mathbf{I}_i \in \mathbb{R}^{H \times W \times 3}\) 라 하자. 네트워크 \(\phi\) 는 이 시퀀스를 대응하는 출력 시퀀스들의 튜플로 mapping한다.
\[\phi(S) = \big( (\mathbf{T}_1, \dots, \mathbf{T}_N), (\mathbf{X}_1, \dots, \mathbf{X}_N), (\mathbf{C}_1, \dots, \mathbf{C}_N) \big)\]여기서 \(\mathbf{T}_i \in SE(3) \subset \mathbb{R}^{4 \times 4}\) 는 camera pose, \(\mathbf{X}_i \in \mathbb{R}^{H \times W \times 3}\) 는 자기 자신의 카메라 좌표계에서 표현된 픽셀 정렬 3D point map, \(\mathbf{C}_i \in \mathbb{R}^{H \times W}\) 는 \(\mathbf{X}_i\) 의 confidence map이다. 임의의 순열 \(\pi\) 에 대해 \(P_\pi\) 를 시퀀스의 순서를 바꾸는 연산자라 하면, 네트워크는 permutation-equivariant 성질
\[\phi(P_\pi(S)) = P_\pi(\phi(S))\]를 만족한다. 즉 입력 시퀀스를 \(P_\pi(S) = (\mathbf{I}_{\pi(1)}, \dots, \mathbf{I}_{\pi(N)})\) 로 섞으면 출력 튜플도 동일하게 섞인 \(\big( (\mathbf{T}_{\pi(1)}, \dots, \mathbf{T}_{\pi(N)}), (\mathbf{X}_{\pi(1)}, \dots, \mathbf{X}_{\pi(N)}), (\mathbf{C}_{\pi(1)}, \dots, \mathbf{C}_{\pi(N)}) \big)\) 이 나온다. 이 성질은 각 이미지와 그 출력(geometry나 pose) 사이의 일관된 1대1 대응을 보장한다. 이 설계의 핵심 장점은 첫째, 기준 view가 바뀌면 성능이 떨어지는 기존 방법과 달리 재구성 품질이 기준 view 선택과 무관해진다는 것이고, 둘째, 불확실하거나 노이즈 있는 관측에 더 robust해진다는 것이다.
실제로 이 equivariance를 실현하기 위해, 구현(Figure 3)에서 순서 의존 구성 요소를 모두 뺀다. 프레임을 구별하는 positional embedding과, VGGT의 camera token처럼 기준 view를 지정하는 특수 학습 token이 그것이다. pipeline은 DINOv2 backbone으로 각 view를 patch token 시퀀스로 embedding하는 데서 시작하고, 이 token들은 view별 self-attention과 global self-attention을 교대하는 layer들을 거친 뒤 최종 decoder가 출력을 생성한다.
3.2 Scale-Invariant Local Geometry
각 입력 이미지 \(\mathbf{I}_i\) 에 대해 네트워크는 geometry를 픽셀 정렬 3D point map \(\hat{\mathbf{X}}_i\) 로 예측한다. 각 point cloud는 처음에 자신의 local 카메라 좌표계에서 정의된다. monocular reconstruction의 잘 알려진 난제는 본질적인 scale 모호성이다. 이를 다루기 위해 네트워크는 한 장면의 \(N\) 개 이미지 전체에 걸쳐 미지이지만 일관된 scale factor까지만(up to scale) point cloud를 예측한다.
따라서 학습에서는 예측 point map \((\hat{\mathbf{X}}_1, \dots, \hat{\mathbf{X}}_N)\) 을 ground-truth 집합 \((\mathbf{X}_1, \dots, \mathbf{X}_N)\) 에 정렬해야 한다. 이 정렬은 이미지 시퀀스 전체에서 depth 가중 L1 거리를 최소화하는 단일 최적 scale factor \(s^*\) 를 풀어 이뤄진다.
\[s^* = \underset{s}{\arg\min} \sum_{i=1}^{N} \sum_{j=1}^{H \times W} \frac{1}{z_{i,j}} \| s \hat{\mathbf{x}}_{i,j} - \mathbf{x}_{i,j} \|_1\]여기서 \(\hat{\mathbf{x}}_{i,j} \in \mathbb{R}^3\) 는 point map \(\hat{\mathbf{X}}_i\) 의 index \(j\) 에 있는 예측 3D 점, \(\mathbf{x}_{i,j}\) 는 \(\mathbf{X}_i\) 의 ground-truth 대응 점, \(z_{i,j}\) 는 \(\mathbf{x}_{i,j}\) 의 z 성분인 ground-truth depth다(\(1/z_{i,j}\) 가중치는 먼 점의 오차를 낮춰 준다). 이 문제는 MoGe가 제안한 ROE solver로 푼다. point cloud 재구성 loss \(\mathcal{L}_{\text{points}}\) 는 최적 scale factor \(s^*\) 로 정의한다.
\[\mathcal{L}_{\text{points}} = \frac{1}{3NHW} \sum_{i=1}^{N} \sum_{j=1}^{H \times W} \frac{1}{z_{i,j}} \| s^* \hat{\mathbf{x}}_{i,j} - \mathbf{x}_{i,j} \|_1\]국소적으로 매끄러운 표면의 재구성을 장려하기 위해 MoGe를 따라 normal loss \(\mathcal{L}_{\text{normal}}\) 도 도입한다. 예측 point map \(\hat{\mathbf{X}}_i\) 의 각 점에 대해 normal 벡터 \(\hat{\mathbf{n}}_{i,j}\) 를 이미지 grid의 인접 이웃으로 향하는 벡터들의 외적(cross product)으로 계산하고, ground-truth normal \(\mathbf{n}_{i,j}\) 와의 각도를 최소화한다.
\[\mathcal{L}_{\text{normal}} = \frac{1}{NHW} \sum_{i=1}^{N} \sum_{j=1}^{H \times W} \arccos\left( \hat{\mathbf{n}}_{i,j} \cdot \mathbf{n}_{i,j} \right)\]예측 confidence map \(\mathbf{C}_i\) 는 BCE(Binary Cross-Entropy) loss \(\mathcal{L}_{\text{conf}}\) 로 supervise한다. 각 점의 ground-truth target은 L1 재구성 오차 \(\frac{1}{z_{i,j}} \| s^* \hat{\mathbf{x}}_{i,j} - \mathbf{x}_{i,j} \|_1\) 가 threshold \(\epsilon\) 아래면 1, 아니면 0이다.
3.3 Affine-Invariant Camera Pose
모델의 permutation equivariance와 multi-view reconstruction의 본질적 scale 모호성이 결합되면, 출력 camera pose \((\hat{\mathbf{T}}_1, \dots, \hat{\mathbf{T}}_N)\) 는 임의의 similarity 변환(강체 변환 + 미지의 전역 scale factor 하나로 이뤄진 affine 변환)까지만 정의된다. 전역 기준 좌표계의 모호성을 해소하기 위해 view 사이의 상대 pose를 supervise한다. view \(j\) 에서 \(i\) 로의 예측 상대 pose는
\[\hat{\mathbf{T}}_{i \leftarrow j} = \hat{\mathbf{T}}_i^{-1} \hat{\mathbf{T}}_j\]로 계산한다. 각 상대 pose \(\hat{\mathbf{T}}_{i \leftarrow j}\) 는 rotation \(\hat{\mathbf{R}}_{i \leftarrow j} \in SO(3)\) 와 translation \(\hat{\mathbf{t}}_{i \leftarrow j} \in \mathbb{R}^3\) 로 구성된다. 상대 rotation은 전역 변환에 불변이지만 상대 translation의 크기는 모호하다. 이는 point map을 ground truth에 정렬하며 계산한 최적 scale factor \(s^*\) 로 해소한다. 이 하나의 일관된 scale factor로 모든 예측 camera translation을 보정해, rotation과 올바르게 scale된 translation 성분을 모두 직접 supervise할 수 있다.
camera loss \(\mathcal{L}_{\text{cam}}\) 은 \(i \neq j\) 인 모든 순서쌍에 대해 평균낸 rotation loss와 translation loss의 가중 합이다.
\[\mathcal{L}_{\text{cam}} = \frac{1}{N(N-1)} \sum_{i \neq j} \left( \mathcal{L}_{\text{rot}}(i,j) + \lambda_{\text{trans}} \mathcal{L}_{\text{trans}}(i,j) \right)\]여기서 \(\lambda_{\text{trans}}\) 는 두 항의 균형을 잡는 hyperparameter다. rotation에는 angle loss, translation에는 Huber loss를 쓴다. rotation loss는 예측 상대 rotation \(\hat{\mathbf{R}}_{i \leftarrow j}\) 와 ground-truth \(\mathbf{R}_{i \leftarrow j}\) 사이의 geodesic 거리(각도)를 최소화한다.
\[\mathcal{L}_{\text{rot}}(i,j) = \arccos\left( \frac{\operatorname{Tr}\left( (\mathbf{R}_{i \leftarrow j})^\top \hat{\mathbf{R}}_{i \leftarrow j} \right) - 1}{2} \right)\]\(\operatorname{Tr}\) 은 행렬의 trace로, 이 식은 두 rotation 사이 각도의 표준 공식이다. translation loss는 scale 보정된 예측을 ground-truth 상대 translation \(\mathbf{t}_{i \leftarrow j}\) 와 비교하며, outlier에 robust한 Huber loss \(\mathcal{H}_\delta\) 를 쓴다.
\[\mathcal{L}_{\text{trans}}(i,j) = \mathcal{H}_\delta( s^* \hat{\mathbf{t}}_{i \leftarrow j} - \mathbf{t}_{i \leftarrow j} )\]나아가 이 기준 없는(reference-free) 정식화는 카메라 궤적의 내재적 구조를 포착하는 데 특히 적합하다. affine-invariant camera 모델은 실세계 카메라 경로가 무작위가 아니라 고도로 구조화돼 있다는 핵심 통찰 위에 서 있다. 물체 주위를 도는 카메라는 구면 위를 움직이고, 차량 탑재 카메라는 곡선을 따르는 식으로 보통 저차원 manifold 위에 놓인다. 예측 pose 분포의 정량 분석(eigenvalue 분석)에서 π³의 pose 분산이 VGGT보다 훨씬 적은 수의 주성분에 집중돼, 출력의 저차원 구조가 확인된다.
3.4 Model Training
모델은 point 재구성 loss, confidence loss, camera pose loss의 가중 합인 복합 loss를 최소화하며 end-to-end로 학습한다.
\[\mathcal{L} = \mathcal{L}_{\text{points}} + \lambda_{\text{normal}} \mathcal{L}_{\text{normal}} + \lambda_{\text{conf}} \mathcal{L}_{\text{conf}} + \lambda_{\text{cam}} \mathcal{L}_{\text{cam}}\]robustness와 넓은 적용성을 위해 다양한 데이터셋 15개의 대규모 통합으로 학습한다. GTA-SfM, CO3D, WildRGB-D, Habitat, ARKitScenes, TartanAir, ScanNet, ScanNet++, BlendedMVG, MatrixCity, MegaDepth, Hypersim, Taskonomy, Mid-Air, 그리고 내부 동적 장면 데이터셋으로, synthetic rendering부터 실사 캡처까지 실내·실외 환경을 폭넓게 아우른다.
4. Experiments
camera pose 추정(4.1), point map 추정(4.2), 비디오·monocular depth 추정(4.3)의 네 과제에서 정량 결과를 보고한다. 모든 과제에서 기존 feed-forward 3D reconstruction 방법 대비 state-of-the-art이거나 대등한 성능을 달성한다. 설계의 효과를 검증하기 위해 입력 이미지 시퀀스 순열에 대한 robustness 평가(4.4)와 scale-invariant point map·affine-invariant camera pose에 대한 ablation(4.5)도 수행한다.
4.1 Camera Pose Estimation
예측 camera pose를 두 종류의 지표로 평가한다. RealEstate10K·Co3Dv2에서는 각도 정확도(RRA·RTA·AUC, threshold 30°), Sintel·TUM-dynamics·ScanNet에서는 거리 오차(ATE, RPE-t, RPE-r)다.
| Method | Re10K RRA ↑ | RTA ↑ | AUC ↑ | Co3Dv2 RRA ↑ | RTA ↑ | AUC ↑ | Sintel ATE ↓ | RPE-t ↓ | RPE-r ↓ | TUM ATE ↓ | RPE-t ↓ | RPE-r ↓ | ScanNet ATE ↓ | RPE-t ↓ | RPE-r ↓ |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Fast3R | 99.05 | 81.86 | 61.68 | 97.49 | 91.11 | 73.43 | 0.371 | 0.298 | 13.75 | 0.090 | 0.101 | 1.425 | 0.155 | 0.123 | 3.491 |
| CUT3R | 99.82 | 95.10 | 81.47 | 96.19 | 92.69 | 75.82 | 0.217 | 0.070 | 0.636 | 0.047 | 0.015 | 0.451 | 0.094 | 0.022 | 0.629 |
| FLARE | 99.69 | 95.23 | 80.01 | 96.38 | 93.76 | 73.99 | 0.207 | 0.090 | 3.015 | 0.026 | 0.013 | 0.475 | 0.064 | 0.023 | 0.971 |
| VGGT | 99.97 | 93.13 | 77.62 | 98.96 | 97.13 | 88.59 | 0.167 | 0.062 | 0.491 | 0.012 | 0.010 | 0.311 | 0.035 | 0.015 | 0.382 |
| π³ (Ours) | 99.99 | 95.62 | 85.90 | 99.05 | 97.33 | 88.41 | 0.074 | 0.040 | 0.282 | 0.014 | 0.009 | 0.312 | 0.031 | 0.013 | 0.347 |
[Table 1] camera pose 추정(굵게 최고, 밑줄 차선). RRA·RTA·AUC는 threshold 30°, Co3Dv2·ScanNet은 학습 도메인(seen)
Table 1에서 보듯 zero-shot 일반화인 Sintel과 RealEstate10K에서 새로운 state-of-the-art를 세우고, TUM-dynamics와 in-domain인 Co3Dv2·ScanNet에서는 VGGT와 나란히 경쟁력 있는 state-of-the-art를 달성한다. 익숙한 데이터 분포에서 우수한 성능을 유지하면서 강한 일반화 능력을 보여준다.
4.2 Point Map Estimation
CUT3R를 따라 장면 수준 7-Scenes·NRGBD에서 sparse·dense view 조건(sampling stride 차이)으로 multi-view point map 품질을 평가하고, object 중심 DTU와 장면 수준 ETH3D로 평가를 확장한다. 예측 point map은 Umeyama 알고리즘으로 대략적인 Sim(3) 정렬을 한 뒤 ICP(Iterative Closest Point)로 정제해 ground truth에 정렬하고, Accuracy(Acc.)·Completion(Comp.)·Normal Consistency(N.C.)를 보고한다.
| Method | View | 7-Scenes Acc. ↓ (Mean/Med.) | Comp. ↓ (Mean/Med.) | N.C. ↑ (Mean/Med.) | NRGBD Acc. ↓ (Mean/Med.) | Comp. ↓ (Mean/Med.) | N.C. ↑ (Mean/Med.) |
|---|---|---|---|---|---|---|---|
| Fast3R | sparse | 0.095 / 0.065 | 0.144 / 0.089 | 0.673 / 0.759 | 0.135 / 0.091 | 0.163 / 0.104 | 0.759 / 0.877 |
| CUT3R | sparse | 0.093 / 0.049 | 0.102 / 0.051 | 0.704 / 0.805 | 0.104 / 0.041 | 0.079 / 0.031 | 0.822 / 0.968 |
| FLARE | sparse | 0.085 / 0.057 | 0.145 / 0.107 | 0.696 / 0.780 | 0.053 / 0.024 | 0.051 / 0.025 | 0.877 / 0.988 |
| VGGT | sparse | 0.044 / 0.025 | 0.056 / 0.033 | 0.733 / 0.845 | 0.051 / 0.029 | 0.066 / 0.038 | 0.890 / 0.981 |
| π³ (Ours) | sparse | 0.047 / 0.029 | 0.075 / 0.049 | 0.742 / 0.841 | 0.026 / 0.015 | 0.028 / 0.014 | 0.916 / 0.992 |
| Fast3R | dense | 0.040 / 0.017 | 0.056 / 0.018 | 0.644 / 0.725 | 0.072 / 0.030 | 0.050 / 0.016 | 0.790 / 0.934 |
| CUT3R | dense | 0.023 / 0.010 | 0.027 / 0.008 | 0.669 / 0.764 | 0.086 / 0.037 | 0.048 / 0.017 | 0.800 / 0.953 |
| FLARE | dense | 0.019 / 0.007 | 0.026 / 0.013 | 0.684 / 0.785 | 0.023 / 0.011 | 0.018 / 0.008 | 0.882 / 0.986 |
| VGGT | dense | 0.022 / 0.008 | 0.026 / 0.012 | 0.666 / 0.760 | 0.017 / 0.010 | 0.015 / 0.005 | 0.893 / 0.988 |
| π³ (Ours) | dense | 0.016 / 0.007 | 0.022 / 0.011 | 0.689 / 0.792 | 0.015 / 0.008 | 0.013 / 0.005 | 0.898 / 0.987 |
[Table 2] 7-Scenes·NRGBD의 point map 추정(굵게 최고, 밑줄 차선). 각 셀은 Mean / Median
| Method | DTU Acc. ↓ (Mean/Med.) | Comp. ↓ (Mean/Med.) | N.C. ↑ (Mean/Med.) | ETH3D Acc. ↓ (Mean/Med.) | Comp. ↓ (Mean/Med.) | N.C. ↑ (Mean/Med.) |
|---|---|---|---|---|---|---|
| Fast3R | 3.340 / 1.919 | 2.929 / 1.125 | 0.671 / 0.755 | 0.832 / 0.691 | 0.978 / 0.683 | 0.667 / 0.766 |
| CUT3R | 4.742 / 2.600 | 3.400 / 1.316 | 0.679 / 0.764 | 0.617 / 0.525 | 0.747 / 0.579 | 0.754 / 0.848 |
| FLARE | 2.541 / 1.468 | 3.174 / 1.420 | 0.684 / 0.774 | 0.464 / 0.338 | 0.664 / 0.395 | 0.744 / 0.864 |
| VGGT | 1.338 / 0.779 | 1.896 / 0.992 | 0.676 / 0.766 | 0.280 / 0.185 | 0.305 / 0.182 | 0.853 / 0.950 |
| π³ (Ours) | 1.198 / 0.646 | 1.849 / 0.607 | 0.678 / 0.768 | 0.194 / 0.131 | 0.210 / 0.128 | 0.883 / 0.969 |
[Table 3] DTU·ETH3D의 point map 추정(굵게 최고, 밑줄 차선). 각 셀은 Mean / Median
이 결과는 synthetic·실사, sparse·dense view 설정(Table 2), object 수준·장면 수준 scale(Table 3)에 걸쳐 넓은 스펙트럼의 3D reconstruction 과제에서 robust한 강한 일반화 능력을 보여준다.
[Figure 5] multi-view 3D reconstruction 정성 비교. 다른 multi-frame feed-forward 방법 대비 더 깨끗하고 정확하며 완전한 재구성
4.3 Depth Estimation
CUT3R의 방법론을 따라 Sintel·Bonn·KITTI에서 절대 상대 오차(Abs Rel)와 threshold \(\delta < 1.25\) 정확도를 보고한다. monocular depth 추정에는 NYU-v2를 추가로 쓴다.
Video depth estimation. 이 설정에서는 비디오 depth 시퀀스를 시퀀스당 하나의 scale로 ground truth에 정렬한다. Table 4에서 보듯 feed-forward 3D reconstruction 방법 중 세 데이터셋 모두에서 새로운 state-of-the-art를 달성한다. 특히 모델이 더 작은데도 KITTI에서 57.4 FPS로 VGGT(43.2 FPS)·Aether(6.14 FPS)보다 훨씬 빠른 뛰어난 효율도 보여준다.
| Method | Params | Sintel Abs Rel ↓ | \(\delta<1.25\) ↑ | Bonn Abs Rel ↓ | \(\delta<1.25\) ↑ | KITTI Abs Rel ↓ | \(\delta<1.25\) ↑ | FPS |
|---|---|---|---|---|---|---|---|---|
| DUSt3R | 571M | 0.662 | 0.434 | 0.151 | 0.839 | 0.143 | 0.814 | 1.25 |
| MASt3R | 689M | 0.558 | 0.487 | 0.188 | 0.765 | 0.115 | 0.848 | 1.01 |
| MonST3R | 571M | 0.399 | 0.519 | 0.072 | 0.957 | 0.107 | 0.884 | 1.27 |
| Fast3R | 648M | 0.638 | 0.422 | 0.194 | 0.772 | 0.138 | 0.834 | 65.8 |
| MVDUSt3R | 661M | 0.805 | 0.283 | 0.426 | 0.357 | 0.456 | 0.342 | 0.69 |
| CUT3R | 793M | 0.417 | 0.507 | 0.078 | 0.937 | 0.122 | 0.876 | 6.98 |
| Aether | 5.57B | 0.324 | 0.502 | 0.273 | 0.594 | 0.056 | 0.978 | 6.14 |
| FLARE | 1.40B | 0.729 | 0.336 | 0.152 | 0.790 | 0.356 | 0.570 | 1.75 |
| VGGT | 1.26B | 0.299 | 0.638 | 0.057 | 0.966 | 0.062 | 0.969 | 43.2 |
| π³ (Ours) | 959M | 0.233 | 0.664 | 0.049 | 0.975 | 0.038 | 0.986 | 57.4 |
[Table 4] Sintel·Bonn·KITTI의 비디오 depth 추정(굵게 최고, 밑줄 차선). FPS는 A800 GPU 1개의 KITTI 기준
Monocular depth estimation. 이 설정에서는 각 depth map을 독립적으로 scale factor 하나로 ground truth에 정렬한다. Table 5에서 보듯 단일 프레임 depth 추정에 명시적으로 최적화되지 않았는데도 multi-frame feed-forward reconstruction 접근 중 state-of-the-art이고, 최상위 monocular depth 추정 모델인 MoGe와도 경쟁할 만하다.
| Method | Sintel Abs Rel ↓ | \(\delta<1.25\) ↑ | Bonn Abs Rel ↓ | \(\delta<1.25\) ↑ | KITTI Abs Rel ↓ | \(\delta<1.25\) ↑ | NYU-v2 Abs Rel ↓ | \(\delta<1.25\) ↑ |
|---|---|---|---|---|---|---|---|---|
| DUSt3R | 0.488 | 0.532 | 0.139 | 0.832 | 0.109 | 0.873 | 0.081 | 0.909 |
| MASt3R | 0.413 | 0.569 | 0.123 | 0.833 | 0.077 | 0.948 | 0.110 | 0.865 |
| MonST3R | 0.402 | 0.525 | 0.069 | 0.954 | 0.098 | 0.895 | 0.094 | 0.887 |
| Fast3R | 0.544 | 0.509 | 0.169 | 0.796 | 0.120 | 0.861 | 0.093 | 0.898 |
| CUT3R | 0.418 | 0.520 | 0.058 | 0.967 | 0.097 | 0.914 | 0.081 | 0.914 |
| FLARE | 0.606 | 0.402 | 0.130 | 0.836 | 0.312 | 0.513 | 0.089 | 0.898 |
| VGGT | 0.335 | 0.599 | 0.053 | 0.970 | 0.082 | 0.947 | 0.056 | 0.951 |
| MoGe v1 | 0.273 | 0.695 | 0.050 | 0.976 | 0.054 | 0.977 | 0.055 | 0.952 |
| MoGe v2 | 0.277 | 0.687 | 0.063 | 0.973 | 0.049 | 0.979 | 0.060 | 0.940 |
| π³ (Ours) | 0.277 | 0.614 | 0.044 | 0.976 | 0.060 | 0.971 | 0.054 | 0.956 |
[Table 5] monocular depth 추정(굵게 최고, 밑줄 차선)
4.4 Robustness Evaluation
제안 구조의 핵심 성질인 permutation equivariance가 입력 이미지 순서 변화에 robust한 출력을 보장하는지 DTU·ETH3D에서 실험으로 검증한다. 길이 \(N\) 의 각 시퀀스에 대해 \(N\) 개 프레임 각각을 차례로 첫 프레임으로 만드는 \(N\) 가지 입력 순서를 만들고, 이 \(N\) 번의 실행에 걸친 지표들의 표준편차를 계산한다. 표준편차가 낮을수록 입력 순서 변화에 robust하다.
| Method | DTU Acc. std. ↓ (Mean/Med.) | Comp. std. ↓ (Mean/Med.) | N.C. std. ↓ (Mean/Med.) | ETH3D Acc. std. ↓ (Mean/Med.) | Comp. std. ↓ (Mean/Med.) | N.C. std. ↓ (Mean/Med.) |
|---|---|---|---|---|---|---|
| Fast3R | 0.578 / 0.451 | 0.677 / 0.376 | 0.007 / 0.009 | 0.182 / 0.205 | 0.381 / 0.273 | 0.047 / 0.072 |
| FLARE | 0.720 / 0.494 | 1.346 / 1.134 | 0.009 / 0.012 | 0.171 / 0.187 | 0.251 / 0.188 | 0.048 / 0.053 |
| VGGT | 0.033 / 0.022 | 0.054 / 0.036 | 0.007 / 0.007 | 0.049 / 0.040 | 0.062 / 0.042 | 0.022 / 0.015 |
| π³ (Ours) | 0.003 / 0.002 | 0.006 / 0.003 | 0.001 / 0.001 | 0.000 / 0.000 | 0.000 / 0.000 | 0.001 / 0.000 |
[Table 6] point cloud 추정의 표준편차(굵게 최고, 밑줄 차선). 각 셀은 Mean / Median
Table 6에서 보듯 DTU·ETH3D의 모든 지표에서 0에 가까운 표준편차를 달성해 기존 접근을 몇 자릿수 차이로 앞선다. 예를 들어 DTU에서 평균 accuracy 표준편차가 π³는 0.003인 반면 VGGT는 0.033이고, ETH3D에서는 사실상 0의 분산을 달성한다. 이 뚜렷한 대비는 입력 순서에 상당히 민감한 기준 프레임 의존 방법들의 한계를 드러내고, 제안 구조가 진정으로 permutation-equivariant해서 일관되고 순서 무관한 3D reconstruction을 보장함을 입증한다.
4.5 Ablation Study
제안 구성 요소들의 효과를 검증하기 위해 완전한 모델에서 기능을 체계적으로 제거하는 ablation을 수행한다. 두 가지 축소 변형을 정의한다. Model 2는 affine-invariant camera pose 모델링이 없고, Model 1은 affine-invariant pose와 scale-invariant point map이 모두 없다.
| Model | ETH3D Acc. ↓ (Mean/Med.) | Comp. ↓ (Mean/Med.) | N.C. ↑ (Mean/Med.) | 7-Scenes Acc. ↓ (Mean/Med.) | Comp. ↓ (Mean/Med.) | N.C. ↑ (Mean/Med.) | NRGBD Acc. ↓ (Mean/Med.) | Comp. ↓ (Mean/Med.) | N.C. ↑ (Mean/Med.) |
|---|---|---|---|---|---|---|---|---|---|
| Model 1 | 0.229 / 0.150 | 0.166 / 0.103 | 0.802 / 0.930 | 0.020 / 0.010 | 0.019 / 0.009 | 0.715 / 0.834 | 0.034 / 0.018 | 0.025 / 0.011 | 0.859 / 0.977 |
| Model 2 | 0.197 / 0.118 | 0.118 / 0.065 | 0.820 / 0.943 | 0.020 / 0.009 | 0.020 / 0.008 | 0.716 / 0.837 | 0.031 / 0.018 | 0.023 / 0.010 | 0.861 / 0.978 |
| Full Model | 0.131 / 0.076 | 0.079 / 0.043 | 0.841 / 0.957 | 0.019 / 0.009 | 0.020 / 0.009 | 0.723 / 0.843 | 0.028 / 0.015 | 0.022 / 0.010 | 0.875 / 0.981 |
[Table 7] 핵심 구성 요소 ablation(굵게 최고, 밑줄 차선). baseline에 구성 요소를 더할수록 지표가 개선되는 과정
scale-invariant point map 모델링은 7-Scenes·NRGBD 같은 실내 데이터셋에서는 큰 이득이 없지만 실외 데이터에서 개선이 훨씬 뚜렷한데, 실외 장면이 scale 모호성의 영향을 더 크게 받는다는 scale-invariant depth 연구들과 일치하는 관찰이다. affine-invariant camera pose 모델링은 최종 성능을 일관되게 높인다. 더 중요하게는 Model 1·2와 달리 이것이 모델을 permutation-equivariant하게 만들어, 입력 프레임 순서와 기준 view 선택 모두에 robust해진다.
5. Conclusion
고정 기준 view 의존을 제거해 visual geometry reconstruction의 새 패러다임을 제시하는 feed-forward 신경망 π³를 소개했다. 완전한 permutation-equivariant 구조 덕분에 모델은 입력 순서에 본질적으로 robust하고 더 높은 정확도로 이어진다. 이 설계 선택은 이전 방법들에 있던 중대한 inductive bias를 제거해, 단순하지만 강력한 접근이 camera pose 추정, depth 추정, dense reconstruction을 포함한 넓은 과제에서 state-of-the-art를 달성하게 한다. π³는 기준 없는(reference-free) 시스템이 실행 가능할 뿐 아니라 더 안정적이고 다재다능한 3D vision 모델로 이어질 수 있음을 입증한다.