AnySplat模型解析:预训练权重如何实现跨场景的3D高斯参数预测
【免费下载链接】AnySplat[SIGGRAPH Asia 2025 (ACM TOG)] AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views项目地址: https://gitcode.com/gh_mirrors/an/AnySplat
AnySplat是SIGGRAPH Asia 2025(ACM TOG)收录的创新项目,它通过预训练权重实现了从非约束视角输入到3D高斯参数的端到端预测,彻底改变了传统3D重建需要逐场景优化的繁琐流程。本文将深入解析其预训练机制如何突破场景限制,实现跨场景的3D高斯参数精准预测。
核心突破:预训练权重如何赋能跨场景预测?
传统3D高斯渲染依赖于对每个场景的耗时优化,而AnySplat通过预训练模型将几何先验知识编码到权重中,实现了真正的前馈式推理。其核心优势在于:
- 无需逐场景优化:预训练权重已学习通用3D结构规律
- 非约束视角输入:支持任意拍摄角度的图片/视频输入
- 实时推理速度:相比传统方法提速100倍以上
图:AnySplat的预训练模型架构,展示了从多视角输入到3D高斯参数预测的完整流程
预训练权重的核心构成
AnySplat的预训练权重包含三大关键组件,共同实现跨场景的泛化能力:
1. 几何Transformer模块
位于src/model/encoder/anysplat.py的几何Transformer是预训练的核心,它通过:
- 多尺度特征融合网络
- 自注意力几何推理
- 跨视角特征对齐
将输入图像编码为结构化的3D特征表示,这部分权重占模型总量的65%,是跨场景泛化的基础。
2. 高斯参数预测头
在src/model/encoder/heads/linear_gs_head.py中实现,预训练权重通过:
- 位置编码权重(μ)
- 尺度参数(σ)
- 旋转矩阵(R)
- 不透明度(α)
四大参数的联合预测,将2D图像特征转化为3D高斯分布。
3. 相机姿态估计器
src/model/encoder/vggt/heads/camera_head.py中的预训练权重能够:
- 从单张图像估计相机内参
- 预测相对姿态关系
- 优化多视图一致性
这解决了非约束拍摄条件下的位姿估计难题。
预训练流程:如何让模型"看懂"3D世界?
AnySplat的预训练过程分为三个阶段,每个阶段都为跨场景能力奠定基础:
阶段一:大规模数据集预训练
在包含1000+场景的混合数据集上(包括CO3D、ScanNet++等),模型通过:
- RGB损失(L_RGB)
- 深度损失(L_depth)
- 相机姿态损失(L_pose)
联合优化,学习通用3D几何规律。配置文件位于config/experiment/multi-dataset.yaml。
阶段二:几何先验蒸馏
通过src/loss/loss_distill.py实现知识蒸馏,将传统3D重建方法的几何先验:
- 伪深度图($\tilde{D}$)
- 伪相机姿态($\tilde{p}$)
融入预训练权重,增强模型对复杂场景的适应能力。
阶段三:跨场景微调
使用src/model/encoder/backbone/backbone_croco_multiview.py中的多视图融合模块,在多样化场景上进行微调,确保权重在不同环境下的稳定性。
实战应用:预训练权重的使用方法
普通用户无需重新训练,可直接使用预训练权重进行3D重建:
1. 环境准备
git clone https://gitcode.com/gh_mirrors/an/AnySplat cd AnySplat pip install -r requirements.txt2. 快速推理
通过inference.py脚本加载预训练权重:
python inference.py --config config/experiment/multi-dataset.yaml \ --input examples/vrnerf/riverview/ \ --output results/riverview_3d3. 可视化界面
运行Gradio demo直观体验预训练模型效果:
python demo_gradio.py图:使用预训练权重的Gradio交互界面,支持图片/视频输入与3D结果实时可视化
预训练权重的优势与局限
核心优势
- 泛化能力:在室内、室外、物体等多种场景均表现稳定
- 效率提升:从几小时/场景缩短到秒级推理
- 部署便捷:预训练权重仅需500MB存储空间
当前局限
- 对极端光照条件适应性有限
- 超高分辨率细节重建仍需优化
- 动态场景处理能力待增强
未来展望:预训练权重的进化方向
AnySplat团队计划通过以下方式持续优化预训练权重:
- 多模态数据融合:加入LiDAR点云数据增强几何感知
- 动态场景建模:新增时序一致性损失函数
- 轻量化版本:针对边缘设备优化权重大小
通过不断迭代的预训练策略,AnySplat有望成为3D内容创作的基础设施工具。
提示:所有预训练相关配置文件位于
config/model/目录下,核心实现代码可参考src/model/encoder/anysplat.py。
【免费下载链接】AnySplat[SIGGRAPH Asia 2025 (ACM TOG)] AnySplat: Feed-forward 3D Gaussian Splatting from Unconstrained Views项目地址: https://gitcode.com/gh_mirrors/an/AnySplat
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考