
main分支 vs paper分支详解Pixal3D基于TRELLIS.2骨架的升级与论文复现指南【免费下载链接】Pixal3D[SIGGRAPH 2026] Pixal3D: Pixel-Aligned 3D Generation from Images项目地址: https://gitcode.com/gh_mirrors/pi/Pixal3DPixal3D 是 2026 年 SIGGRAPH 的图生3D生成方法从单张图片生成带PBR材质的高质量3D资产。与早期注意力松散注入不同它通过像素反投影建立像素到3D点的一一对应实现接近重建级别的保真度。仓库提供两个分支main基于 TRELLIS.2 骨架的增强版和paper论文原版基于 Direct3D-S2本文讲清两者差异、安装步骤与复现路线帮助新手一次选对分支。两个分支一句话对比仓库官方对分支的说明见 README.md对比项main分支paper分支底座框架基于TRELLIS.2骨架重写基于Direct3D-S2原始实现定位最新增强版性能更好论文原始版本对应 SIGGRAPH 2026 论文报告结果适用场景日常使用、在线Demo、生产推理严格复现论文指标与对比实验推理入口inference.py app.py见该分支自带说明选型口诀想复现论文结果 → 切paper想获得最新效果 → 用main。官方在 README 中特别提示If you want to reproduce the results in our paper, please switch to thepaperbranch.main 分支TRELLIS.2 骨架带来哪些升级1. 更先进的 O-Voxel 稀疏表示。main 分支的推理直接依赖 TRELLIS.2 的o_voxel工具链管线核心是 Pixal3DImageTo3DPipeline它串起稀疏结构 → 形状 → 纹理三级联式生成最终导出 4K 贴图的 GLB 网格见 inference.py。2. MoGe-2 自动相机估计。你只需给一张野外照片inference.py 会用 MoGe-2 深度模型自动估计相机 FOV 与距离无需手动标定发现畸变时可用--fov参数手动干预。3. 低显存模式。标准模式需约 18GB 显存默认 1536 级联加--low_vram后模型按需加载峰值降到 10-12GB 并自动切换 1024 级联见 inference.py。4. Web 演示界面。运行 app.py 即可启动 Gradio 交互界面同样支持低显存模式前端会自动切换分辨率。快速上手main 分支git clone https://gitcode.com/gh_mirrors/pi/Pixal3D cd Pixal3D pip install -r requirements.txt # 按 CUDA 架构安装 natten再安装 utils3d详见 README python inference.py --image assets/images/0_img.png --output ./output.glb python inference.py --image assets/images/0_img.png --output ./output.glb --low_vram注意requirements-hfdemo.txt 仅适用于 Hugging Face 空间的 H 系 GPU 架构本地部署请使用 requirements.txt。paper 分支论文复现指南paper分支保留了论文中所有实验对应的原始实现Direct3D-S2 底座 像素对齐投影条件当你需要验证论文表格中的定量指标FID、几何/纹理误差等与论文对比基线做公平对比排查为什么我的结果和论文不一样——多数情况是分支用错了复现流程克隆仓库后git checkout paper再按该分支 README 的推理与评测脚本执行。分支间代码结构不同不要混用两个分支的权重与配置。想从零训练三阶段级联流水线Pixal3D 的训练代码已完整开源训练入口是 train.py配置位于 configs/gen/ 目录整体为三级级联见 README.md阶段模型分辨率配置前缀1稀疏结构32 → 64ss_flow_img_dit_*2形状256 → 512 → 1024slat_flow_img2shape_*3纹理256 → 512 → 1024slat_flow_imgshape2tex_*所有阶段共享两个核心设计源码值得一读像素对齐投影条件DINOv3 提取图像特征后通过 3D→2D 投影与稀疏体素逐点对齐实现见 image_conditioned_proj.py视角对齐潜变量训练数据为每个视角各生成一份 latent默认 2 视角。数据准备是复现的最大工作量data_toolkit/README.md 给出了从下载 ObjaverseXL/ABO 等数据集、Blender 渲染多视角条件图render_cond.py、视角对齐 O-Voxel 化到编码各类 latent 的完整八步流程例如# 渲染多视角条件图默认2视角 python data_toolkit/render_cond.py ObjaverseXL --root datasets/ObjaverseXL_sketchfab # 编码形状 latent python data_toolkit/encode_shape_latent_view.py --root datasets/ObjaverseXL_sketchfab --resolution 512 --view_indices 0-1每一级分辨率训练完成后把上一级 checkpoint 写入下一级配置的finetune_ckpt继续微调即可完整三阶段命令示例已收录在 README.md。常见问题清单显存不够跑 main加--low_vram峰值显存从约 18GB 降到 10-12GB。没有 flash_attn用环境变量切换 SDPA 后端ATTN_BACKENDsdpa python inference.py ...。生成结果有畸变尝试手动指定 FOV如--fov 0.2弧度。结果和论文对不上确认你当前在paper分支而不是main。第三方组件许可见 NOTICE 与 LICENSE。总结日常使用选mainTRELLIS.2 骨架、更低显存、GLB 一键导出、Gradio 交互界面复现论文选paper与 SIGGRAPH 2026 报告结果一一对应想深入源码重点看像素对齐投影条件模块 pixal3d/trainers/flow_matching/mixins/ 与三阶段级联配置 configs/gen/。【免费下载链接】Pixal3D[SIGGRAPH 2026] Pixal3D: Pixel-Aligned 3D Generation from Images项目地址: https://gitcode.com/gh_mirrors/pi/Pixal3D创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考