图生 3D 模型调研:路线、原理与工具选型
从第一性原理出发,梳理图像到 3D 模型的主流路线,对比 Tripo、Meshy 商业工具和 Trellis2、Hunyuan3D、Pixal3D 开源方案
2025 年到 2026 年,AI 生成 3D 模型这件事经历了一轮明显的加速。一年前大部分工具还停留在”能用”的阶段——生成的模型拓扑混乱、纹理模糊、需要大量手工修复。到了现在,无论是商用平台的体验还是开源模型的质量,都已经到了可以真正进入实际工作流的程度。
这篇文章是一次系统性的调研笔记,覆盖几个方面:图生 3D 为什么比文本直出 3D 更可行、背后的基本原理是什么、目前有哪些值得关注的工具,以及如何根据需求做选型。
文本生 3D 的问题#
最直觉的想法是”用一句话描述一个物体,AI 直接生成 3D 模型”。这个方向有不少研究,但现阶段效果普遍不好。问题在于文本描述的语义密度太低——“一个穿风衣的角色”这句话只传递了几个维度的信息,而一个 3D 模型需要确定的变量多得多:几何结构的每一个面、纹理的每一个像素、光照响应在每一处表面上的表现。中间的空白全要靠模型的”想象”来填补,模型不会每次都往同一个方向想。
2025 年之后,主流路线开始收敛到一个共识:先图像,再 3D。让用户先得到一张符合预期的 2D 图像——2D 生成模型的生态已经很成熟了,Midjourney、DALL·E、Stable Diffusion、FLUX 各自能产生高质量的图像——然后再把这张图像送入 3D 生成模型。图像比文本携带的信息密度高几个数量级,一个像素就锁定了一个空间位置的颜色约束,整张图像加在一起,给 3D 模型提供了一个足够紧的”锚点”。
当前工业界和学术界的基本共识:图像是 3D 生成的有效中间表示。2D 生成负责”人想要什么”,3D 生成负责”把它变成可旋转的”。
一张图变成 3D 模型的原理#
对于没有接触过这个领域的人,可以先建立一个大致的认知框架。从输入图像到输出 3D 模型,大致经历三个阶段。
第一步:理解图像里有什么。 模型首先用视觉编码器——通常是 DINOv3 这类大规模视觉预训练模型——将输入的 2D 图像编码成高维特征向量。这一步提取的不只是”图像长什么样”,还包括物体的类别、姿态、材质、空间关系等语义信息。许多模型在这一步还会做背景去除,把要生成的目标物体从背景中分离出来。
第二步:从 2D 特征升维到 3D 结构。 这是核心难题,也是不同模型路线分歧最大的地方。一个二维图像本质上是三维世界的一个平面投影,模型需要根据有限的信息”猜出”被遮挡的那一面长什么样。当前主流的做法是用一个 3D 生成网络,接收 2D 特征作为条件输入,在三维空间中逐步生成体素或点云。TRELLIS.2 的选择是用 O-Voxel 这种稀疏体素表示,它用一个扩散模型在 3D 体素空间中去噪,逐步将一个随机噪声场变成有意义的几何结构。Pixal3D 的思路更进一步,直接把图像像素反投影到 3D 特征体积中,在像素和三维点之间建立显式的对应关系。Hunyuan3D 则用了两阶段的 DiT 路线:先用一个 26 亿参数的扩散 Transformer 生成几何,再交给另一个 13 亿参数的模型做纹理合成。
第三步:给几何模型贴纹理。 有了几何结构之后,需要把颜色信息贴上去。这一步通常由一个专门的纹理生成模块完成,它利用多视角扩散技术——同时考虑从不同角度看物体时的颜色信息——生成 PBR 材质贴图(Base Color、Roughness、Metallic 等),贴回几何模型上,最终输出一个完整的、带材质的 3D 资产。
整个过程可以理解为:模型先”看懂”图像,再在脑中”旋转”它,把看不到的面也补出来,最后”上色”。三个步骤环环相扣,任何一环的偏差都会在最终输出中被放大。
商业工具:开箱即用#
如果你不想折腾环境配置,只想快速试用或集成到项目里,两条商业路线是目前最成熟的选择。
Tripo#
Tripo 由 VAST 团队开发,核心模型参数规模超过 2000 亿,在几何精度和结构准确性上有明显优势。它的特点是速度快(秒到分钟级别完成生成)、支持自动重拓扑和智能分割、输出格式全面(USD、FBX、OBJ、STL、GLB、3MF),对 3D 打印和游戏开发场景做了专门优化。
Tripo 分为两个独立产品线:Tripo Studio 是 Web 端交互式 3D 工作台,面向设计师和个人用户;Tripo API 是面向开发者的接口服务,两套计费体系独立。免费版每月 300 credits,支持非商业用途;Pro 版 $19.90/月,3,000 credits,开放商用授权。对刚接触的人来说,先用免费额度测试效果是一个低成本的入门方式。
Meshy#
Meshy 是目前用户规模最大的 AI 3D 生成平台之一,注册用户超过 1000 万,已生成超过 1 亿个 3D 模型。它的最新模型 Meshy 6 支持单张或多角度图片(最多 4 张)输入,一分钟内生成带 PBR 材质的完整 3D 模型。
Meshy 的差异化优势在于它的生态完整度。2026 年 3 月发布的 Workspace 3.0 将整个创作流程从”工具导向”重组为”任务导向”——从 AI 生成参考图到 3D 建模、纹理、绑定、动画,再到 3D 打印和视频生成,全在一个工作空间内完成。它还有 Blender、Unity、Unreal、Maya 等的原生插件,对团队协作和管线集成更友好。2026 年 6 月推出的 Meshy 3D Agent 更进一步,允许用户通过对话交互完成 3D 创作。
定价方面,免费版每月 100 credits(CC BY 4.0 协议),Pro 版约 $20/月,商用授权。Meshy 在 3D 打印领域投入很大——与 Bambu Lab、Formlabs 建立了直接集成,甚至提供了专门的打印可修复性检查和切片软件直连。
商业工具小结#
简化的对比:
- 两者核心能力相近:都支持图片到带纹理 3D 模型的快速生成
- Tripo 在几何精度上有优势(200B+ 参数带来的红利),免费额度更多(300 vs 100 credits/月)
- Meshy 在生态完整度上更胜一筹:多平台插件、API 体系、3D 打印集成、对话式 Agent
- 定价基本在同一水准,对个人使用都很友好
开源方案:本地部署的选项#
开源路线有三重价值:不需要付费、数据留在本地、可以搭建自动化管线。代价是环境配置的门槛——大部分模型需要 Linux + NVIDIA GPU,显存要求 16GB 起步。
TRELLIS.2:目前最强的开源图生 3D 模型#
2025 年 12 月微软开源 TRELLIS.2 时,整个图生 3D 社区的反应是”炸了”。不是因为它的架构有多革命性,而是它做到了之前开源模型没做到的几件事。
速度。 在 H100 上,512³ 分辨率约 3 秒完成(2 秒几何 + 1 秒材质),1024³ 约 17 秒,1536³ 约 60 秒。这种速度不再是”慢慢跑一晚上等结果”,而是”喝口水的工夫”。
质量。 生成的是 PBR 材质模型——Base Color、Roughness、Metallic、Opacity 四张贴图齐全,GLB 格式直接导入 Blender 或游戏引擎就能用。不再是过去那种”生成完还得花半天修复拓扑和重新贴纹理”的半成品。
技术选择。 TRELLIS.2 的核心创新是 O-Voxel 表示——一种专门为 3D 生成设计的稀疏体素结构。传统体素表示把所有三维空间格子都存下来,大部分是空的,浪费计算。O-Voxel 只存储有内容的格子和表面层,让模型在有限的计算资源下处理更复杂的几何:衣服的开放表面、树叶的薄片结构、非流形几何都不在话下。
开源程度。 MIT 协议,4B 参数权重完全公开,训练代码也在 2026 年 1 月释出。这意味着你可以根据自有数据精调模型。
生态。 社区在半年内完成了 Mac 端移植(trellis2-mlx,Apple Silicon 原生运行)、ComfyUI 集成(节点化工作流)、Blender 插件(直接在 Blender 里调用生成)和 Hugging Face 在线 Demo。TRELLIS.2 已经成为当前开源图生 3D 领域的事实标准。
硬件门槛是目前主要的限制:官方推荐 NVIDIA GPU + 24GB 以上显存,Linux 优先。Windows 可以通过 ComfyUI 方案绕开。Mac 端已有社区移植但速度较慢——M4 Pro 上 512³ 分辨率约需 5 分钟。
Hunyuan3D#
腾讯混元在 2025 年 1 月开源了 Hunyuan3D 2.0,随后在 3 月将整个模型家族扩展到 6 个模型,6 月又发布了 2.1 版本。它的架构是经典的两阶段流水线:Hunyuan3D-DiT(26 亿参数)负责几何生成,Hunyuan3D-Paint(13 亿参数)负责纹理合成,输出最高 4K 纹理。
Hunyuan3D 的独特之处在于它的轻量化做得很好。Hunyuan3D-2mini 将模型参数压缩到 6 亿,最低可以跑在 RTX 4060(8GB 显存)甚至 Apple M1 Pro 上。Turbo 系列基于 FlashVDM 加速框架,能将生成时间缩短到 30 秒以内,最快 0.5 秒出白模。在线体验平台也开放了(3d.hunyuan.tencent.com),不需要本地部署就能试用。
如果你有消费级显卡(RTX 3060/4060 这样的),Hunyuan3D 是开源方案里部署门槛最低的选择。
Pixal3D#
Pixal3D 来自腾讯 ARC Lab,2026 年被 SIGGRAPH 收录。它站在 TRELLIS.2 的肩膀上——直接以 TRELLIS.2 为主干网络——然后做了一件很直觉的事:把图像特征从二维平面上逐像素地反投影到三维空间中。
传统方法通常把图像特征通过注意力机制间接注入到 3D 生成网络,信息传递有一层间接,容易丢失细节。Pixal3D 的思路是建立一个直接的”像素→三维点”对应关系——图像上每一个像素的特征被显式地提升到三维特征体积中对应的空间位置,生成网络直接在三维空间中对这些投影特征进行处理。这个设计的直接结果是:生成的 3D 模型与原图的对应更精准,细节保留度更高。论文的实验数据也印证了这一点——在 3D 重建保真度指标上显著优于当时的 SOTA。
Pixal3D 的定位更偏学术和前沿探索,MIT 协议但限制非商业用途和欧盟地区使用。它对显存要求较高(16GB 起步,推荐 24GB+),依赖 CUDA 12.8 和 PyTorch 2.8+,环境配置确实比较折腾。如果你对图生 3D 的前沿方法感兴趣,它的像素对齐思路值得关注。
选型建议#
选哪条路,取决于你的实际约束:
想快速试水、没有高配显卡。 Tripo 或 Meshy 的免费额度是最低成本的入门。先上传几张图试试效果,感受一下目前的生成质量上限在哪,再决定是否需要更进一步。
想集成到生产管线、需要 API。 Meshy 的 API 体系更成熟——Webhook、SSE 流式、MCP Server 都有,原生插件覆盖了主流 3D 工具和引擎。Tripo 也有 API 但体系相对精简。
有 24GB 以上显卡、想本地部署、追求可控性。 TRELLIS.2 是当前开源方案里效果最好的。社区生态活跃,从 ComfyUI 到 Blender 插件到 Mac 移植都有现成方案,上手成本已经在显著降低。
显卡中等(8-16GB)、不想额外花钱。 Hunyuan3D-2mini 是门槛最低的开源选择,RTX 4060 就能跑,或者在线的体验平台直接用。
想做前沿探索或技术选型。 Pixal3D 的像素对齐思路代表了图生 3D 的一个技术方向,SIGGRAPH 论文的方法通常有足够的学术参考价值。但它的工程成熟度确实不如 TRELLIS.2——环境配置复杂、依赖链条长,更适合研究用途。
结尾#
图生 3D 的工程成熟度在 2026 年达到了一个拐点。商业工具已经到了”上传图→导出模型”的一键体验,开源模型也在半年内从”仅供研究”进化到了”社区生态活跃、能跑在消费级显卡上”。对想做 3D 内容但缺乏传统建模能力的人来说,窗口确实打开了。
当前还存在一些共性问题:拓扑结构的自动优化、极细结构的精度、多视角一致性、PBR 材质的真实感——这些都还有改进空间。但大方向是确定的:图像作为 3D 生成的中介这一步,在未来很长一段时间内都会是主流路线。