GPT-6 Astra 从图像到3D (五)—— Blender 之外:Agent 场景建模
既然 Astra 并不擅长复杂物体建模,那么与其仅让它调用 Blender,一个更加自然的想法是:将图生 3D 模型的能力交给 Astra Agent。
让 Agent 自己来找到复杂到需要借助外力帮助的物体,将 3D 理解、Blender 3D 建模、图生 3D 模型等能力自动串成一套制作流程:
- Agent 决定哪些物体使用 Blender 建模(如桌子、水杯),哪些交给专门的生成模型(如手办);
- Agent 调用图片生成能力为图生 3D 准备输入参考图(涉及抠图、遮挡补全、视角矫正、分辨率提升等);
- 最后,Agent 需要将不同路径建模的物体组织整合成同一个场景。
以下几个场景示例中全程我仅输入文字(包括场景图片描述以及建模任务):
- 文字描述场景需求。由最新的 GPT Image 2.5 模型为每个场景生成 1 张图片。
- 以上图片作为 3D 场景建模的参考,由 AI 自己组织场景建模流程。特别地,需要合理调用图生 3D 工具,要求每个场景分别使用两条路线对照:
- 路线 A:全部基于 Blender 完成建模(允许使用图像生成制作纹理),作为对比基线。
- 路线 B:在 A 的基础上,可引入图生 3D,自主完成物体选择、物体建模和场景整合。
办公桌:手办交由图生 3D
路线 B 建模结果:
以上结果中手办是 Agent 识别到的「困难」物体。从以下对比中也可以发现,路线 A 的手办建模虽然包含了完整的结构(底座、人物、头发等),但整体建模生硬。
为了调用图生 3D 工具生成以上手办模型,它先调用 imagegen 工具生成出独立、完整的人物正面参考图片,再送入图生 3D 。
工作台:遥控玩具车
路线 B 建模结果:
该例子中,Astra 将遥控玩具越野车交给图生 3D 建模。从对比图中可以看出,路线 A 也可以建模出相对复杂的结构(轮胎、悬架、尾翼等),但复杂的车身轮廓、印花和精细结构仍存在差距。
这个例子还有一处有趣的细节,蓝色零件箱内独立建模出168 件五金件(132颗螺栓、18个螺母和18个垫圈)并完成排布和穿插检查。
更多场景
厨房餐桌
建模结果:
困难物体选择的是机器人 WALL·E。本例子中,实际上路线 A 的机械细节更加真实、丰富,但路线 B 的整体造型更加还原。
客厅茶几
路线 B 生成结果:
本例子中,困难物体是高达模型。
学习文具
建模结果:
同样,与办公桌的例子类似,手办也被选做困难物体单独建模。