五个场景的生成结果概览

既然 Astra 并不擅长复杂物体建模,那么与其仅让它调用 Blender,一个更加自然的想法是:将图生 3D 模型的能力交给 Astra Agent。

Agent 自己来找到复杂到需要借助外力帮助的物体,将 3D 理解、Blender 3D 建模、图生 3D 模型等能力自动串成一套制作流程

  • Agent 决定哪些物体使用 Blender 建模(如桌子、水杯),哪些交给专门的生成模型(如手办);
  • Agent 调用图片生成能力为图生 3D 准备输入参考图(涉及抠图、遮挡补全、视角矫正、分辨率提升等);
  • 最后,Agent 需要将不同路径建模的物体组织整合成同一个场景。

以下几个场景示例中全程我仅输入文字(包括场景图片描述以及建模任务):

  1. 文字描述场景需求。由最新的 GPT Image 2.5 模型为每个场景生成 1 张图片。
  2. 以上图片作为 3D 场景建模的参考,由 AI 自己组织场景建模流程。特别地,需要合理调用图生 3D 工具,要求每个场景分别使用两条路线对照:
    • 路线 A:全部基于 Blender 完成建模(允许使用图像生成制作纹理),作为对比基线。
    • 路线 B:在 A 的基础上,可引入图生 3D,自主完成物体选择、物体建模和场景整合。

办公桌:手办交由图生 3D

办公桌输入参考
办公桌输入图,由 GPT Image 2.5 生成。

路线 B 建模结果:

办公桌路线 B 生成结果
办公桌路线 B 三维场景总览

以上结果中手办是 Agent 识别到的「困难」物体。从以下对比中也可以发现,路线 A 的手办建模虽然包含了完整的结构(底座、人物、头发等),但整体建模生硬。

办公桌手办对比:左为路线 A,右为路线 B
人物局部:左为 A,右为 B。

为了调用图生 3D 工具生成以上手办模型,它先调用 imagegen 工具生成出独立、完整的人物正面参考图片,再送入图生 3D 。

Astra 为图生 3D 准备的人物参考
Astra 准备的独立人物参考,用作图生 3D 输入。

工作台:遥控玩具车

工作台输入参考
工作台输入图,由 GPT Image 2.5 生成。

路线 B 建模结果:

工作台路线 B 生成结果

该例子中,Astra 将遥控玩具越野车交给图生 3D 建模。从对比图中可以看出,路线 A 也可以建模出相对复杂的结构(轮胎、悬架、尾翼等),但复杂的车身轮廓、印花和精细结构仍存在差距。

遥控玩具车对比:左为路线 A,右为路线 B
车辆局部:左为 A,右为 B。

这个例子还有一处有趣的细节,蓝色零件箱内独立建模出168 件五金件(132颗螺栓、18个螺母和18个垫圈)并完成排布和穿插检查。

工作台零件箱与五金件细节

更多场景

厨房餐桌

厨房餐桌输入参考
输入参考图

建模结果:

厨房餐桌路线 B 生成结果
厨房餐桌路线 B 交互结构展示

困难物体选择的是机器人 WALL·E。本例子中,实际上路线 A 的机械细节更加真实、丰富,但路线 B 的整体造型更加还原。

WALL·E 对比:左为路线 A,右为路线 B

客厅茶几

客厅茶几输入参考
客厅茶几输入图。

路线 B 生成结果:

客厅茶几路线 B 生成结果
客厅茶几路线 B 局部细节

本例子中,困难物体是高达模型。

高达模型对比:左为路线 A,右为路线 B

学习文具

文具桌面输入参考
文具桌面输入图。

建模结果:

文具桌面路线 B 生成结果
文具桌面路线 B 开合结构展示

同样,与办公桌的例子类似,手办也被选做困难物体单独建模。

文具桌面手办对比:左为路线 A,右为路线 B