GPT-6 Astra 与 V2Fun 协同:当大模型开始“调度”3D生成,AI建模范式正在转移

导读

  一张挖掘机参考图进入GPT-6 Astra后,模型先识别驾驶舱、履带、底盘、动臂、斗杆和铲斗,再把复杂部件交给V2Fun 2.0生成,最后通过Three.js补齐液压管、螺丝、转轴和操作摇杆,并完成尺度匹配与整体装配。这个过程指向一种新的三维生产方式:大模型不必独自完成所有几何,而是根据任务调用不同的专业能力。

  这不是单纯的图生3D,也不是单纯的代码生成。GPT-6 Astra负责理解、规划和构建,专业3D Foundation Model负责处理复杂几何,二者共同输出一个可以继续编辑和使用的三维资产。极顶数创旗下V2Fun正在尝试的,正是这样一套模型协同工作流。

  三维生成开始从单一模型走向任务分工

  GPT-6 Astra带来的一个变化,是大语言模型开始进入三维对象的结构理解与构建环节。借助多模态理解、空间推理和代码能力,它可以识别一个对象由哪些部分组成,再通过Three.js等程序化方式逐步搭建。

  工业流水线是较容易说明这一能力的例子。传送带、滚轮、支撑框架、电机和不同工作模块,都可以被拆解为对应的几何结构。支撑柱可以用基础几何体表达,滚轮可以批量复制,传送带的长度和位置则可以通过参数控制。

  这类输出也不是一个不可拆分的黑盒Mesh。流水线中的各个部件仍然是独立对象,可以继续移动、复制、删除和修改。换句话说,GPT-6 Astra不只是生成一个三维结果,也开始具备理解对象组成并将其构建出来的能力。

  但当对象从流水线变成人物面部、生物、服装、雕塑,或者拥有复杂工业曲面的挖掘机时,问题就变成了:是否还应该让语言模型通过代码完成全部几何描述?

  答案不必是二选一。V2Fun进入的,正是这段复杂几何需要被专业模型接管的环节。

  V2Fun负责复杂几何的专业生成

  V2Fun并不是为一次Demo临时接入的3D API,而是极顶数创长期研发AI 3D Foundation Model的产品化入口。极顶数创成立于2025年,核心方向围绕3D生成、空间智能以及更长期的世界模型基础设施展开。

  此前,V2Fun已作为鸿蒙系统首个3D大模型AI原生应用亮相HDC 2026,并通过移动端和Web工作台覆盖从大众创作到专业3D内容生产的链路。它持续解决的问题,是如何把复杂的三维对象以更低的门槛和更短的时间,变成真正可以继续使用的3D资产。

1.png

  V2Fun 2.0聚焦复杂三维对象的生成能力

  即将上线的V2Fun 2.0将搭载最新一代3D Foundation Model,并支持最高8K级贴图生成,重点提升复杂几何、人物、生物、服装、雕塑以及其他非规则曲面的生成质量。

  这也解释了V2Fun与GPT-6 Astra为什么能够形成互补。GPT-6 Astra擅长理解、规划、空间关系、代码和Agent调度;V2Fun擅长直接生成复杂三维几何和高质量表面。前者回答“这个对象应该怎样构建”,后者处理“复杂部件本身应该长什么样”。

  挖掘机案例展示如何拆分与装配

  挖掘机的整体结构相对清晰。GPT-6 Astra可以识别底盘、左右履带、车身、驾驶舱、动臂、斗杆和铲斗,也能判断这些部件之间的连接关系。

  但驾驶舱不是一个简单立方体,车身外壳也无法仅靠几个Primitive准确表达。铲斗包含连续曲面,机械臂具有复杂轮廓,履带与底盘还包含大量工业设计细节。继续用程序化代码逼近这些结构,意味着需要生成和修改更多几何代码,迭代轮次也会增加。

  在这组Demo中,GPT-6 Astra先“看懂”挖掘机,再把驾驶舱、履带、机械臂和铲斗等复杂主体分别交给V2Fun 2.0生成。生成完成后,GPT-6 Astra重新接管流程,负责尺度调整、旋转、位置匹配和整体装配。

2.png

  挖掘机被拆分为可分别生成的三维部件

3.png

  代码生成与模型协同生成的挖掘机效果对比

  V2Fun发挥的是从视觉输入中直接恢复复杂三维结构的能力,而不是让语言模型通过大量代码间接描述曲面。与此同时,V2Fun并没有取代Three.js。

  组装完成后,GPT-6 Astra仍然会继续生成液压管、螺丝、连接轴和操作摇杆。液压管本质上是沿关键点连接起来的管状结构,螺丝和连接轴则尺寸规则、结构简单、数量较多,这些对象都更适合程序化表达。如果每个细节都单独调用一次3D Foundation Model,反而会增加流程的成本和复杂度。

  最终得到的是一个混合型三维资产。复杂主体由V2Fun生成,规则细节由GPT-6 Astra与Three.js完成,再由GPT-6 Astra把两类结果组织为同一个结构化三维对象。模型需要做的,不是从代码生成和3D大模型中做单选,而是判断每一部分更适合哪一种能力。

  人物和有机曲面放大了复杂几何的价值

  人物是另一类更能体现差异的对象。相比机械设备,人类角色更难用规则表达。一个面部是否自然,不只取决于眼睛、鼻子和嘴的位置,还取决于脸型、颧骨、眼窝、鼻梁、嘴唇以及它们之间连续而细微的曲率变化。

  铠甲也并非简单的工程件。浮雕、装饰、连续曲面和风格化造型共同构成角色的视觉特征。为此,另一组Demo让GPT-6 Astra构建一名全副武装的国王,角色包含人体、复杂铠甲、头部、剑和盾牌。

4.png

  全副武装国王Demo展示部件生成与整体装配

  在这组流程中,GPT-6 Astra先理解整体角色,再拆分出头模、身体与铠甲、剑和盾几个主要部分,随后由V2Fun分别生成复杂部件。GPT-6 Astra继续负责头部尺度、身体连接、剑盾位置、部件比例、模型减面,以及最终的整理和装配。

  V2Fun处理复杂几何如何快速而高质量地出现,GPT-6 Astra处理这些几何如何成为一个完整对象。

  V2Fun能够承担这一层复杂几何,基础仍是极顶数创围绕几何表达和高分辨率纹理持续进行的研发。几何侧的重点,是减少无效几何表达,把模型能力集中在高曲率、薄结构和复杂区域;纹理侧则关注多视角、高分辨率生成中常见的纹理错位、撕裂和细节损失。

  这也是V2Fun 2.0支持8K级高质量贴图的基础。对于Agent来说,它调用的不是一个“看起来像3D”的视觉生成工具,而是一个可以输出三维资产的专业模型。生成的资产还要继续被组合、减面和修改,并可能进入动画、游戏、打印或其他三维工作流。

  Token效率改变了建模路径

  这套工作流的收益不只体现在视觉质量上,也体现在Token使用效率上。GPT-6 Astra用Three.js描述圆柱、液压管或几个螺丝时,所需代码并不多;但如果用同样的方法逼近人物面部、衣物褶皱或高复杂度工业曲面,代码的生成与修改会迅速增加。

  在这种情况下,大量Token会被消耗在反复调整曲面、轮廓和局部几何细节上。复杂部分交给V2Fun后,这些底层过程可以被压缩为一次专业模型调用,GPT-6 Astra则可以把更多推理资源用于对象拆分、模型选择、空间关系判断、整体组装和后续修改。

  因此,V2Fun 2.0带来的不只是“模型更好看”。在这套工作流中,它有机会同时降低GPT-6 Astra在复杂3D任务中的Token消耗和整体建模时间,尤其是在多个复杂部件可以并行生成时。

  原来的路径可能是“理解、写几何、修改,再写几何、再修改”;新的路径则变成“理解、拆分、并行生成、组装、局部补充”。两者的差异,来自不同模型承担了不同层级的工作。

  从生成一个模型到成为Agent的三维基础能力

  过去几年,AI 3D的核心问题是怎样生成一个更好的模型。随着GPT-6 Astra这样的模型具备更强的多模态理解、代码和Agent能力,问题开始转向:如何让不同的三维能力在同一项任务中协同工作。

  简单结构可以直接写代码,复杂曲面可以调用V2Fun,已有资产可以继续复用,需要减面、组合和调整结构的部分则交给Agent继续执行。对于使用者来说,未来未必需要先知道应该调用哪个模型、写哪段代码或选择什么建模方式。

  “把这个做成3D。”

  在这样的交互中,GPT-6 Astra负责理解需求并决定如何完成,V2Fun 2.0则希望成为它在复杂三维世界中的专业基础能力。对极顶数创而言,这也延续了其长期的产品方向:从移动端降低3D创作门槛,到Web端进入专业资产生产,再到3D模型、动画、动作以及更长期的空间智能和世界模型,持续建设三维内容生成与空间智能的基础设施。

  当3D生成从一次性结果走向Agent参与的生产流程,模型之间的协同就不再只是产品联动,而开始成为建模路径本身的一部分。