技术方案研究 · 2026-08-27

GPT-5.6 做工业设计:
它能干什么,不能干什么,怎么接进你的流程

基于官方文档、第三方评测,以及你自己那份 260 条的「工业设计渲染图」ChatGPT 会话存档做的复盘。

样本:移位机手控器项目 · yiweiji-handset

一句话结论

GPT-5.6 不会画图。Sol / Terra / Luna 三档的官方模型页都明确写着 Image Output: No —— 所谓"GPT-5.6 做工业设计",实际是三个东西拼起来:GPT-5.6 负责推理和评审,GPT Image 2 负责出图,代码执行器负责拼文件。

你那份会话已经把这条路完整走了一遍,成绩单是:约束推理 A,设计语言拆解 B,出图 C,出 CAD D。它给你的最大价值不是那些渲染图,是第 39 条里它自己算出「6 颗 18650 装不进 42×210×26」并逼你改尺寸。

正确的用法是把"形"的唯一真相源从像素模型搬回参数化 CAD——这套你 8 月 24 号已经在本机打通了(CadQuery → STEP → Blender)。GPT-5.6 只做它擅长的三件事:定约束、改参数脚本、读图评审。

01 / 事实基线

GPT-5.6 到底是什么

2026-07-09 发布,三档模型,都是 105 万 token 上下文、12.8 万 token 输出、知识截止 2026-02-16。关键的一行在最后一列。

档位model id输入 / 输出(每百万 token)读图出图
Sol 旗舰gpt-5.6-sol$4 / $20
Terra 均衡gpt-5.6-terra$2 / $12
Luna 廉价gpt-5.6-luna$0.20 / $1.20

三档都支持 function calling、结构化输出、MCP、Responses API、computer use 和 code_interpreter。出图靠另一个模型 gpt-image-2(2026-04 上线):单次最多接 16 张参考图,支持 mask 局部重绘,按分辨率计价 $0.03 / $0.05 / $0.08 一张。这两个数字后面很重要。

一个必须先说清的信息缺口

我没有找到任何把 GPT-5.6 用于实体工业设计、CMF 或产品设计评审的公开案例。找得到的设计类案例——Figma Make 接入、Banani 的 UI 测评——全部落在软件界面设计。也没有任何官方或权威第三方评测测过它的 3D / CAD / 空间推理能力。所以下面的判断,主要证据来自你自己那份会话,而不是行业共识。

02 / 实证复盘

你那 260 条会话里,它赢在哪、输在哪

这份存档比任何评测都有说服力,因为它是同一个产品、同一个人、连续 9 轮迭代的完整记录。逐条读完之后的成绩单:

A工程约束推理 —— 这是它不可替代的地方

「先做空间校核:6 颗 18650 最紧凑的细长排列是 2 列 × 3 排,裸电芯包络已经约为 37 × 196 × 19 mm。再加入电芯支架、绝缘、BMS、导线、按键行程、显示窗、外壳和挂钩后,原来的 42 × 210 × 26 mm 基本放不下。」 — 会话第 39 条,它主动推翻了你给的初始尺寸

这段是整场会话最值钱的十行字。你原本的尺寸是拍的,它用电芯物理尺寸倒推包络,直接否掉,并给出可信区间。Midjourney、即梦、Vizcom 永远给不了这个——它们不知道 18650 是 18mm 直径 65mm 长。

同类表现还有几处:第 194 条它导出 STEP 后发现实体计数和预期对不上,主动选择不交付先去修校验逻辑;最后一条它提醒你「两并」如果指电气 2P,六节就构成 3S2P,整机电压和 BMS 要另行核对。这种"自己怀疑自己"的倾向,在工程场景比出图漂亮值钱得多。

B竞品设计语言拆解

你说"参考米家马桶盖",它先去检索智米官方产品图和拆解实拍,然后把结论抽象成可执行的设计语言:"核心不是纯白无层次,而是一个很薄的圆角长条控制臂:机身与按键几乎共面,功能通过浅灰图标和极细分隔来组织"。这个转译能力是真的,比你自己描述"要简洁"要精确得多。

C出图 —— 三视图对不上,9 轮才勉强收敛

这是整场会话消耗最多轮次、最后靠你人工抓 bug 才解决的部分:

「好像老出现一个问题,就是那个工业设计正面的时候,它是一个平面,但是背面那个钩子不对呀,那个钩子怎么又变成,这跟正面对不上。」 — 你,会话第 236 条
「对,前面的问题是我把挂钩错误地做成了『机身顶部的一部分』,所以正面是完整平面,背面却突然多出一个大 C 形轮廓,三视图当然对不上。」 — 它,第 242 条,承认

同类失效还有两处:第 233 条它自己发现"第三套的透明视图把 6 节电芯画成了 3×2";第 253 条修完一版又发现"PCB 仍被画到了电池上方而不是压在电芯表面"。

更隐蔽的一个问题是尺寸单向膨胀:42×210×26 → 52×238×33 → 55×245×36 → 60×258×42。每一轮"修正"都在放大,因为像素模型没有守恒约束——它只会往画面里加东西,不会做减法预算。最终尺寸比你的起点宽了 43%、长了 23%,一个单手握持的线控器已经握不住了。

D出 CAD —— 看起来成了,实际不能用

你在第 123 条要求"生成 3D 数据,例如 STP 格式"。它确实交付了一个 .stp,38 个独立实体、23,101 个实体引用、6 节电芯命名校验通过。但它自己写明了本质:

「我已经确定采用『多实体 Faceted B-Rep STEP』的路线……圆角会以较密的曲面分片表达;这是概念级 STEP,不是最终模具级 NURBS 曲面。」 — 第 162 条

翻译成人话:它用 Python 拼三角面片,再把面片包装成 STEP 语法。没有 CAD 内核参与,没有真正的圆角、没有拔模角、没有壁厚、改不动参数。导进 SolidWorks 能打开,但除了看比例什么都做不了。它自己在交付时也承认"暂不能直接用于开模生产"。

顺带一个操作层面的发现

第 248 条它提到"参考图数量超过了单次上限",只能保留 5 张。但 gpt-image-2 的 API 单次支持 16 张参考图——这个限制来自 ChatGPT 网页版,不是模型能力。走 API 你能一次喂 16 张(上一版外观 + 四个视角 + 竞品实拍 + PCB + 电池包 + 挂钩细节…),一致性会明显好转。

03 / 机理

为什么再怎么写 prompt 也修不好

因为出图那一步是扩散模型,它没有"同一个物体"这个概念,只有"看起来像的像素"。你要的三视图一致性、内部零件排布、尺寸守恒,这三件事全都属于几何真值,必须由几何引擎持有。

这不是 OpenAI 的问题,是全行业的。截至 2026 年,多视角一致性仍然是学术界在发论文攻关的开放问题;即使是被认为在保形编辑上最强的 Nano Banana Pro(Gemini 3 Pro Image),其前代的已知失败模式仍然是"产品经过第二轮提示后形状漂移、细节丢失"。

同样的道理解释了 CAD 那一步:网格不等于 B-Rep。Rodin Gen-2.5 能出千万面级细节、Meshy 7 一分钟出全贴图模型,但它们产出的都是三角网格,是给游戏和展示用的资产,不是参数化实体。这条分界线在 2026 年多份独立评测里被反复强调。

04 / 方案

把"形"的真相源搬回 CAD,让 GPT-5.6 只做它擅长的事

核心的一次角色调换:不要让像素模型定义形状,让它给形状上皮。

你 8 月 24 号在这个项目上已经打通了 CadQuery → STEP / GLB → Blender Cycles 的全链路,缺的只是把 GPT-5.6 接在正确的工位上。五个工位:

1

约束表 —— 先立尺子,再动手

GPT-5.6 Terra让它先输出一份硬约束清单,落成 constraints.md:电芯包络、最小壁厚、按键行程、挂钩载荷与安全系数、IP 等级要求、拔模角、单手握持宽度上限。这一步是防尺寸膨胀的唯一手段——之后每一轮评审都拿这张表当尺子,"60mm 宽超了单手握持上限 55mm"就是一句可判定的话,而不是感觉。

2

参数化建模 —— 让它改脚本,不是画图

GPT-5.6 Terra/SolCadQuerybuild_step.py 顶部的尺寸全部提成一份 params 字典。要改造型时,让它改数字和建模代码,不是重新生成一张图。它写 Python 的能力(Sol 在 Coding Agent Index 上 80 分创纪录)远强于它画三视图的能力,用强项。

3

白模出图 —— 几何绝对正确

Blender Cyclesblender -b -P blender_render.py 出正 / 侧 / 背 / 45° / 内部透视 / 爆炸图。这些图的三视图天然一致(同一个 B-Rep 转的)、电芯排布天然正确(是真建出来的圆柱)、尺寸天然守恒(是算出来的)。你那份会话里 9 轮没解决的问题,在这一步全部消失。

4

上皮 —— 只改 CMF,不许改形

gpt-image-2 / Nano Banana Pro拿 Blender 白模当参考图做图生图,用 mask 圈定只允许改动的区域。prompt 的重点从"设计一个……"变成"保持轮廓、比例、分件、按键位置完全不变,只替换材质表现与灯光环境"。这一步产出的是给客户和评审看的卖相图,几何仍由 CAD 兜底。

5

评审 —— 让它读图,不让它出图

GPT-5.6 Sol把 Blender 三视图 + 约束表 + 竞品实拍一起喂进去(三档都支持图片输入,105 万上下文装得下),要求输出结构化问题清单:违反了哪条约束、DFM 风险在哪、和竞品比设计语言弱在哪。它做批判者比做创作者靠谱得多——第 194、233、253 条都是它自己揪出来的错。

这套为什么能解决你踩的那四个坑

  • 三视图对不上 → 所有视角是同一个实体渲染的,物理上不可能不一致
  • 电芯排布漂移 → 6 颗 ⌀18×65 圆柱是真实建模的,画错了模型本身就穿模
  • 尺寸单向膨胀 → 每次改动是改数字,超约束表当场报警
  • 假 STEP → CadQuery 走 OCCT 内核,出的是真 B-Rep,能拿去做 DFM

05 / 通路

本机实测:现在这三条路,全是堵的

为了确认方案能不能自动化跑起来,我把本机能碰的通路都实测了一遍:

Codex CLI(GPT-5.6)

已装 0.144.6,模型列表里有 gpt-5.6-terra / gpt-5.6-luna,最高支持 ultra 推理档。

但 ~/.codex/auth.json 里那把 key 返回 401 invalid_api_key,实跑 stream disconnected

Gemini 3 Pro Image

模型列表已能看到 gemini-3-pro-imagegemini-3.1-flash-image(即 Nano Banana Pro 系)。

但生成请求返回 429 quota exceeded,免费层配额为 0,需绑付费账单

即梦 CLI

二进制在位,登录态有效,查余额正常。

但生成命令仅限高级会员,当前账号免费档

也就是说:目前唯一活着的 GPT-5.6 通路就是 ChatGPT 网页版手工操作——就是你现在在用的方式。想把上面那套流水线自动化,必须解锁一把付费通路。三个选项:

选项解决什么成本取舍
OpenAI 充值 推理 + 出图一次到位 terra $2/$12 每百万
image-2 $0.03–0.08/张
唯一同时给你 16 张参考图 + mask 局部重绘的,"只改挂钩不动机身"这类需求是刚需
Gemini 绑卡 只解决出图 约 $0.134/张 保形局部编辑口碑最好,2K/4K 输出,但推理侧还是要另找模型
即梦高级会员 只解决出图 按会员月费 中文营销图场景验证最充分,但工业设计垂类无公开评测,API 化程度低

建议:先充 OpenAI $20 打通全链路,Gemini 绑卡作为出图备份。理由是 mask inpainting 那一项——工位 4 的"锁形只改 CMF"没有它就退化成碰运气。

06 / 边界

三件不该指望的事

一、别指望任何 LLM 直接给你可开模的 STEP

2026 年这条路上唯一能验证走通"输入 → 可编辑 B-Rep → 导出可制造 STEP"完整闭环的是 Zoo 的 Zookeeper(2026-01 上线对话式 CAD Agent,2026-03 起支持图片 / 图表 / PDF 转 CAD,2026-02 起支持实体与曲面建模)。如果你想省掉自己写 CadQuery 的功夫,它是目前唯一值得付费试的。对照组:AdamCAD 的 STEP 导出还在路线图上没上线;Meshy / Rodin / Tripo / 混元3D 出的全是网格。

二、别指望靠 prompt 修好多视角一致性

你那 9 轮已经证明了。这是模型机理层面的问题,不是描述得不够清楚的问题。要么用几何引擎兜底,要么接受它只能出情绪板。

三、IP 风险已经从理论担忧变成监管动作

USPTO 在 2026 年 3 月专门发文讨论生成式 AI 在外观设计专利中的角色;美欧现行法律都要求人类作者 / 发明人,纯 AI 生成内容原则上不受版权保护。实操含义:如果这个外观将来要申外观专利,从现在开始保留人类设计贡献的过程证据——手绘草图、参数决策记录、评审修改意见。你那份 260 条会话本身就是很好的证据链,因为里面每一轮方向都是你定的。

07 / 落到你三个项目上

优先级

项目适配度怎么用
移位机手控器 立刻可做 CadQuery 脚本、STEP、Blender 渲染全都在位,把工位 1 的约束表补上就能跑完整循环。这是验证这套方法最便宜的靶子。
轮椅整车 Glydon 部分适用 整车尺度的形面质量不是参数化 CAD 的强项,也不是 AI 的强项。这里 GPT-5.6 的价值在竞品设计语言拆解和 CMF 策略(它拆智米马桶盖那段的水准),形还得人类设计师出。别指望端到端。
无人机清洗设备 优势更大 偏机构和工程件,外观权重低、约束权重高,正好落在参数化路线的甜区。而且这类设备没有现成的"好看"参考,AI 出图本来也帮不上忙。