基于官方文档、第三方评测,以及你自己那份 260 条的「工业设计渲染图」ChatGPT 会话存档做的复盘。
GPT-5.6 不会画图。Sol / Terra / Luna 三档的官方模型页都明确写着 Image Output: No —— 所谓"GPT-5.6 做工业设计",实际是三个东西拼起来:GPT-5.6 负责推理和评审,GPT Image 2 负责出图,代码执行器负责拼文件。
你那份会话已经把这条路完整走了一遍,成绩单是:约束推理 A,设计语言拆解 B,出图 C,出 CAD D。它给你的最大价值不是那些渲染图,是第 39 条里它自己算出「6 颗 18650 装不进 42×210×26」并逼你改尺寸。
正确的用法是把"形"的唯一真相源从像素模型搬回参数化 CAD——这套你 8 月 24 号已经在本机打通了(CadQuery → STEP → Blender)。GPT-5.6 只做它擅长的三件事:定约束、改参数脚本、读图评审。
2026-07-09 发布,三档模型,都是 105 万 token 上下文、12.8 万 token 输出、知识截止 2026-02-16。关键的一行在最后一列。
| 档位 | model id | 输入 / 输出(每百万 token) | 读图 | 出图 |
|---|---|---|---|---|
| Sol 旗舰 | gpt-5.6-sol | $4 / $20 | ✅ | ❌ |
| Terra 均衡 | gpt-5.6-terra | $2 / $12 | ✅ | ❌ |
| Luna 廉价 | gpt-5.6-luna | $0.20 / $1.20 | ✅ | ❌ |
三档都支持 function calling、结构化输出、MCP、Responses API、computer use 和 code_interpreter。出图靠另一个模型 gpt-image-2(2026-04 上线):单次最多接 16 张参考图,支持 mask 局部重绘,按分辨率计价 $0.03 / $0.05 / $0.08 一张。这两个数字后面很重要。
我没有找到任何把 GPT-5.6 用于实体工业设计、CMF 或产品设计评审的公开案例。找得到的设计类案例——Figma Make 接入、Banani 的 UI 测评——全部落在软件界面设计。也没有任何官方或权威第三方评测测过它的 3D / CAD / 空间推理能力。所以下面的判断,主要证据来自你自己那份会话,而不是行业共识。
这份存档比任何评测都有说服力,因为它是同一个产品、同一个人、连续 9 轮迭代的完整记录。逐条读完之后的成绩单:
这段是整场会话最值钱的十行字。你原本的尺寸是拍的,它用电芯物理尺寸倒推包络,直接否掉,并给出可信区间。Midjourney、即梦、Vizcom 永远给不了这个——它们不知道 18650 是 18mm 直径 65mm 长。
同类表现还有几处:第 194 条它导出 STEP 后发现实体计数和预期对不上,主动选择不交付先去修校验逻辑;最后一条它提醒你「两并」如果指电气 2P,六节就构成 3S2P,整机电压和 BMS 要另行核对。这种"自己怀疑自己"的倾向,在工程场景比出图漂亮值钱得多。
你说"参考米家马桶盖",它先去检索智米官方产品图和拆解实拍,然后把结论抽象成可执行的设计语言:"核心不是纯白无层次,而是一个很薄的圆角长条控制臂:机身与按键几乎共面,功能通过浅灰图标和极细分隔来组织"。这个转译能力是真的,比你自己描述"要简洁"要精确得多。
这是整场会话消耗最多轮次、最后靠你人工抓 bug 才解决的部分:
同类失效还有两处:第 233 条它自己发现"第三套的透明视图把 6 节电芯画成了 3×2";第 253 条修完一版又发现"PCB 仍被画到了电池上方而不是压在电芯表面"。
更隐蔽的一个问题是尺寸单向膨胀:42×210×26 → 52×238×33 → 55×245×36 → 60×258×42。每一轮"修正"都在放大,因为像素模型没有守恒约束——它只会往画面里加东西,不会做减法预算。最终尺寸比你的起点宽了 43%、长了 23%,一个单手握持的线控器已经握不住了。
你在第 123 条要求"生成 3D 数据,例如 STP 格式"。它确实交付了一个 .stp,38 个独立实体、23,101 个实体引用、6 节电芯命名校验通过。但它自己写明了本质:
翻译成人话:它用 Python 拼三角面片,再把面片包装成 STEP 语法。没有 CAD 内核参与,没有真正的圆角、没有拔模角、没有壁厚、改不动参数。导进 SolidWorks 能打开,但除了看比例什么都做不了。它自己在交付时也承认"暂不能直接用于开模生产"。
第 248 条它提到"参考图数量超过了单次上限",只能保留 5 张。但 gpt-image-2 的 API 单次支持 16 张参考图——这个限制来自 ChatGPT 网页版,不是模型能力。走 API 你能一次喂 16 张(上一版外观 + 四个视角 + 竞品实拍 + PCB + 电池包 + 挂钩细节…),一致性会明显好转。
因为出图那一步是扩散模型,它没有"同一个物体"这个概念,只有"看起来像的像素"。你要的三视图一致性、内部零件排布、尺寸守恒,这三件事全都属于几何真值,必须由几何引擎持有。
这不是 OpenAI 的问题,是全行业的。截至 2026 年,多视角一致性仍然是学术界在发论文攻关的开放问题;即使是被认为在保形编辑上最强的 Nano Banana Pro(Gemini 3 Pro Image),其前代的已知失败模式仍然是"产品经过第二轮提示后形状漂移、细节丢失"。
同样的道理解释了 CAD 那一步:网格不等于 B-Rep。Rodin Gen-2.5 能出千万面级细节、Meshy 7 一分钟出全贴图模型,但它们产出的都是三角网格,是给游戏和展示用的资产,不是参数化实体。这条分界线在 2026 年多份独立评测里被反复强调。
核心的一次角色调换:不要让像素模型定义形状,让它给形状上皮。
你 8 月 24 号在这个项目上已经打通了 CadQuery → STEP / GLB → Blender Cycles 的全链路,缺的只是把 GPT-5.6 接在正确的工位上。五个工位:
GPT-5.6 Terra让它先输出一份硬约束清单,落成 constraints.md:电芯包络、最小壁厚、按键行程、挂钩载荷与安全系数、IP 等级要求、拔模角、单手握持宽度上限。这一步是防尺寸膨胀的唯一手段——之后每一轮评审都拿这张表当尺子,"60mm 宽超了单手握持上限 55mm"就是一句可判定的话,而不是感觉。
GPT-5.6 Terra/SolCadQuery把 build_step.py 顶部的尺寸全部提成一份 params 字典。要改造型时,让它改数字和建模代码,不是重新生成一张图。它写 Python 的能力(Sol 在 Coding Agent Index 上 80 分创纪录)远强于它画三视图的能力,用强项。
Blender Cyclesblender -b -P blender_render.py 出正 / 侧 / 背 / 45° / 内部透视 / 爆炸图。这些图的三视图天然一致(同一个 B-Rep 转的)、电芯排布天然正确(是真建出来的圆柱)、尺寸天然守恒(是算出来的)。你那份会话里 9 轮没解决的问题,在这一步全部消失。
gpt-image-2 / Nano Banana Pro拿 Blender 白模当参考图做图生图,用 mask 圈定只允许改动的区域。prompt 的重点从"设计一个……"变成"保持轮廓、比例、分件、按键位置完全不变,只替换材质表现与灯光环境"。这一步产出的是给客户和评审看的卖相图,几何仍由 CAD 兜底。
GPT-5.6 Sol你把 Blender 三视图 + 约束表 + 竞品实拍一起喂进去(三档都支持图片输入,105 万上下文装得下),要求输出结构化问题清单:违反了哪条约束、DFM 风险在哪、和竞品比设计语言弱在哪。它做批判者比做创作者靠谱得多——第 194、233、253 条都是它自己揪出来的错。
为了确认方案能不能自动化跑起来,我把本机能碰的通路都实测了一遍:
已装 0.144.6,模型列表里有 gpt-5.6-terra / gpt-5.6-luna,最高支持 ultra 推理档。
模型列表已能看到 gemini-3-pro-image 和 gemini-3.1-flash-image(即 Nano Banana Pro 系)。
二进制在位,登录态有效,查余额正常。
但生成命令仅限高级会员,当前账号免费档也就是说:目前唯一活着的 GPT-5.6 通路就是 ChatGPT 网页版手工操作——就是你现在在用的方式。想把上面那套流水线自动化,必须解锁一把付费通路。三个选项:
| 选项 | 解决什么 | 成本 | 取舍 |
|---|---|---|---|
| OpenAI 充值 | 推理 + 出图一次到位 | terra $2/$12 每百万 image-2 $0.03–0.08/张 |
唯一同时给你 16 张参考图 + mask 局部重绘的,"只改挂钩不动机身"这类需求是刚需 |
| Gemini 绑卡 | 只解决出图 | 约 $0.134/张 | 保形局部编辑口碑最好,2K/4K 输出,但推理侧还是要另找模型 |
| 即梦高级会员 | 只解决出图 | 按会员月费 | 中文营销图场景验证最充分,但工业设计垂类无公开评测,API 化程度低 |
建议:先充 OpenAI $20 打通全链路,Gemini 绑卡作为出图备份。理由是 mask inpainting 那一项——工位 4 的"锁形只改 CMF"没有它就退化成碰运气。
2026 年这条路上唯一能验证走通"输入 → 可编辑 B-Rep → 导出可制造 STEP"完整闭环的是 Zoo 的 Zookeeper(2026-01 上线对话式 CAD Agent,2026-03 起支持图片 / 图表 / PDF 转 CAD,2026-02 起支持实体与曲面建模)。如果你想省掉自己写 CadQuery 的功夫,它是目前唯一值得付费试的。对照组:AdamCAD 的 STEP 导出还在路线图上没上线;Meshy / Rodin / Tripo / 混元3D 出的全是网格。
你那 9 轮已经证明了。这是模型机理层面的问题,不是描述得不够清楚的问题。要么用几何引擎兜底,要么接受它只能出情绪板。
USPTO 在 2026 年 3 月专门发文讨论生成式 AI 在外观设计专利中的角色;美欧现行法律都要求人类作者 / 发明人,纯 AI 生成内容原则上不受版权保护。实操含义:如果这个外观将来要申外观专利,从现在开始保留人类设计贡献的过程证据——手绘草图、参数决策记录、评审修改意见。你那份 260 条会话本身就是很好的证据链,因为里面每一轮方向都是你定的。
| 项目 | 适配度 | 怎么用 |
|---|---|---|
| 移位机手控器 | 立刻可做 | CadQuery 脚本、STEP、Blender 渲染全都在位,把工位 1 的约束表补上就能跑完整循环。这是验证这套方法最便宜的靶子。 |
| 轮椅整车 Glydon | 部分适用 | 整车尺度的形面质量不是参数化 CAD 的强项,也不是 AI 的强项。这里 GPT-5.6 的价值在竞品设计语言拆解和 CMF 策略(它拆智米马桶盖那段的水准),形还得人类设计师出。别指望端到端。 |
| 无人机清洗设备 | 优势更大 | 偏机构和工程件,外观权重低、约束权重高,正好落在参数化路线的甜区。而且这类设备没有现成的"好看"参考,AI 出图本来也帮不上忙。 |