三个Grok从四张照片到3D打印:多智能体协同制造全解析

发布时间:2026/9/9 9:19:38
三个Grok从四张照片到3D打印:多智能体协同制造全解析 说实话看到“MIT教授扔4张照片3个Grok一小时造出零件”这条消息时我正在第三次报废打印件。手里那两个支撑柱的孔又偏了0.3毫米我放下卡尺认真想了想这条消息背后的东西——如果它真的成立改变的不仅是“会用AI的人”而是从想法到实物整条流程的工作方式。这条消息在技术群和创客圈里的讨论明显分成两派一派觉得是“AI科学家冲出屏幕”另一派觉得只是又一个被夸大的演示。我的理解更接地气它本质上是一次多智能体协作制造的落地演习从视觉识别、三维建模到生成制造指令三个Grok分工接管了原本需要一个团队完成的动作。这篇文章想聊透的是三件事四张照片为什么够用、三个Grok到底怎么分工、以及普通人想在自己工作台上复现这段流程时最容易在哪几个环节翻车。搞AI应用的人可以从里面学到多Agent之间的数据交接设计机械和创客方向的读者能借此了解图像输入与制造输出的最短路径产品经理和自动化工程师也能看到人机协同的检查点应该放在哪里。1. 这场“冲出屏幕”的本质三个Agent顶替一条小产线1.1 为什么是三个Grok而不是一个更聪明的Grok很多人第一反应是既然Grok够强为什么还要开三个直接问一个Grok让它从头干到尾不就行了我第一次听到这个设计时也这么想但试过之后发现单实例连续干完整个逆向制造流程效果会迅速劣化。原因主要有两个。第一是上下文窗口的问题。一个Grok实例在处理四张照片、生成JSON约束、写OpenSCAD代码、再生成制造参数之后早期图片细节会被后边更长的对话冲淡。模型不是记不住而是上下文里的信息拥挤之后注意力会被最后几轮对话带走。第二是角色幻觉。既当视觉工程师又当CAD建模师还要当工艺师模型容易在“补全特征”这件事上自作主张——视觉阶段没看清楚的孔建模阶段会顺手按常识补一个。这恰恰是逆向工程最忌讳的事情。所以三个Grok背后是一套明确的三段式分工第一个做图像理解和尺寸约束提取第二个负责CAD建模与几何验证第三个负责制造参数和输出路径规划。每个实例的上下文相对干净只处理自己那一环避免了“一个模型同时扮演三个角色导致的判断混乱”。用公司里的分工打比方产品经理收集需求结构工程师建模工艺工程师排产三个人只需要对接一份需求文档而不是让一个人包揽所有岗位。有人可能会问那同一个Grok换三次system prompt分阶段调用不行吗也可以但三个独立实例有一个额外好处并行。第一个Agent在输出约束文件后第二个Agent立刻接手建模同时你可以人工检查第一阶段的JSON。如果是同一个实例串行处理你只能等它全部跑完再发现问题。Grok Build这类模式的价值正是在这里它把一个agent循环变成了可并行、可复核的流水线而不是让模型自己憋大招。1.2 一小时这个数字是怎么挤出来的为什么能做到一小时我们把时间拆开看。拍照和整理材料大约10分钟第一个Grok输出视觉约束差不多5分钟第二个Grok生成CAD模型并进行渲染检查大概20分钟第三个Grok做切片和制造参数校验约10分钟剩下15到20分钟用来打印一个小尺寸原型。如果零件不大、打印层高合理整个流程确实能压进60分钟。但这里有一个隐藏前提三个Grok都得一遍过。实际复现时任何一个环节返工都会让时间翻倍。更常见的情况是第一个Agent识别孔位时把4个孔看成了5个第二个Agent老老实实按5个孔建模第三个Agent也继续按5个孔切片。等你打印出来才发现多了一个孔这时候浪费的就不止一小时了。所以这条消息的真正价值不是“一小时”这个数字而是展示了一个可以并行推进的流水线结构。时间预算在我后面会专门展开这里先建立一个概念一小时不是AI的极限而是整个工具链没有额外等待时间、没有返工的理想状态。跑通流程之后再去压缩时间才是稳妥的做法。2. 四张照片传递的不是“图片”是一份带置信度的约束清单2.1 单目照片能算出尺寸吗先解决比例尺问题单张照片丢失了深度信息这是物理规律不是模型能力问题。哪怕给四张照片Grok也无法像激光扫描仪那样直接输出毫米级点云。真正可行的方法是在拍摄时放入一个已知尺寸的参照物Grok通过分割零件和参照物的像素区域估算两者之间的比例关系再把像素换算成毫米。这里用到的是一套最简单的像素比例换算公式实际特征尺寸 参照物已知尺寸 × (特征像素长度 / 参照物像素长度)举个例子参照硬币直径25毫米照片里硬币直径是500像素某个孔的直径是100像素那孔的估算直径就是25 × (100 / 500) 5毫米。这个公式看起来简单但它依赖一个前提特征和参照物处于同一个垂直于镜头光轴的平面上或者误差可以被接受。如果零件放在硬币后方半个厘米透视造成的偏差就会变大。四张照片的作用就是把不同方向上的可见特征都覆盖到再通过多角度互相校验。比如从正面看孔的横向位置是准的但深度方向尺寸不可信必须从侧面照片补全高度。我把通用的信息来源可靠性整理成了这张表照片角度能提取的信息可靠性正视主视图外轮廓、孔位平面分布、倒角位置较高俯视顶部视角凸台、沉槽、螺纹孔布局较高侧视厚度方向壁厚、高度、侧向凹槽中等斜45度视角曲面走向、整体比例用做目测不宜定量所以“四张照片”不是随机四张而是覆盖主视图、俯视图、侧视图和一个斜视角的组合。少了任何一张后面两个Grok都可能靠猜。2.2 给Grok的提示词里必须写清“不知道就说不知道”AI在图像理解上的通病是过度自信。明明看不清倒角是R1还是R2它依然会输出一个数值。如果这个数值进入后续的CAD建模流程就会成为板上钉钉的尺寸最终做出来的零件当然对不上。我在实际使用中会让第一个Grok为每个关键特征附一个置信度字段并且在提示词里直接规定不确定的特征必须输出“require_manual_measure”: true而不是强行给一个估计值。这样一来低置信度项会被标记出来而不是伪装成确定数据。处理策略也很直接置信度为high且属于外观或非配合特征的尺寸可以直接用凡是标注了low或者require_manual_measure的属性一律在打印前人工用卡尺复测。这个规则可以同时写进第一个Agent的输出模板和第三个Agent的检查清单里形成一个闭环。2.3 从照片到JSON三个Agent之间的通用语言为什么要用JSON而不是让第一个Grok写一段自然语言描述因为自然语言有大量模糊表达比如“大概在中间”“稍微靠左”第二个Agent无法可靠执行。JSON作为一种结构化数据格式每个字段都有确定含义可以被程序直接读取也能被下一个模型快速解析。我通常会让三个Grok之间传这样的文件{ object_id: bracket_01, unit: mm, reference: { type: coin, known_diameter: 25.0, confidence: high }, features: [ { type: hole, diameter: 5.1, position: [20.0, 15.0, 0.0], through: true, confidence: high, require_manual_measure: false }, { type: fillet, radius: 2.0, location: top_left_corner, confidence: low, require_manual_measure: true } ], design_intent: 两侧孔用于M5螺栓固定底部开槽需要避让PCB板 }这份JSON既是第一阶段的产品也是第二和第三阶段的输入。它让人和AI都能检查同一份数据这是整个工作流能不能稳定跑起来的基石。收到JSON之后还可以写一个简单的schema校验脚本检查必填字段是否缺失。字段缺失比数值错误更麻烦因为这往往会导致下游Agent自己脑补一个默认值。3. 一小时工作流拆解从照片到打印件每一步都可以复现3.1 拍照阶段用手机拍出能让AI读懂的四张图很多人以为AI视觉识别很强大随手拍四张就能建模。实际上输入质量直接决定输出上限。我拍照时会遵循一套固定的方法把零件放在纯色背景上旁边平放一枚硬币或者一把直尺作为参照物手机镜头与零件保持基本平行避免俯拍带来的透视压缩先拍正视、俯视、侧视再补一张斜45度视角。光线也很关键。尽量使用漫射光不要开闪光灯不要让阴影遮挡零件边缘。如果零件表面反光可以在侧面加一张白纸反射光线让轮廓更清晰。每张照片拍完以后放大了看一眼确认没有糊片。如果手机有超广角镜头尽量用1x主摄来拍超广角的边缘畸变会直接破坏像素比例换算。拍照这件事看起来最基础但实际流程中超过一半的返工都是因为输入照片不合格。还有一个容易踩的细节零件在整个拍摄过程中不要移动位置只移动手机角度。如果每换一个角度就换个位置参照物和零件的相对几何关系会变后续多视角校验就失去了意义。3.2 约束生成阶段第一个Grok的任务清单第一个Grok只做一件事读图输出结构化约束。它的提示词可以这样写你是机械逆向工程师。用户提供了四张零件照片其中包含一个已知直径的参照硬币25.0mm。 请完成 1. 识别零件的主要特征外轮廓、孔、凸台、开槽、倒角等。 2. 根据参照硬币换算每个特征的尺寸和位置坐标。 3. 以JSON格式输出必须包含features数组每个feature带confidence字段。 4. 只输出你确定能看到的特征不要臆测被遮挡的结构。 5. 所有不确定的尺寸标注require_manual_measure: true。 6. 不要生成任何CAD代码不要输出建模步骤。这一阶段不需要让Grok生成任何CAD代码甚至不建议它描述建模思路。如果它开始画图或者写脚本说明提示词没有约束好。这一步的输出应该是一份干净、可验证的JSON约束文件。拿到文件后你还需要顺手检查孔的数量对不对直径是否合理如果有明显识别错的地方先重新拍对应角度不要急着往下走。我在这个阶段还会做一件额外的事让第一个Grok在输出JSON的同时返回它在每张照片里识别出的特征框坐标。这相当于给人工检查留了对照物万一后续出了问题你能很快定位是照片识别阶段的问题还是CAD建模阶段的问题。3.3 建模阶段让第二个Grok直接生成OpenSCAD脚本模型生成环节的关键选型是OpenSCAD。为什么不选传统的鼠标拖拽建模软件因为OpenSCAD本质是代码建模模型脚本是纯文本AI生成和修改的成功率都非常高而且每次改动都可以用diff对比。相比之下Fusion 360的API虽然也能驱动但脚本复杂度和调试成本高很多。建模工具AI友好性主要问题OpenSCAD纯代码diff友好生成成功率高不适合复杂曲面雕刻FreeCAD Python可以通过脚本驱动但对象模型复杂学习曲线偏高Fusion 360 API功能强适合直接上游制造闭源API不稳定AI试错成本高第二个Grok会读取第一部分输出的JSON然后生成一段类似这样的OpenSCAD脚本$fn 64; // 参数来自JSON禁止自行更改 plate_length 60.0; plate_width 40.0; plate_height 8.0; hole_d1 5.1; hole_pos1 [15.0, 20.0]; difference() { cube([plate_length, plate_width, plate_height]); translate([hole_pos1[0], hole_pos1[1], -1]) cylinder(d hole_d1, h plate_height 2); }这个Agent的真正任务不是写漂亮代码而是严格按照JSON建模。我会在提示词里明确写所有变量值必须取自JSON任何偏差都必须单独标注。否则模型会为了“好看”顺手调整尺寸导致后期装配失败。生成STL文件后先打开渲染图检查一遍重点看孔位、厚度和方向。这一步的人工检查只需要三十秒但能避免打印出一个废品。3.4 制造阶段第三个Grok负责把模型变成可打印的指令第三个Grok做的是工艺师的活。它读取CAD脚本和STL检查最小壁厚是否满足打印机能力、悬垂结构是否需要支撑、层高和填充率应该设多少。然后可以调用切片命令行工具生成GCode或者输出一份打印参数建议。这个阶段最容易被忽略的是材料收缩率。PLA打印件的收缩率大约在0.3%到0.5%PETG更高一些ABS则可能达到0.8%。如果这是一个有配合要求的孔第三个Grok应该预留0.2到0.3毫米的余量打印后再用扩孔钻头处理而不是直接按图纸尺寸打。这一点我会明确写进制造阶段的提示词里。如果你习惯自动化这一步可以用Grok CLI或API把三个实例串起来第一个脚本输出JSON第二个脚本读取JSON并生成STL第三个脚本读取STL并生成切片参数。调度脚本本身很薄核心价值是让三个Agent之间的文件交接自动完成。我最初是手动粘贴文件跑通之后再写脚本自动化这样排查问题更简单。阶段产物人工介入点拍照四张照片放参照物、检查焦距、避免超广角约束提取约束JSON核对特征数量和置信度CAD建模SCAD源文件STL查看渲染结果抽测尺寸制造参数GCode/3MF切片预览确认支撑和层高打印实体零件去支撑卡尺复核关键尺寸这套流程跑顺以后一小时是现实的。但第一次跑不建议强求速度先让每个阶段的结果都能通过检查再谈压缩时间。4. 真实复现时最容易翻车的四个环节4.1 尺寸雪球照片误差如何在流水线里放大照片测量的误差通常不会太大但问题在于它会沿着流水线不断累积。第一个Agent在照片上把孔距估算成20.3毫米实际是20.0毫米第二个Agent按20.3毫米建模第三个Agent又根据材料收缩率把它改成20.5毫米。打印出来以后孔距变成了20.5毫米。如果这是一个配合件哪怕误差只有0.3毫米也可能装不上。我身边就有个很典型的例子有人复现一个连接支架整体外形看起来完全正常但装在设备上的时候两颗螺丝怎么都对齐不了螺丝孔。最后拿卡尺一量孔距差了0.5毫米只能用锉刀扩孔。问题根源就在照片识别时硬币参照物离零件太远导致比例换算产生了系统性偏差。应对方法只有一个对于所有参与装配的尺寸不要相信照片估算必须用卡尺复测。AI生成的约束文件里凡是标注require_manual_measure为true的字段必须进入人工复核清单。把这个规则写进第三个Grok的提示词里它会自动在最后输出一份复测清单。4.2 代码“看起来对渲染就废”Grok的视觉死角第二个Grok生成的OpenSCAD脚本常常存在一些结构性问题模块名拼错、差集操作顺序不对、Z轴方向看反。这些问题一眼看不出渲染后才暴露。最常见的报错是“The given mesh is not closed!”翻译过来就是模型没有闭合切片器无法生成连续表面。这种报错通常是差集后的几何体存在开口面比如作者忘记在底面加上一个薄壁或者差集操作的顺序让某个立方体成为了封闭空间。现在的排错链路很简单把报错信息原样回贴给同一个Grok让它修复并输出完整脚本而不是自己去改代码。这个来回通常控制在三次以内。如果三轮之后还在报错说明问题很可能出在输入约束本身比如某个孔的位置数据自相矛盾。这时候继续让AI改代码没有意义应该回到第一步重新生成约束文件或者直接拍一张更清楚的照片。记住一个原则AI生成的代码出故障优先怀疑输入数据而不是代码本身。4.3 上下文隔离导致的设计意图丢失三个Grok之间只传JSON很容易丢掉那些“明确但从数据里看不出来”的信息。比如一个孔是用来穿M5螺栓的另一个槽是为了避让电路板这些设计意图如果不在JSON里显式写出建模Agent会把它们当作普通特征处理最后生成的模型可能在形状上正确却在装配方向或开孔位置上完全不对。解决办法是在JSON中增加design_intent字段把每个特征的用途写清楚。同时把原始四张照片也传给第二个Grok作为参考而不只是给它JSON。多传照片不会让上下文爆炸但能让建模Agent在视觉上理解“为什么这里要开孔”从而减少自作主张的倾向。为了保持数据流干净照片可以作为只读参考尺寸仍然以JSON为准。这里还想补充一点上下文隔离并不是越彻底越好。隔离的是角色任务不是所有信息。共享的信息越结构化隔离才越安全。如果你把所有视觉细节都揉成一个特别长的JSON第二个Agent同样会被无关信息干扰。理想的状态是第二个Agent只拿到建模所需的尺寸、位置和特征类型以及一张可选的原图作为空间理解参考。4.4 一小时的时间陷阱别把打印时间算漏了最后一个坑来自对“一小时”的误解。如果你理解成从拍照到实体件全部在一小时内完成那这个零件多半是手机支架一类的小尺寸物件。大尺寸零件的打印时间本身就超过一小时AI再快也变不出时间。我们做一个更现实的时间预算拍照10分钟约束提取5分钟CAD生成20分钟切片参数生成10分钟打印一个中等尺寸零件35分钟总计80分钟。如果把打印件缩小、层高调高打印能压到15分钟总时间就变成60分钟。也就是说一小时方案的前提是“打印件足够小、打印参数足够激进”。我自己的建议是不要被这个新闻带偏节奏。第一次复现时给自己留出两个小时一个半小时跑流程半小时处理意外。等流水线稳定了再逐步压缩时间。多Agent协同的价值是减少人的重复劳动而不是让人在时间压力下跳过检查。5. 这套工作流到底适合什么项目我的判断5.1 三类非常适合抄作业的场景首先是备件仿制。老设备缺一个塑料卡扣或支架手头只有一个磨损样品拍照让AI生成替换件要比手动建模快一个数量级。拍照时留意一点磨损件的磨损区域要单独说明让AI在建模时适当把轮廓外扩否则做出来的替换件会跟着一起“磨损”。其次是原型快速迭代。设计师在纸上画个草图拍四张照片半小时后就能拿到一个可以握在手里的3D打印件。这个流程对产品讨论的帮助很大因为用户看到实物之后的反馈和看渲染图完全是两回事。第三类是教学demo。把多Agent工作流作为案例能让学生同时理解视觉识别、参数化建模和制造约束。课程设计里可以让学生自己选一个小零件走一遍从拍照到打印的完整链路然后再对照精度差异效果非常直观。5.2 三类一定别硬上的场景场景为什么不能硬上承重结构件AI没有做应力分析和安全系数校核受力后可能断裂精密配合件照片误差加打印误差叠加后间隙无法保证外观与品牌件材质、表面处理、纹理无法从照片中可靠推断这些领域不是AI不能帮忙而是不能只靠四张照片走全流程。传统CAD工程师、有限元仿真和材料数据仍然不可替代。AI适合做的是缩短前期概念阶段而不是替代工程验证。承重结构件尤其危险。一个零部件用在什么受力场景、安全系数选多少、疲劳寿命怎么评估这些不是从照片里能看出来的。如果你拿AI生成的零件直接承载人体重量或机器扭矩出了事故责任是真实的。别把“能打印出来”等同于“能正常使用”。5.3 人必须守住的三个检查点多Agent工作流不等于无人工作流。我会在三个节点强制人工介入一是照片拍摄时确认参照物和角度二是建模完成后抽查关键尺寸并看渲染图三是切片预览时检查支撑、悬垂和层高。这三个检查点加起来不超过三分钟但能避开绝大部分失败。最后分享一个我自己的习惯让第三个Grok在输出GCode的同时生成一份首件检验清单。清单上列明哪些孔需要卡尺测量、哪些边缘需要打磨、哪些尺寸允差多少。打印完成后拿着清单逐项核对比凭感觉检查可靠得多。如果你的项目后续还会受力那更别急着直接上机先用PLA做尺寸验证再用ABS或尼龙打正式件成本低而且安全。这套从照片到零件的流程本质上是在教AI用工程语言表达视觉信息。只要能管好每个Agent的输出质量普通人也可以让“看不见的东西快速变成拿在手里的东西”。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询