旗下矩阵

  • 投资界
  • 天天IPO
  • 解码LP
  • 并购
  • 前哨
  • 投资界AI

AI的下一刀,会砍向仿真和工业设计吗?来EngiWorld实测见分晓。

知满科技联合多机构推出EngiWorld平台,设六大工程领域1301项任务,检验AI智能体工程设计能力,为工业AI实战检验提供基准。
·投资界综合

写代码、修 Bug、一句话生成App,AI 已经全流程接手了软件开发的任务,颠覆了传统的工作流程。SWE-bench 等评测,持续检验着大模型在真实代码工作中的表现。而结论就是,模型一代更比一代强。

而下一个会被 AI 全程接管的行业是什么,成为了很多人关注的话题。会是工业设计和仿真吗?CAD 里的零件设计、EDA 里的电路设计、CAE 里的仿真验证等工作,距离 AI 接管还有多远?

答案,还暂时无法从编程榜单上看出来。因为要看真本事,就得让 AI 操作工业软件,在真实环境里,完成真实工程任务,真刀真枪地来检验能力是否过关。

而EngiWorld,正是为这场实战检验所搭建的“工业设计练兵场”。

EngiWorld:把工业软件变成LLM的实战训练场

来自知满科技团队的 EngiWorld,是面向专业工程软件的智能体评测平台与任务基准,由知满科技与清华大学、重庆大学、中国科学院大学、北京大学等机构的研究者共同提出。它把工程任务、软件运行环境和成果验收机制组织在一起,检验前沿模型驱动的智能体能交付什么。

这个“工业练兵场”配备软件环境、任务与验收条件。智能体接收设计要求,实际操作软件,提交成果后接受检查。

平台收录 1,301 个任务,覆盖 计算机辅助设计(CAD)、工程分析与仿真(CAE)、计算机辅助制造(CAM)、建筑信息建模(BIM)、电子设计自动化(EDA)和三维可视化六个工程领域,涉及 26 个专业软件平台与工作台,包括 AutoCAD、SolidWorks、ANSYS、Abaqus、KiCad、Revit、Blender 等。

这些任务既有看图还原结构、选择合适软件、完成单软件操作,也有达到量化设计目标、跨软件协作,以及自主选择工具和执行路线。它们共同回答一个问题:面对具体工程要求,智能体能把事情做到哪一步?

有题可做,有软件可用,也有结果可查

EngiWorld 首先提供可执行的工程任务。任务由专家主导、AI 辅助构建,配有要求、初始文件、参考成果和验收程序,并在指定环境中执行与审查。模型要面对明确的尺寸、连接关系或设计目标。

其次,它提供真实的软件操作环境。任务在 Windows 或 Ubuntu 的独立环境中运行,覆盖 610 个图形界面任务和 691 个命令行任务。智能体可以观察屏幕、点击输入,也可以编写脚本、调用工具并读取反馈。

最后,它检查实际交付成果。任务结束后,验收程序重新打开提交的文件,提取几何、物理或结构属性:零件的尺寸和实体是否有效,电路是否正确连接,仿真的材料、载荷与结果是否符合要求。跨软件任务还要检查中间文件和前后阶段的一致性。

量化设计任务则先检查硬性约束,再评价设计质量。开发者因此能同时观察“做没做成”和“合格之后做得怎么样”。

有了这套环境,开发者就能检验:模型、规划、记忆或纠错策略的改进,是否带来了更可靠的工程成果。

AI 的实战科目考题

先看几个通过任务验收的例子。

在 AutoCAD 中,智能体完成了一张包含 23 个交错管孔的管板图,并导出 DXF。验收关注具体孔位与几何要求,让“画出来了”有了可检查的依据。

在 KiCad 中,智能体完成 MCU 与 SRAM 之间的数据线连接,并通过相应电气规则检查。这里考的既是软件操作,也是电路连接是否真正符合任务要求。

在 SolidWorks 中,智能体调整滑块位置,再导出保留两个独立实体的 STEP 文件。模型外观之外,导出结果中的实体结构同样要过关。

在 Blender 中,智能体完成贴图烘焙、打包并保存场景,通过相应任务的成果验收。平台的检验范围也由零件与电路,延伸到三维可视化成果。

平台还可以衡量设计优化。在一个 KiCad 布局任务中,Gemini 3.7 Flash 将布线路径从约 53.16 毫米缩短到 40.17 毫米,同时满足四个可移动元件的位置与最小间距要求,最终获得 0.982 的任务分数。

这些案例展示了 EngiWorld 的用途:把“AI 好像会设计”拆解为能够复查的动作、约束与结果。

再把任务往前推一步:设计一块带有 10 个散热鳍片的板,先在 AutoCAD 中绘图,再用 SolidWorks 建模,最后进入 Abaqus 做热分析。

每个阶段都有明确目标,但它们需要连续成立。前一步输出的模型,必须成为后一步可用的输入。

研究记录中的一次执行,就卡在了这里。导入模型时发生比例错误;智能体一度修正单位,但软件崩溃、重新导入后,错误再次出现。后续网格划分反复受阻,直到达到 300 轮决策上限,也没有产出完成求解的热分析结果。

单看某一步操作,很难看出整个流程为什么失败。把任务从头跑到尾,再检查中间与最终成果,才能定位问题:尺寸与单位有没有保持一致?恢复软件之后,有没有重新核对关键条件?

在主实验的 24 个跨软件任务中,七个模型共尝试 168 次,只有 6 次成功,约占 3.6%。Claude Opus 5 在单软件任务上的得分为 50.3,到了跨软件任务则降至 8.3。这个结果说明,在本次设置下,跨软件工程交付仍是明显的难点。它也把后续改进的目标,具体到了每一次模型传递、错误恢复和结果复核。

七大主流模型同场实测,能力实战见分晓

知满科技的研究团队从完整任务集中分层抽取同一组 300 个任务,包含 152 个命令行任务和 148 个图形界面任务,对七个模型进行评测。每次执行都从干净的环境快照开始,模型接收相同的任务描述和工具说明,使不同模型的表现能够在统一条件下比较。

最高综合 EngiScore 为 44.3/100。在这 300 个任务中,有 128 个任务让七个模型全部得零分,约占 42.7%。

EngiScore 是综合得分:普通任务须满足全部验收条件,量化设计任务还计入设计质量,所有任务等权汇总到 0—100 分。因此,44.3 分不能理解为 44.3% 的任务成功率。

操作方式同样影响表现。DeepSeek V4.1 Flash 的命令行得分为 48.3,图形界面得分则为 2.0。两类任务的分布不同,不能把差距全部归因于界面,但这提示开发者:选择工程智能体,还需要看它将以什么方式操作软件。

更值得警惕的是,成果没有通过验收,模型却可能已经宣布“完成”。在研究纳入分析的主实验失败记录中,GPT-5.6 Sol 有 87.0% 以“已完成”信号结束,Claude Opus 5 的这一比例为 73.9%。这两个比例统计的是相应模型的已分析失败记录,并非全部任务。

这也解释了 EngiWorld 为什么要重新打开文件、逐项检查结果:智能体说“完成了”,还需要成果本身来证明。

这些结果回答的是给定任务、工具和执行预算下的表现。零分也需要结合记录解读,例如文件表示或结构与验收器要求不匹配,就可能影响结果。通过任务验收,同样不等于完成实际生产环境中的全部验证。

多给信息、多花预算,AI 就能做得更好吗?

EngiWorld 的用途还包括检验改进方案。研究团队调整参考图的呈现方式、运行时看图能力、界面辅助信息、截图分辨率和历史对话长度,观察这些变化是否改善最终成果。

有的改动效果明显:在相应的图形界面消融实验中,将参考图直接放进任务消息,GPT-5.6 Sol 的得分从 15.0 提升到 31.7。让模型更容易获得关键信息,能够影响任务结果。

但更多信息并不总能换来更好的成果。加入界面可访问性信息后,三个模型都减少了决策轮数,API 成本却增加了 50.7%—147.9%,成果得分也没有一致提升。Kimi K3 将历史窗口从 10 轮扩展到 15 轮时,得分下降,成本反而增加了 53.0%。这些数字来自各自的消融设置,不能与主实验得分直接混比。

对于工程 Agent 开发者,这类实验让优化有了具体依据:参考图应该怎样提供,历史信息应该保留多少,额外的工具反馈是否值得成本,都可以放进同一套任务与验收流程中检验。平台因此既能衡量当前能力,也能帮助判断下一步该改哪里。

距离颠覆,还有多远?

工业设计和仿真会不会迎来像 AI 编程一样的变化?这个领域是否即将迎来它的“chatGPT时刻”?EngiWorld 没有给这个问题设定倒计时。它提供的是一种把讨论落到实处的方法。

对模型研究者,可以比较智能体在不同软件、任务和交互方式下的表现;对工程 Agent 开发者,可以检验新的规划、记忆与纠错策略;对关注工业 AI 的读者,可以从可检查的案例和结果中,判断能力已经走到哪里。

与其只问“AI 什么时候接管 CAD、EDA、CAE”,不如先让它打开软件,完成设计,再把结果交出来。

知满科技推出EngiWorld 的价值在于,让智能体的能力进步能够通过具体的工程成果加以检验。


项目主页提供任务与演示,代码和环境镜像为进一步开展评测提供入口。

【本文经授权发布,不代表投资界立场。本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。