从机器码到计算边界:AI大模型与Agent能力的真相

发布时间:2026/9/26 3:18:08
从机器码到计算边界:AI大模型与Agent能力的真相 前阵子看到一个访谈片段斯蒂芬·沃尔弗拉姆在被问到怎么看当前这波AI浪潮时笑着说了句“没有任何AI真正震撼我。”很多人的第一反应是“这人是不是对AI有什么误解”但你要是把这句话放在他四十年研究计算宇宙的背景里再去琢磨就会发现这不是嘴硬而是一套完整世界观的必然结论。沃尔弗拉姆是Mathematica之父、Wolfram Alpha的缔造者更是一个一直在试图用“计算”重新解释一切的人。他认为宇宙的底层不是粒子也不是弦而是类似元胞自动机的简单规则在机器码层面不断迭代AI也不例外。这篇文章想聊的就是这个机器码视角下AI的位置、计算边界在哪以及我们在日常选型、使用大模型、搭AI Agent时能不能借鉴这套思路少踩几个坑。这篇文章适合三类人一是被“AI万能论”包围、想搞清楚AI能力上限的产品经理和技术管理者二是正在学大模型、写AI工具提示词但总觉得结果忽好忽坏的开发者三是单纯对“计算到底能做到什么”感兴趣的人。全文没有数学公式堆砌只有一套能用来思考和做判断的框架。1. 一句“不震撼”背后的世界观计算宇宙与机器码1.1 为什么这个人的评价值得看沃尔弗拉姆不是普通的旁观者。他写过《一种新科学》花了十几年用计算机枚举大量元胞自动机规则他做的Wolfram Alpha让机器能直接理解人类世界的结构化数据他参与过大语言模型早期讨论写过《ChatGPT在做什么……为什么它能奏效》这类长文。换句话说他是少数既有理论高度、又有工程实践还把“计算”当成世界观核心的人。当他说“没有任何AI真正震撼我”潜台词是当前AI系统的底层在他看来仍然没有跳出“规则的有限演化”这个框架。你会对一台自动售货机感到震撼吗也许第一次见到会觉得新奇但一旦知道里面就是一堆弹簧和机械臂震撼感就会消失。沃尔弗拉姆对AI的态度就是这样——他承认这些系统功能强大但原理上不出他的预期。1.2 宇宙是机器码从元胞自动机说起要理解他的观点得先回到“宇宙机器码”这个概念。沃尔弗拉姆在元胞自动机研究中发现大量极其简单的规则能产生极其复杂的行为。最经典的是规则30一个细胞下一时刻的状态只取决于自己和左右邻居的状态总共就8种情况但迭代出来却是一幅看起来毫无秩序的复杂图案。这里的“机器码”不是说宇宙真有一个CPU在跑程序而是一种类比如果非要找出宇宙最底层的解释它可能不是一组微分方程而是一小段不断自我执行的规则。物理学定律只是这个规则的粗粒度涌现我们观察到的粒子、场、力都是局部规则在巨大时空尺度上运行后的投影。这种思路比传统的“万物皆程序”更激进。传统程序有清晰的输入、处理、输出但宇宙机器码更像一个无输入的系统每一拍的结果又成为下一拍的输入。普通软件工程师拿到这种“代码”会懵因为里面没有变量、没有函数调用只有纯粹的邻居关系和状态更新。1.3 为什么“没有AI真正震撼我”计算等价原理才是关键沃尔弗拉姆提出过一条“计算等价原理”只要有足够复杂的规则系统它们之间的计算能力本质上是等价的。你给一个大型语言模型足够长的上下文和推理步骤它能模拟一台元胞自动机反过来一个特定规则的元胞自动机如果规模足够大它也能模拟有限状态机甚至更多。区别只在执行速度和展现形式不在计算深度。这条原理直接把“AI是否震撼”拉到一个比较低的评价基准上。现在的AI大模型再强大做的事仍然是“根据上下文和参数预测下一个token”虽然预测精度高但依然是一个确定性的规则系统。它不是新物理不是新宇宙只是在计算等价这个层级里又出现了一个性能不错的实例。沃尔弗拉姆真正觉得震撼的东西是那些能突破“可预测、可约减”的系统比如他自己发现的规则30所代表的“计算不可约”现象。这点后面详细展开。2. 从机器码看AI大模型、AI Agent与计算边界2.1 大模型在计算宇宙里的真实位置如果我们把宇宙看成一堆规则在自动运行那么大模型就是在这些规则之上再叠加一层“模仿规则”。它学到的是互联网文本中的统计规律本质上是把人类历史上已经写成文字的计算过程压缩进神经网络参数里。当它回答你问题时它不是在调用某个确定的机器码程序而是在做数值逼近。这就导致一个边界大模型能处理的现象通常是那些“可以用语言和概率描述”的现象。一项工作如果能够被充分表达为文本规则、步骤、案例那么大模型就能把它做得很好。反过来那些无法用语言完整表达、需要不断与真实环境交互调整的物理操作大模型就只擅长“给建议”不擅长“给结果”。这个边界不是靠堆参数就能突破的因为语言本身的表达能力已经给普通训练集设了上限。我自己的体会是把大模型当成“人类知识的概率投影仪”比“超级智能体”更准确。它能给出一段非常合理的代码、一份结构完整的会议纪要但如果你问它一个现实中不存在于任何训练文本里的全新问题它的答案立刻会变得模棱两可。这不是它变笨了而是它的计算过程天然建立在已有数据分布上。2.2 AI Agent是“程序搜索”还是“规则演化”AI Agent最近很火。你给它一个目标它自己规划步骤、调用工具、观察结果、再调整。有人觉得这是“机器码层面的自我演化”但沃尔弗拉姆的框架提示我们Agent的行为仍然在一个可被描述的程序搜索空间里。简单说Agent是“用搜索引擎、代码执行器、外部API组合出一个流程程序”。它决定下一步执行什么靠的是大模型根据当前上下文做选择。这个选择本身又基于训练时的数据分布。所以Agent的天花板在于它能不能跳出训练数据隐含的“程序模板”发现一种真正不在任何人类文本中出现过的解决方案。目前看很难绝大多数Agent的成功案例都是把已知步骤拆得更细、执行得更准。不过这不代表Agent没用。在一个封闭问题空间里比如“用Python抓取网页并生成报告”Agent可以把原本需要一小时的手工操作变成10分钟自动执行。这就像一台规定动作做得很好的工业机器人它确实很棒但和“宇宙机器码里涌现出新规则”还是两回事。2.3 计算不可约性与AI预测能力的边界沃尔弗拉姆最让我喜欢的概念是“计算不可约性”。意思是有些系统你想知道它最终的结果唯一的办法就是把每一步都实际算完没有捷径。规则30就是一个典型例子。你说“再往下迭代1000步会是什么图案”我不能通过分析规则直接告诉你我只能老老实实跑1000步。这对AI意味着什么意味着当一个任务本身具有计算不可约性时任何AI模型都无法通过“快速推理”直接给出正确答案。它必须模拟、必须搜索、必须试错。现在的大模型在面对数学证明、复杂逻辑推演、多步规划时经常翻车根源就在这里。模型不是“不聪明”而是它总想用一个前馈过程去压缩一个本质上不可压缩的计算过程。所以当你要求AI做一件事时至少有两个问题要问这件事的计算复杂度是可约减的吗标准答案能描述成“模式匹配”吗如果答案是不可以那就别指望AI一步到位而是应该设计成“AI负责拆解人类负责判断外部环境负责反馈”的循环。3. 实操视角普通人如何用“计算边界”思维选型AI工具3.1 判断AI能力的三个维度现在市面上的AI产品叫人眼花缭乱。通用大模型、垂直领域小模型、本地部署模型、AI编程助手、AI Agent框架。与其看广告词不如用三把尺子量一量。第一把尺子叫“可替代性”这个任务能不能通过少量规则或者固定脚本完成比如把一段文字总结成要点这本质是信息提取大模型完全可以做。但像“根据一个模糊的商业目标设计完整产品方案”它没法只靠规则完成需要大量人工反馈。第二把尺子叫“反馈带宽”做错之后系统能不能快速从环境里获得明确信号写代码的反馈带宽很高——代码能跑就是能跑报错就是报错写文案的反馈带宽很低——没有客观标准用户喜不喜欢要等很久才知道。AI工具在“高反馈带宽”任务上表现普遍更好因为可以迭代优化。第三把尺子叫“不可约性”这件事是否存在一个比完整计算更短的捷径比如算圆周率第100万位看起来复杂但实际上有固定公式和算法属于可约减。但“判断一个创业想法在五年后是否会成功”就高度不可约因为涉及无数环境因素的逐步演化。AI对这类问题只能给概率参考不能给确定性结论。日常选型时我会优先找“反馈带宽高”的场景先上线AI把“不可约性高”的场景留给人机协同。这样最容易出成果也最不容易产生“AI不过如此”的挫败感。3.2 本地部署、AI编程和对话产品怎么选本地部署大模型最近讨论很多。从计算边界看本地部署的价值不只是数据隐私还在于“规则空间可定制”。云端模型你只能通过提示词调整行为本地模型你可以改解码参数、改系统提示词、甚至微调权重等于你拿到了规则的一部分控制权。如果你的任务是敏感数据处理或者需要完全离线运行那本地部署几乎是唯一选择。常见的配置建议很简单7B到14B参数模型用16GB以上显存的消费级显卡就能跑得动70B以上参数至少需要48GB左右显存或者用多卡并行。给一个我踩过坑后的经验别只看参数量要看量化后的实际显存占用。7B模型用4bit量化大约需要6GB14B模型需要10GB32B模型需要20GB左右先按这个估算再选硬件。AI编程工具的选择也能套用计算边界理论。像GitHub Copilot、Cursor这类工具最适合干的事是“填补已知模板和重复代码”。你让它生成一个HTTP接口、写一个排序函数、补一段单元测试它非常利索。但你让它“帮我把整个系统的架构重构一遍并保证老接口完全兼容”时它往往会给出一个看起来合理但漏洞百出的方案。因为重构中存在大量不可约的上下文依赖模型没法算尽。3.3 建立自己的“AI计算边界测试集”被人问多了“哪个AI好用”我现在会给一个奇怪的答案别问哪个AI好先建一组测试集测出每个工具的边界。我的测试集大概五个问题第一个是“事实性连接题”让AI把三个看似无关的领域概念连接起来看它会不会一本正经地编造关系。第二个是“长链条逻辑题”比如“有五个开关控制三盏灯给你两次机会进房间判断开关与灯的对应关系”看它能不能保持推理一致。第三个是“固定规则模拟题”让AI按某种严格规则生成一组数据比如“生成100个满足递增且差值互不相同的数据”看它是否真的理解规则。第四个是“自我矛盾检测题”给它一段前后矛盾的文本让它找出问题并解释。第五个是“不可约步骤题”让它逐步演算一个规则比较复杂的序列看它是否愿意老老实实算而不是偷懒给结论。你会发现同一个模型在这五个题上的表现差异很大。有的模型对话能力强但长逻辑容易崩有的模型逻辑严谨但创造力不足。没有全能的模型只有“适合某种边界”的模型。选型过程就是拿你的核心任务去试边界而不是被发布会宣传带着跑。4. 数据、规则与“机器码”从理论到可复现的思考实验4.1 用30行代码看“规则创造复杂性”与其空谈机器码不如动手做一个最经典的思考实验用Python模拟规则30。你只需要一个一维数组每个格子的状态是0或1每次迭代根据邻居状态更新。这里我直接给一份可以跑的代码。import numpy as np import matplotlib.pyplot as plt def rule30(width, steps): cells np.zeros(width, dtypeint) cells[width // 2] 1 grid [cells.copy()] for _ in range(steps): new np.zeros(width, dtypeint) padded np.concatenate([[cells[-1]], cells, [cells[0]]]) for i in range(1, width 1): left, center, right padded[i-1], padded[i], padded[i1] # 规则30left XOR (center OR right) new[i-1] 1 if (left ^ (center or right)) else 0 cells new grid.append(cells.copy()) return np.array(grid) grid rule30(101, 100) plt.figure(figsize(10, 8)) plt.imshow(grid, cmapgray_r, interpolationnearest) plt.axis(off) plt.title(Rule 30: a tiny machine code produces chaos) plt.show()这个代码逻辑很简单中心先放一个1然后围绕它的邻居关系不断更新。运行后你会看到从中间一列1开始左右两侧逐步长出复杂的三角形纹理完全不像是由8行规则产生的。这让我第一次理解什么叫“简单规则带来复杂行为”。你看不到程序里的函数调用也看不到设计者的意图但复杂模式自己涌现了。4.2 规则空间搜索计算等价性的直观体验接下来可以做的实验是“枚举所有一维元胞自动机规则”。规则30只是256种可能规则每种邻居组合对应0或1共2的8次方之一。你可以写一段循环把100多条规则都跑一遍观察它们的图案。一定会发现有的是纯色有条纹有分形有混沌。但你同时也会发现很多看起来完全不同的规则最后生成的图案在统计特征上差不多。这就是计算等价原理的经验基础——在足够大的规则空间里复杂度的峰值其实被大量规则共享。不存在某条“超级规则”能一直产生无限不重复的新结构大部分高复杂度规则最终都收敛到“看起来都是碎花”的类别。思考一下这个概念对AI的启发。每个大模型都可以看作一个在高维空间里的确定性规则系统。你给它一段文本它输出下一段再输出下一段整个过程就是规则迭代。如果你换成另一个模型只要训练数据足够像最终输出的文本统计结构也非常接近。它们之间的差异远小于它们与“纯随机文本”的差异。这其实在暗示AI找到一个“好规则”不难难的是找到“真正不同于其他规则的好规则”。4.3 把思考实验变成日常判断工具规则30带来的不只是一幅好看的图它还能当日常工具。比如你在做数据预测时拿“是否可以用规则捕捉”作为判断标准。如果数据背后隐含的规则是固定的比如电商平台成交量受季节、价格、流量影响这些可以用统计模型和AI做预测。但如果你预测的是某个网名连续发帖的下一句话哪怕让你拿到他所有历史帖子也未必能准确预判因为人类行为的上下文太复杂可能等效于一个计算不可约系统。这个思考方式帮我避免了很多“数据迷信”。每当我看到一个看起来很准的AI预测Demo我都会想一想它的预测问题是不是一个“低复杂度规则”就能解释的如果是那这份预测能力在换个场景、换个数据分布后可能立刻失效。判断AI能力边界时我会刻意提醒自己一些当下看起来惊艳的结果可能只是规则空间里一个很窄的甜区而不是通用能力的体现。5. 我踩过的坑从“震撼感”到“看见规则”5.1 别把AI聊天当成意识对话我最早用AI聊天工具时也有过“这玩意儿是不是有一点灵性”的瞬间。但后来做了几组控制实验彻底清醒了。把同一个问题换几种说法AI会给出大相径庭的答案把问题里的主语换成另一个无关对象逻辑结构完全不变。这就说明模型只是在跟着上下文做概率展开不存在一个稳定的“自我”在理解对话。有个特别容易踩的坑用户觉得AI语气亲切、回答流畅就认为它“懂我”。实际上流畅感来源于训练数据里大量问答对它模仿了被很多人认为是“贴心”的话语模式。这有点像剧本杀里的NPC设定文本里有一万种应对方式但背后没有一以贯之的人格。所以我现在的态度是把AI聊天当“超强文本搭档”不当“灵魂伴侣”。这样既不会失望也能更客观利用它整理思绪。5.2 AI编程为什么总在长任务上翻车AI编程刚火的时候我在一个中型项目里试过让AI从零生成一个完整模块。前50行代码非常惊艳函数命名规范、逻辑清晰。但一旦这个模块要和现有系统的几个老接口对接AI就开始“左右互搏”今天生成的函数签名明天就忘为了满足一个测试用例会悄悄引入一个不存在的依赖。这类问题的根源还是计算不可约性。真实项目的状态空间非常庞大每次改动都会引入新的上下文AI无法靠预训练的权重把整个状态算完。我给你一个可参照的用法把AI当成“高级结对程序员”不是“独立架构师”。每次请它完成一个几百行以内的、接口定义清楚的功能它很稳。一旦任务扩大到需要跨多个文件修改、还要考虑历史遗留代码时就一定要把任务拆成多个子任务每完成一个马上人工review。你甚至可以给它设定“禁止修改其他文件”的约束这样它的行为边界清晰很多。5.3 实用建议保持“不被震撼”的清醒踩过几次坑我最大的收获不是“AI不好用”而是“AI被夸大的地方正好是它最不该被依赖的地方”。现在看到任何AI演示我都会按下面这套习惯做三件事。第一看演示是否筛过题。如果一个Demo只展示成功案例、不展示失败案例甚至同一问题跑十次只放最好的那次那这个AI边界一定比演示窄很多。第二看任务反馈是否可验证。如果输出没有自动检查机制AI很容易编造一个看起来合理的答案。所以凡是能写成单元测试、能跑命令行验证的任务都让AI先跑一遍再交付。第三看问题是否属于“高不可约性”。越复杂、越依赖大量环境细节的决策越应该把AI当参考而不是当裁判。最后分享一个小技巧我给自己设了一个“不震撼清单”。每次接触新AI工具先写下三个它可能翻车的场景再测一测。如果它在这些场景下确实翻车了那我对它的能力印象就会变准确后面的使用也会更高效。这套方法比听任何一个专家的评价都管用。毕竟理解边界的最好方式不是崇拜某个说法而是亲眼看到规则在边界处失效的样子。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询