【Agent系列 (一) 】初识智能体

发布时间:2026/10/2 13:55:06
【Agent系列 (一) 】初识智能体 ⭐️在这个怀疑的年代我们依然需要信仰。个人主页 YYYing.⭐️Agent系列专栏从零开始的agent学习系列下期内容暂无前言欢迎来到智能体的世界在人工智能浪潮席卷全球的今天智能体Agent已成为驱动技术变革与应用创新的核心概念之一。无论你只是想当一个普通的开发者还是励志成为AI领域的研究者还是希望深刻理解技术前沿的观察者从而掌握智能体的本质智能体Agent都将是你知识体系中不可或缺的一环。1、什么是智能体在探索任何一个复杂概念时我们最好从一个简洁的定义开始。在人工智能领域智能体被定义为任何能够通过传感器Sensors感知其所处环境Environment并自主地通过执行器Actuators采取行动Action以达成特定目标的实体。这个定义包含了智能体存在的四个基本要素。环境是智能体所处的外部世界。对于自动驾驶汽车环境是动态变化的道路交通对于一个交易算法环境则是瞬息万变的金融市场。智能体并非与环境隔离它通过其传感器持续地感知环境状态。摄像头、麦克风、雷达或各类应用程序编程接口Application Programming Interface, API返回的数据流都是其感知能力的延伸。获取信息后智能体需要采取行动来对环境施加影响它通过执行器来改变环境的状态。执行器可以是物理设备如机械臂、方向盘或虚拟工具如执行一段代码、调用一个服务。然而真正赋予智能体智能的是其自主性Autonomy。智能体并非只是被动响应外部刺激或严格执行预设指令的程序它能够基于其感知和内部状态进行独立决策以达成其设计目标。这种从感知到行动的闭环构成了所有智能体行为的基础如图 1.1 所示。1.1 传统视角下的智能体在当前大语言模型Large Language Model, LLM的热潮出现之前人工智能的先驱们已经对“智能体”这一概念进行了数十年的探索与构建。这些如今我们称之为“传统智能体”的范式并非单一的静态概念而是经历了一条从简单到复杂、从被动反应到主动学习的清晰演进路线。这个演进的起点是那些结构最简单的反射智能体Simple Reflex Agent。它们的决策核心由工程师明确设计的“条件-动作”规则构成如图 1.2 所示。经典的自动恒温器便是如此若传感器感知的室温高于设定值则启动制冷系统。这种智能体完全依赖于当前的感知输入不具备记忆或预测能力。它像一种数字化的本能可靠且高效但也因此无法应对需要理解上下文的复杂任务。它的局限性引出了一个关键问题如果环境的当前状态不足以作为决策的全部依据智能体该怎么办​图 1.2 简单反射智能体的决策逻辑示意图为了回答这个问题研究者们引入了“状态”的概念发展出基于模型的反射智能体Model-Based Reflex Agent。这类智能体拥有一个内部的世界模型World Model用于追踪和理解环境中那些无法被直接感知的方面。它试图回答“世界现在是什么样子的”。例如一辆在隧道中行驶的自动驾驶汽车即便摄像头暂时无法感知到前方的车辆它的内部模型依然会维持对那辆车存在、速度和预估位置的判断。这个内部模型让智能体拥有了初级的“记忆”使其决策不再仅仅依赖于瞬时感知而是基于一个更连贯、更完整的世界状态理解。然而仅仅理解世界还不够智能体需要有明确的目标。这促进了基于目标的智能体Goal-Based Agent的发展。与前两者不同它的行为不再是被动地对环境做出反应而是主动地、有预见性地选择能够导向某个特定未来状态的行动。这类智能体需要回答的问题是“我应该做什么才能达成目标”。经典的例子是 GPS 导航系统你的目标是到达公司智能体会基于地图数据世界模型通过搜索算法如 A*算法来规划Planning出一条最优路径。这类智能体的核心能力体现在了对未来的考量与规划上。更进一步现实世界的目标往往不是单一的。我们不仅希望到达公司还希望时间最短、路程最省油并且避开拥堵。当多个目标需要权衡时基于效用的智能体Utility-Based Agent便随之出现。它为每一个可能的世界状态都赋予一个效用值这个值代表了满意度的高低。智能体的核心目标不再是简单地达成某个特定状态而是最大化期望效用。它需要回答一个更复杂的问题“哪种行为能为我带来最满意的结果”。这种架构让智能体学会在相互冲突的目标之间进行权衡使其决策更接近人类的理性选择。至此我们讨论的智能体虽然功能日益复杂但其核心决策逻辑无论是规则、模型还是效用函数依然依赖于人类设计师的先验知识。如果智能体能不依赖预设而是通过与环境的互动自主学习呢这便是学习型智能体Learning Agent的核心思想而强化学习Reinforcement Learning, RL是实现这一思想最具代表性的路径。一个学习型智能体包含一个性能元件即我们前面讨论的各类智能体和一个学习元件。学习元件通过观察性能元件在环境中的行动所带来的结果来不断修正性能元件的决策策略。想象一个学习下棋的 AI。它开始时可能只是随机落子当它最终赢下一局时系统会给予它一个正向的奖励。通过大量的自我对弈学习元件会逐渐发现哪些棋路更有可能导向最终的胜利。AlphaGo Zero 是这一理念的一个里程碑式的成就。它在围棋这一复杂博弈中通过强化学习发现了许多超越人类既有知识的有效策略。从简单的恒温器到拥有内部模型的汽车再到能够规划路线的导航、懂得权衡利弊的决策者最终到可以通过经验自我进化的学习者。这条演进之路展示了传统人工智能在构建机器智能的道路上所经历的发展脉络。它们为我们今天理解更前沿的智能体范式打下了坚实而必要的基础。1.2 大语言模型驱动的新范式以GPTGenerative Pre-trained Transformer为代表的大语言模型的出现正在显著改变智能体的构建方法与能力边界。由大语言模型驱动的 LLM 智能体其核心决策机制与传统智能体存在本质区别从而赋予了其一系列全新的特性。这种转变可以从两者在核心引擎、知识来源、交互方式等多个维度的对比中清晰地看出如表 1.1 所示。简而言之传统智能体的能力源于工程师的显式编程与知识构建其行为模式是确定且有边界的而 LLM 智能体则通过在海量数据上的预训练获得了隐式的世界模型与强大的涌现能力使其能够以更灵活、更通用的方式应对复杂任务。表 1.1 传统智能体与 LLM 驱动智能体的核心对比​这种差异使得 LLM 智能体可以直接处理高层级、模糊且充满上下文信息的自然语言指令。让我们以一个“智能旅行助手”为例来说明。在 LLM 智能体出现之前规划旅行通常意味着用户需要在多个专用应用如天气、地图、预订网站之间手动切换并由用户自己扮演信息整合与决策的角色。而一个 LLM 智能体则能将这个流程整合起来。当接收到“规划一次厦门之旅”这样的模糊指令时它的工作方式体现了以下几点规划与推理智能体首先会将这个高层级目标分解为一系列逻辑子任务例如[确认出行偏好] - [查询目的地信息] - [制定行程草案] - [预订票务住宿]。这是一个内在的、由模型驱动的规划过程。工具使用在执行规划时智能体识别到信息缺口会主动调用外部工具来补全。例如它会调用天气查询接口获取实时天气并基于“预报有雨”这一信息在后续规划中倾向于推荐室内活动。动态修正在交互过程中智能体会将用户的反馈如“这家酒店超出预算”视为新的约束并据此调整后续的行动重新搜索并推荐符合新要求的选项。整个“查天气 → 调行程 → 订酒店”的流程展现了其根据上下文动态修正自身行为的能力。总而言之我们正从开发专用自动化工具转向构建能自主解决问题的系统。核心不再是编写代码而是引导一个通用的“大脑”去规划、行动和学习。1.3 智能体的类型继上文回顾智能体的演进后本节将从三个互补的维度对智能体进行分类。1基于内部决策架构的分类第一种分类维度是依据智能体内部决策架构的复杂程度这个视角在《Artificial Intelligence: A Modern Approach》中系统性地提出[1]。正如 1.1.1 节所述传统智能体的演进路径本身就构成了最经典的分类阶梯它涵盖了从简单的反应式智能体到引入内部模型的模型式智能体再到更具前瞻性的基于目标和基于效用的智能体。此外学习能力则是一种可赋予上述所有类型的元能力使其能通过经验自我改进。2基于时间与反应性的分类除了内部架构的复杂性还可以从智能体处理决策的时间维度进行分类。这个视角关注智能体是在接收到信息后立即行动还是会经过深思熟虑的规划再行动。这揭示了智能体设计中一个核心权衡追求速度的反应性Reactivity与追求最优解的规划性Deliberation之间的平衡如图 1.3 所示。​图 1.3 智能体决策时间与质量关系图反应式智能体 (Reactive Agents)这类智能体对环境刺激做出近乎即时的响应决策延迟极低。它们通常遵循从感知到行动的直接映射不进行或只进行极少的未来规划。上文的简单反应式和基于模型的智能体都属于此类别。其核心优势在于速度快、计算开销低这在需要快速决策的动态环境中至关重要。例如车辆的安全气囊系统必须在碰撞发生的毫秒内做出反应任何延迟都可能导致严重后果同样高频交易机器人也必须依赖反应式决策来捕捉稍纵即逝的市场机会。然而这种速度的代价是“短视”由于缺乏长远规划反应式智能体容易陷入局部最优难以完成需要多步骤协调的复杂任务。规划式智能体(Deliberative Agents)与反应式智能体相对规划式或称审议式智能体在行动前会进行复杂的思考和规划。它们不会立即对感知做出反应而是会先利用其内部的世界模型系统地探索未来的各种可能性评估不同行动序列的后果以期找到一条能够达成目标的最佳路径 。基于目标和基于效用的智能体是典型的规划式智能体。可以将其决策过程类比为一位棋手。他不会只看眼前的一步而是会预想对手可能的应对并规划出后续几步甚至十几步的棋路。这种深思熟虑的能力使其能够处理复杂的、需要长远眼光的任务例如制定一份商业计划或规划一次长途旅行。它们的优势在于决策的战略性和远见。然而这种优势的另一面是高昂的时间和计算成本。在瞬息万变的环境中当规划式智能体还在深思熟虑时采取行动的最佳时机可能早已过去。混合式智能体(Hybrid Agents)现实世界的复杂任务往往既需要即时反应也需要长远规划。例如我们之前提到的智能旅行助手既要能根据用户的即时反馈如“这家酒店太贵了”调整推荐反应性又要能规划出为期数天的完整旅行方案规划性。因此混合式智能体应运而生它旨在结合两者的优点实现反应与规划的平衡。一种经典的混合架构是分层设计底层是一个快速的反应模块处理紧急情况和基本动作高层则是一个审慎的规划模块负责制定长远目标。而现代的 LLM 智能体则展现了一种更灵活的混合模式。它们通常在一个“思考-行动-观察”的循环中运作巧妙地将两种模式融为一体规划(Reasoning)在“思考”阶段LLM 分析当前状况规划出下一步的合理行动。这是一个审议过程。反应(Acting Observing)在“行动”和“观察”阶段智能体与外部工具或环境交互并立即获得反馈。这是一个反应过程。通过这种方式智能体将一个需要长远规划的宏大任务分解为一系列“规划-反应”的微循环。这使其既能灵活应对环境的即时变化又能通过连贯的步骤最终完成复杂的长期目标。3基于知识表示的分类这是一个更根本的分类维度它探究智能体用以决策的知识究竟是以何种形式存于其“思想”之中。这个问题是人工智能领域一场持续半个多世纪的辩论核心并塑造了两种截然不同的 AI 文化。亚符号主义 AISub-symbolic AI亚符号主义或称连接主义认为知识并非显式的规则而是内隐地分布在一个由大量神经元组成的复杂网络中是从海量数据中学习到的统计模式。神经网络和深度学习是其代表。如图 1.4 左侧所示亚符号主义 AI 就像一个牙牙学语的孩童。他不是通过学习“猫有四条腿、毛茸茸、会喵喵叫”这样的规则来认识猫的而是在看过成千上万张猫的图片后大脑中的神经网络能辨识出“猫”这个概念的视觉模式。这种方法的强大之处在于其模式识别能力和对噪声数据的鲁棒性。它能够轻松处理图像、声音等非结构化数据而这类任务对于依赖明确规则的系统往往非常困难。然而这种强大的直觉能力也伴随着不透明性。亚符号主义系统通常被视为一个黑箱Black Box。它能以惊人的准确率识别出图片中的猫但你若问它“为什么你认为这是猫”它很可能无法给出一个合乎逻辑的解释。此外它在纯粹的逻辑推理任务上表现不佳有时会产生看似合理却事实错误的幻觉。符号主义 AISymbolic AI与亚符号主义不同符号主义常被称为传统人工智能其核心信念是智能源于对符号的逻辑操作。这里的符号是人类可读的实体如词语、概念操作则遵循严格的逻辑规则如图 1.4 中间所示。这好比一位一丝不苟的图书管理员将世界知识整理为清晰的规则库和知识图谱。其主要优势在于透明和可解释。由于推理步骤明确其决策过程可以被完整追溯这在金融、医疗等高风险领域至关重要。然而其“阿喀琉斯之踵”在于脆弱性它依赖于一个完备的规则体系但在充满模糊和例外的现实世界中任何未被覆盖的新情况都可能导致系统失灵这就是所谓的“知识获取瓶颈”。神经符号主义 AINeuro-Symbolic AI长久以来亚符号主义和符号主义这两大阵营如同两条平行线各自发展。为克服上述两种范式的局限一种“大和解”的思想开始兴起这就是神经符号主义 AI也称神经符号混合主义。它的目标是融合两大范式的优点创造出一个既能像神经网络一样从数据中学习又能像符号系统一样进行逻辑推理的混合智能体。换言之它试图将亚符号主义擅长的模式识别与符号主义擅长的逻辑推理结合起来。诺贝尔经济学奖得主丹尼尔·卡尼曼Daniel Kahneman在其著作《思考快与慢》Thinking, Fast and Slow中提出的双系统理论为我们理解神经符号主义提供了一个绝佳的类比[2]。按照图 1.4 从左到右的展示顺序这种对应关系可以概括为系统 1是快速、凭直觉、并行的思维模式类似于亚符号主义 AI 强大的模式识别能力。系统 2是缓慢、有条理、基于逻辑的审慎思维恰如符号主义 AI 的推理过程。神经符号主义 AI则将系统 1 的模式识别与系统 2 的逻辑推理结合起来使二者协同工作。​图 1.4 亚符号主义、符号主义与神经符号混合主义的知识表示范式人类的智能正源于这两个系统的协同工作。同样一个真正鲁棒的 AI也需要兼具二者之长。大语言模型驱动的智能体是神经符号主义的一个极佳实践范例其内核是一个巨大的神经网络使其具备模式识别和语言生成能力在工作过程中它又会生成一系列结构化的中间步骤如思想、计划或 API 调用这些都是明确的、可操作的符号。通过这种方式它将基于神经网络的模式识别与基于符号的逻辑推理结合起来。2、智能体的构成与运行原理2.1 任务环境定义要理解智能体的运作我们必须先理解它所处的任务环境。在人工智能领域通常使用PEAS 模型来精确描述一个任务环境即分析其性能度量(Performance)、环境(Environment)、执行器(Actuators)和传感器(Sensors)。以上文提到的智能旅行助手为例下表 1.2 展示了如何运用 PEAS 模型对其任务环境进行规约。表 1.2 智能旅行助手的 PEAS 描述​在实践中LLM 智能体所处的数字环境展现出若干复杂特性这些特性直接影响着智能体的设计。首先环境通常是部分可观察的。例如旅行助手在查询航班时无法一次性获取所有航空公司的全部实时座位信息。它只能通过调用航班预订 API看到该 API 返回的部分数据这就要求智能体必须具备记忆记住已查询过的航线和探索尝试不同的查询日期的能力。其次行动的结果也并非总是确定的。根据结果的可预测性环境可分为确定性和随机性。旅行助手的任务环境就是典型的随机性环境。当它搜索票价时两次相邻的调用返回的机票价格和余票数量都可能不同这就要求智能体必须具备处理不确定性、监控变化并及时决策的能力。此外环境中还可能存在其他行动者从而形成多智能体(Multi-agent)环境。对于旅行助手而言其他用户的预订行为、其他自动化脚本甚至航司的动态调价系统都是环境中的其他“智能体”。它们的行动例如订走最后一张特价票会直接改变旅行助手所处环境的状态这对智能体的快速响应和策略选择提出了更高要求。最后几乎所有任务都发生在序贯且动态的环境中。“序贯”意味着当前动作会影响未来而“动态”则意味着环境自身可能在智能体决策时发生变化。这就要求智能体的“感知-思考-行动-观察”循环必须能够快速、灵活地适应持续变化的世界。2.2 智能体的运行机制在定义了智能体所处的任务环境后我们来探讨其核心的运行机制。智能体并非一次性完成任务而是通过一个持续的循环与环境进行交互这个核心机制被称为智能体循环 (Agent Loop)。如图 1.5 所示该循环描述了智能体与环境之间的动态交互过程构成了其自主行为的基础。​图 1.5 智能体与环境交互的基本循环这个循环主要包含以下几个相互关联的阶段感知 (Perception)这是循环的起点。智能体通过其传感器例如API 的监听端口、用户输入接口接收来自环境的输入信息。这些信息即观察 (Observation)既可以是用户的初始指令也可以是上一步行动所导致的环境状态变化反馈。思考 (Thought)接收到观察信息后智能体进入其核心决策阶段。对于 LLM 智能体而言这通常是由大语言模型驱动的内部推理过程。如图所示“思考”阶段可进一步细分为两个关键环节规划 (Planning)智能体基于当前的观察和其内部记忆更新对任务和环境的理解并制定或调整一个行动计划。这可能涉及将复杂目标分解为一系列更具体的子任务。工具选择 (Tool Selection)根据当前计划智能体从其可用的工具库中选择最适合执行下一步骤的工具并确定调用该工具所需的具体参数。行动 (Action)决策完成后智能体通过其执行器Actuators执行具体的行动。这通常表现为调用一个选定的工具如代码解释器、搜索引擎 API从而对环境施加影响意图改变环境的状态。行动并非循环的终点。智能体的行动会引起环境 (Environment)的状态变化 (State Change)环境随即会产生一个新的观察 (Observation)作为结果反馈。这个新的观察又会在下一轮循环中被智能体的感知系统捕获形成一个持续的“感知-思考-行动-观察”的闭环。智能体正是通过不断重复这一循环逐步推进任务从初始状态向目标状态演进。2.3 智能体的感知与行动在工程实践中为了让 LLM 能够有效驱动这个循环我们需要一套明确的交互协议 (Interaction Protocol)来规范其与环境之间的信息交换。在许多现代智能体框架中这一协议体现在对智能体每一次输出的结构化定义上。智能体的输出不再是单一的自然语言回复而是一段遵循特定格式的文本其中明确地展示了其内部的推理过程与最终决策。这个结构通常包含两个核心部分Thought (思考)这是智能体内部决策的“快照”。它以自然语言形式阐述了智能体如何分析当前情境、回顾上一步的观察结果、进行自我反思与问题分解并最终规划出下一步的具体行动。Action (行动)这是智能体基于思考后决定对环境施加的具体操作通常以函数调用的形式表示。例如一个正在规划旅行的智能体可能会生成如下格式化的输出Thought: 用户想知道北京的天气。我需要调用天气查询工具。 Action: get_weather(北京) Copy to clipboardErrorCopied这里的Action字段构成了对外部世界的指令。一个外部的解析器 (Parser)会捕捉到这个指令并调用相应的get_weather函数。行动执行后环境会返回一个结果。例如get_weather函数可能返回一个包含详细天气数据的 JSON 对象。然而原始的机器可读数据如 JSON通常包含 LLM 无需关注的冗余信息且格式不符合其自然语言处理的习惯。因此感知系统的一个重要职责就是扮演传感器的角色将这个原始输出处理并封装成一段简洁、清晰的自然语言文本即观察Observation: 北京当前天气为晴气温25摄氏度微风。 Copy to clipboardErrorCopied这段Observation文本会被反馈给智能体作为下一轮循环的主要输入信息供其进行新一轮的Thought和Action。综上所述通过这个由 Thought、Action、Observation 构成的严谨循环LLM 智能体得以将内部的语言推理能力与外部环境的真实信息和工具操作能力有效地结合起来。结语此次博客因考虑到概念的精确性和标准性内容主要为搬运来源于Hello-Agents我是YYYing后面还有更精彩的内容希望各位能多多关注支持一下主包。无限进步我们下次再见

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询