AI Agent 为什么重新拥抱 CLI

发布时间:2026/10/2 16:25:30
AI Agent 为什么重新拥抱 CLI 过去命令行常被看成程序员的专属工具黑色窗口、精确参数、输错一个字符就报错。到了 AI Agent 时代这套看似古老的交互方式反而重新站到了台前。原因并不玄乎。大语言模型以文本为输入和输出CLI 也是文本进、文本出命令可组合结果可解析成功或失败还能用退出码明确表示。对人来说不够直观的界面对 AI 来说可能恰好合适。一、为什么行业重新关注 CLI2025 年底至 2026 年初行业对 MCP 和 CLI 的讨论明显增多。Vercel CEO rauchg 曾用一句话概括这种趋势CLIs are the de-facto MCPs for agents即 CLI 正在成为 Agent 事实上的工具接口。Perplexity CTO、Y Combinator 的 Garry Tan 也公开表达过对 CLI 路线的支持。一个很有代表性的例子是 Playwright。微软先推出 Playwright MCP Server让 Agent 通过 MCP 操作浏览器。功能没有问题但长链路任务会带来很高的上下文成本。在一组 15 步浏览器自动化任务的对比中MCP 方案大约消耗 114,000 Token换成专为 Agent 设计的 Playwright CLI 后同类任务约消耗 27,000 Token差距超过四倍。这不是说 MCP 没有价值而是说明工具协议并非越重越好。一个 Agent 如果只需先看--help再按需执行命令就没有必要在会话开始时把所有工具 Schema 全部塞进上下文。大厂和办公平台的 CLI 动作几个有代表性的行业动态如下Google 在 2025 年 6 月发布开源的 Gemini CLI把 Gemini 模型带入终端随后又推进 Gemini CLI 向 Antigravity CLI 整合。Microsoft 推动 GitHub Copilot CLI并在真实工程工作流中与 Claude Code 做评估和基准测试。即使缩减 Claude Code 工具本身的使用Anthropic 模型仍可经由 Copilot CLI 提供。飞书开源 Lark CLI用命令行封装消息、日历、文档、多维表格、邮箱、任务和会议等开放平台能力并提供大量命令及 Agent Skills可接入 Claude Code、Codex、Cursor 等工具。钉钉 CLI 开放 AI 表格、日历、日志、待办、机器人、通讯录、DING、考勤等能力原生支持 Claude Code、Cursor、Qoder 等 Agent 环境。企业微信 CLI 开放消息、日程、文档、会议、待办、通讯录、智能表格等能力并支持 Claude Code、Codex、WorkBuddy、QClaw 调用。这些动作指向同一件事办公平台争夺的已不只是人类用户的桌面入口还包括 AI Agent 的执行入口。谁能把平台能力包装成稳定、节省 Token、容易发现的命令谁就更容易进入 Agent 的工具箱。二、GUI、传统 CLI 与 Agent CLI理解 Agent CLI先要把三种界面分开。形态主要使用者交互方式输出形式设计目标GUI普通用户鼠标、触控、点击和拖拽窗口、图标、动画、进度条直观、易学、所见即所得传统 CLI程序员、运维和系统管理员人在终端中输入精确命令面向人阅读的日志、颜色和提示批处理、管道组合、脚本自动化Agent CLI大语言模型和自动化 Agent程序传入命令、参数或函数调用JSON、XML、纯文本、退出码少歧义、低 Token、可自动决策和重试传统 CLI 的使用者仍然是人。例如ls-lafindstrerrortest.logAgent CLI 则把人从逐条敲命令的位置上移开。人只描述目标Agent 负责选命令、填参数、读取结果并决定下一步。为了让机器可靠解析Agent CLI 应减少颜色、动画和情绪化报错优先返回稳定、精简的结构化数据。三、用 Playwright CLI 操作浏览器下面用 Playwright CLI 跑一条完整的浏览器自动化链路打开 B 站搜索“C语言”切换结果标签页并保存全页截图。1. 安装并确认命令可用npminstall-gplaywright/clilatest playwright-cli--help能正常打印帮助信息说明安装成功。--help不只是给人看的说明书也是 Agent 发现工具能力的入口。2. 打开页面并获取快照playwright-cliopenhttps://www.bilibili.com/--headedplaywright-cli snapshot--headed会显示浏览器窗口。snapshot返回页面快照其中的元素会带有类似e43的引用 ID。Agent 不必靠坐标猜输入框在哪而是可以直接引用这个 ID。3. 输入关键词并搜索playwright-cli fill e43C语言playwright-cli press Enter这里的e43来自上一步快照。页面变化后实际 ID 可能变化所以稳妥的做法是重新获取快照而不是把某个 ID 永久写死。4. 切换标签页并截图playwright-cli tab-select1playwright-cli screenshot --full-page--filenamefull-page.png接下来把 Playwright CLI 安装成项目技能playwright-cliinstall--skills安装后可以直接向 Agent 描述目标使用项目下面的 playwright-cli 技能打开 B 站搜索C语言 将搜索结果页面完整截图保存文件名是 full-page-agent.png。Agent 会把自然语言拆成打开页面、进入搜索结果、截图和关闭会话等步骤。一段实际调用可能包含playwright-cliopenhttps://www.bilibili.com playwright-cli gotohttps://search.bilibili.com/all?keyword鹏哥C语言playwright-cli screenshot--filenamebilibili-penggc-c.png playwright-cli close这段演示的重点不是某个网站而是工作方式人给目标Agent 通过技能了解命令再把任务落实成可检查的 CLI 调用。四、为什么 LLM 天生适配 CLI把模型的工作方式与命令行放在一起看大致可以归纳出五个原因。1. 训练语料里有大量命令行文本Stack Overflow、GitHub Issues、技术博客、man pages、Shell 脚本和终端记录都包含在大模型常见的训练语料中。模型早已见过大量“命令—输出—修正”的模式。相比识别一张模糊截图理解下面这条命令通常更直接gitlog--oneline2. 文本输入输出与模型的工作方式一致GUI 要求 Agent 识别按钮位置、颜色、弹窗和页面状态。界面一改原来的视觉定位就可能失效。CLI 的输入是确定的命令输出是确定的文本歧义更少。3. 命令结构接近自然语言大部分命令可以抽象成command [options] [arguments]命令名像动词选项负责修饰参数则是操作对象。它比完整编程语言简单又比自由文本更有约束--help、man page 和退出码还能帮助模型自行校正。4. 反馈容易形成闭环CLI 通常给出三类信号stdout正常结果stderr警告和错误exit code执行状态。Agent 可以据此写出很清楚的控制逻辑退出码为 0 就继续非 0 就读stderr并修正stdout为空则换一种查询方式。GUI 的失败状态往往藏在按钮变灰、弹窗出现或页面未跳转这些视觉变化里判断成本更高。5. 上下文利用率更高CLI 可以返回短 ID 和结构化 JSON不必把整棵 DOM、像素坐标或大量界面描述交给模型。省下来的上下文可以保留更长的执行历史或者用于真正需要推理的步骤。五、CLI 与 GUI、MCP 怎么选用一句直白的话概括GUI 是给人点的CLI 是给机器说的。CLI 相比 GUICLI 的第一项优势是可组合。管道可以把多个小工具接成一条工作流playwright-cli snapshot|jq.buttons|xargs-I{}playwright-cli click{}第二项优势是批量执行效率。重复操作、数据处理和调试任务可以脚本化无需反复点击。第三项是资源占用较低。TUI 应用常见内存占用约 1050 MB而完整 IDE 加大型插件可能达到 500 MB 甚至更高。对容器、服务器和远程环境中的 Agent这个差距很实际。CLI 相比 MCP两种方案放在一起比较CLI 的优势主要落在三处CLI 可以按需读取帮助并执行命令减少一开始加载大量 Schema 的 Token 成本。命令通常是一次调用、一次结束不依赖长期连接出错后的重试边界也更清楚。Agent 可以先运行--help探索再决定具体参数工作流更接近日常调试。但 MCP 仍有自己的位置。它适合用统一协议连接标准化 API 和外部资源尤其适合快速集成与原型验证。GUI 则继续服务于人类操作和可视化浏览。三者不是简单的替代关系。维度Agent CLIMCPGUI交互主体AI 优先人也能用AI 专用人类优先工作方式逐步探索、命令式、按需取用注入工具 Schema声明式调用点击和浏览Token 消耗较低15 步对比任务约 27K较高15 步对比任务约 114K视觉编码和界面描述成本高可靠性调用边界清楚执行较确定长连接和大型工具集可能增加超时风险UI 变化会影响视觉定位可组合性管道、脚本和批处理能力强每个工具需声明调用很难程序化串联资源占用较低需要维护会话状态完整桌面应用占用较高适用场景自动化、后台任务、CI/CD、批处理标准 API 接入、原型验证人机操作、数据可视化六、CLI 的四种形态和调用分层当前常见的 CLI 可以分为四类。1. 传统 CLI代表工具有 Git、Docker、GitHub CLI、curl。人的精确命令经过 CLI 交互层最后由具体软件执行精确命令 → 交互界面 CLI → 具体工具执行它们各自解决一个明确问题再通过管道和脚本组合。生态成熟缺点是人需要记住语法。2. 面向 Agent 的工具型 CLIPlaywright CLI 是典型代表。它仍使用传统命令行语法但目标使用者变成了 Claude Code、Copilot 等 Agent。它强调原子操作、机器可读输出、Token 控制和技能注入。调用链路是自然语言 → AgentLLM→ CLI飞书 CLI、企业微信 CLI 也可以放在这一大类中讨论。这些平台型工具把云服务 API 包装成统一命令顺便解决鉴权和 HTTP 请求拼装问题自然语言 → AgentLLM→ CLI → 云服务3. Agent 型 CLIClaude Code、Codex CLI、Gemini CLI、Cursor 属于 AI 原生的终端 Agent。用户不需要先掌握每条底层命令只需说明目标Agent 会规划并执行多步骤任务。它的完整分层更像这样自然语言 ↓ Agent CLI 交互界面 ↓ AgentLLM自主决策 ├─ Skill固化流程 ├─ CLI执行本地工具 └─ MCP连接外部接口这张分层图也解释了 CLI、Skill 和 MCP 的关系它们不是互斥选项而是 Agent 在不同任务中选择的执行手段。七、常见的 CLI 产品与框架产品或框架定位地址Hermes Agent有持久记忆和自动创建技能能力的自学习 CLI Agent支持多种模型及 Telegram、Slack 等平台GitHubTraeCode CLI运行在本地终端里的编码智能体文档Claude Code能理解代码库、读写文件、执行命令和管理 Git 工作流的终端 Agent官网Codex CLIOpenAI 的终端 Agent使用 Rust 实现可承担持续时间较长的自主任务GitHubGemini CLIGoogle 的终端 Agent支持长上下文和多模态输入GitHubOpenCode终端原生编码 Agent可接入多种 LLM 提供商GitHub飞书 CLI面向 Agent 设计的飞书平台命令行工具官网钉钉 CLI钉钉官方 CLI文档企业微信 CLI企业微信官方 CLI文档OpenCLI把网站和浏览器会话转化为确定性 CLI 接口GitHubbrowser-use让 AI Agent 操作浏览器的 Python 开源库GitHubPlaywright CLI微软推出的浏览器自动化 CLI强调 Token 效率和 Skill 架构GitHubCLI-Anything把现有软件能力包装成 AI 可调用 CLI 的工具GitHubQwen Code 也采用了类似思路它支持终端交互可以理解整个项目上下文完成代码生成、调试、优化和功能模块构建。八、怎样写一个适合 AI Agent 的 CLICLI 能不能被 Agent 稳定使用取决于接口细节。下面七条设计原则值得优先处理。1. 支持静默和无人值守模式任何可能被自动化调用的命令都不应强制等待交互式输入。可以提供--yes --force --quiet --no-input程序还应在非 TTY 环境中自动关闭交互并允许通过 flag、stdin、配置文件或环境变量传入必填项。否则当子 Agent 调起 CLI 后卡在y/n提示上最上层用户很可能根本看不到。2. 把--help写成工具发现文档帮助信息至少要说明参数用途、使用时机和默认值而不是只给一句模糊的 Usage。--input file 输入的文本文件必须 --output file 输出的 Word 文件路径默认同目录/output.docx --format [basic|academic] 排版风格默认basicAgent 读完就能知道哪些值必须提供、哪些可以采用默认值。帮助信息离线可用也不需要额外协议协商。3. 支持渐进式发现Agent 往往不会先读完整手册而是逐步探索tool--helptool subcommand--help顶层帮助负责告诉它“有什么”子命令帮助再解释“怎么用”。这种分层能避免一次输出过多文档。4. 为破坏性操作提供--dry-run删除或批量写入前先返回将发生什么clean_notes --older-than 30d --dry-run示例输出将删除以下文件2024-03-01_化学.txt、2024-03-02_化学.txt…… 共 12 个文件。未做任何实际修改。Agent 的日期理解或筛选条件可能出错。--dry-run给人或上层审核流程留下拦截机会。5. 错误信息要告诉 Agent 下一步怎么修只有Permission denied不够。错误应同时说明缺少什么以及修复命令Error: missing permission wechat:send:file Fix: run study-agent auth add --scope wechat:send:file这样 Agent 才能补权限并重试而不是反复执行同一条失败命令。6. 数据输出应稳定且可解析适合 Agent 的 CLI 应提供--json或等价选项。正常结果写到stdout警告、进度和错误写到stderr字段名也要保持稳定。list_docs--since7d--outputjson--filtersize0{files:[{name:empty.docx,size:0}]}Agent 可以直接读取字段不必从ls -l一类给人看的表格中猜列宽和数据含义。7. 控制输出边界一次输出 500 行日志很容易挤占上下文并淹没真正的错误。CLI 应默认分页或限量并提供筛选参数--limit --page --since如果结果被截断还应提示怎样缩小范围或读取下一页。九、Cursor CLI 实战生成、审查并修复网页再来看一个完整的 Cursor CLI 开发流程先生成企业官网落地页再用非交互模式做代码审查和修复。1. 在 Windows PowerShell 安装Windows PowerShell 可以使用下面的安装命令irmhttps://cursor.com/install?win32true|iex其中irm是Invoke-RestMethod的别名用来下载响应内容iex是Invoke-Expression的别名会把下载到的字符串当作 PowerShell 命令执行。这类“下载后直接执行”的命令很方便但也意味着你在运行远程脚本。正式环境中最好先下载并检查脚本内容再决定是否执行。安装完成后创建工作目录mkdir cursorcli输入agent进入交互模式。首次使用时可能要求登录并询问是否信任当前工作目录。Agent 可以在被信任的目录中读取文件、执行命令和修改代码所以不要对来源不明的目录随意授权。2. 先让 Agent 制订计划先用/plan提交需求要求生成一个响应式的一页式企业官网并写入landing.html/plan 请生成一个现代企业官网的落地页保存为 landing.html。完整需求包括极简现代风格、滚动时变化的导航栏、带 CTA 的 Hero 区、三张服务卡片、公司数据指标、页脚、移动端适配、中文注释以及 CSS 动画。Agent 先给出计划用户审核后再执行遇到高权限操作时工具会请求确认。3. 用非交互模式做代码审查生成页面后可以使用-p让 Agent 以--print也就是非交互模式运行--force允许它无需逐项确认便修改文件。agent-p--force请对 landing.html 进行代码质量审查。检查规范var/命名/未使用、性能滚动防抖/动画/重排、安全eval/innerHTML、可维护性重复代码/魔法数字/函数长度、可访问性alt/语义标签。输出 Markdown 格式报告写入 landing-review.md按严重/警告/建议分级标注行号和修复建议。4. 根据报告自动修复cursor-agent-p--force--output-format stream-json根据 landing-review.md 中的审查报告修复 landing.html 中所有严重和警告级别的问题保持原有功能和样式不变Cursor CLI 在不同版本或安装方式下可能使用agent或cursor-agent作为可执行文件名应以当前安装版本的提示和--help输出为准agent--help这里也能看到前文几条设计原则的实际作用先规划危险操作要授权批处理使用非交互模式执行过程输出结构化流最后再根据报告修复。结语CLI 的回归意味着命令行的主要消费者开始从人扩展到 AI Agent。一个好用的 Agent CLI 不需要花哨界面但必须有清楚的--help、稳定的 JSON、严格的退出码、可恢复的错误、--dry-run和有限的输出。做到这些模型就能自己发现能力、执行任务、判断结果并修正错误。GUI 仍然适合人MCP 仍然适合标准化连接。CLI 的优势在于简单、确定、容易组合。当任务需要长链路自动化、后台执行、批处理或低成本工具调用时它往往是最顺手的工具。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询