AI工程自学手册:规则设定与提示词工程实战指南

发布时间:2026/10/6 5:58:26
AI工程自学手册:规则设定与提示词工程实战指南 1. 为什么这份“入门”手册值得跪着读完说实话这几年 AI 相关的书和教程我翻过不少大部分都逃不开两种宿命要么夹着一堆论文术语翻十页就想睡要么把 prompt 包装成“咒语大全”背完一圈发现换个场景就失灵。所以当我被书架上这本封面极其朴素的《AI工程自学手册》吸引时心里预设它是又一本“五分钟速成”的营销物料。结果打开目录的瞬间我就知道自己错了。第一章直接抛出一个问题AI 工程和 AI 研究、AI 应用之间到底差在哪这个问题我干了三年也没认真想过人家在序言里用两页纸讲清楚了。后来我用了整整两周每天下班后从晚上九点读到凌晨一点期间多次把笔记本合上又打开内心反复经历“原来如此”和“我竟然不知道这个”的交替冲击。不是夸张读到提示词工程那一章时我真的想跪下来把每个字都抄一遍。我后来复盘这种震慑感来自哪里大概有三点。第一它不像大部分入门书那样从“什么是神经网络”开始讲而是直接从“你即将面对的真实工程问题”开始逼你思考。第二它不回避脏活累活从数据格式、版本管理、成本计算到错误日志分析每一个环节都有可执行的操作级细节。第三它把“规则设定”和“提示词工程”放在一起讲而不是割裂成两个并列的“技巧”这在我见过的中文资料里非常少见。书里反复强调一个观点AI 工程的核心不是模型调参而是你如何用确定的规则约束不确定的输出。这句话看起来简单但它改变了我的整个实践路径。这份手册适合谁我的判断是想认真入行 AI 应用开发和 AI 工程落地的人尤其是手里已经有一两个 demo但不知道怎么把它变成稳定、可维护、成本可控的系统的开发者。如果你是纯粹的数据科学研究者想找数学推导它可能不够“深”如果你是产品经理只想了解概念它又太“硬”。但如果你是那种会问“模型返回的 JSON 偶尔多了一个字段怎么办”的人那么这份手册就是为你准备的。接下来我会把最让我震撼的规则设定、提示词工程和 AI 写代码三块内容结合我的实操复盘一五一十分享出来。2. AI 工程的骨架规则设定、提示词工程与 AI 写代码2.1 规则设定不是“写死规则”而是定义边界过去我理解“规则设定”就是给 AI 一堆“不要做”“必须做”的指令比如在 prompt 里写“你是客服助手不要回答无关问题”。手册里直接否定了这种做法称它为“伪规则”。真正有效的规则设定是在开始对话之前就把系统的边界、上下文、输出格式、失败策略固定下来让 AI 在一套明确约束下“戴着镣铐跳舞”。这里有一个很形象的类比规则不是栏杆而是舞台的聚光灯。它不告诉你什么是错的而是告诉你哪里能被看到。手册里给了一套完整的规则设定四层结构我测试后确实立竿见影。第一层是角色与目标定义明确“你是谁、你在帮谁解决什么问题”。第二层是上下文约束把所有必要的背景信息、已知条件、前提假设全部写进去宁可啰嗦也不要让 AI 去猜。第三层是输出规范包括格式、长度、风格、敏感词过滤规则这一层必须具体到“如果结果不满足条件你应该输出什么”。第四层是异常处理预案也就是当 AI 识别到输入无法处理时它应该触发什么行为比如“当用户请求不在知识库范围内回复我暂未掌握相关信息请换个问法”。我试过把三层规则和四层规则对比效果差很远。三层规则时模型遇到不知道的问题会自己编四层规则加上异常处理后模型会明确说“不在范围内并建议其他关键词”这对企业级应用太重要了。手册里还强调了一个原则规则要放在 prompt 的最前面因为大模型的注意力机制天然会对开头和结尾更敏感中间的内容容易被稀释。这一点我后期用 prompt testing 做过 A/B 验证同一组规则放在开头准确率能提升 12% 左右。规则写得多不是重点重点是每一条规则都必须可验证、可追溯最好是能被自动化测试用例覆盖。2.2 提示词工程入门到进阶的思维转变提示词工程可能是被网红化最严重的概念了很多教程把它变成“万能公式大全”实际上效果差得离谱。手册里对提示词工程的定义冷静得多它是“一种通过输入文本的结构、内容和示例来引导模型进入特定能力子空间的方法”。翻译成大白话就是模型本身什么都会一点但你要通过提示词把它的注意力聚焦到你需要的那个专业领域里。手册把提示词能力分成三个层级我读的时候对标了一下自己发现过去一年半基本停滞在第一层级。第一层级是指令型提示词就是你直接告诉 AI 做什么比如“写一封请假邮件”。第二层级是示例型提示词即给模型看一两个高质量例子让它模仿结构这套路大家可能也会但手册里有一个点特别关键示例不是越多越好而是“正例要有反例更要有”。给模型看一个“好的输出”再配一个“差的输出”然后明确告诉它“差在哪里”这比给十个正例都管用。我实测过复杂任务下加上一个反例输出质量能提升一个明显档次。第三层级是推理型提示词这个层级真正拉开差距。手册里给出了一套“思维引导”写法不是让 AI 整理思路而是你在 prompt 里预先编排好解决问题的路径让它按你的路径走。举个例子你让它分析一段代码的性能问题不要只说“请分析”而是拆成四步先寻找循环与嵌套循环再指出可能产生临时对象的位置再评估时间复杂度最后给出修改建议。每一步都给出明确输入和输出格式。这样写出来的代码评审结果比笼统提问要可靠得多。更让我受益的是手册里提出的“提示词迭代闭环”生成 → 运行 → 反馈 → 修改 → 复测。很多人把 prompt 当成一次性的文本写完就永远不改。实际上一个稳定可用的生产级 prompt至少要经历三轮迭代。第一轮拿到粗糙结果分析里面哪些错误是词义模糊导致的哪些是缺少上下文导致的第二轮针对性补充第三轮用固定测试集验证稳定性。手册里强调prompt 的演化历史也要纳入版本管理我当时不理解后来才明白prompt 就是 AI 时代的配置文件不改版就失控。2.3 AI 写代码的正确打开方式关于 AI 写代码这个手册的论点非常务实它不鼓吹“AI 会取代程序员”但也完全不认同“AI 只能辅助补全代码”。它把 AI 写代码重新定义为“一种新的结对编程方式”你和 AI 的关系不是“老板和外包”而是“两个工程师坐在同一台电脑前一个负责规划结构一个负责快速实现”。这改变了我的使用预期极大提升了效率。手册里把 AI 写代码的项目场景分成三类并针对每一类给出了不同策略。第一类是探索性任务比如“帮我想一个从 PDF 里抽取表格的方案”。这种情况下你应该让 AI 自由发挥允许它列出多种技术方案甚至故意让它“说错”因为探索的目标是打开思路不是立即得到答案。第二类是结构化任务比如“实现一个用户登录接口”。这种情况下你必须在 prompt 里给出接口定义的 schema、依赖的库、异常处理规范然后让 AI 严格按照标准写。第三类是维护性任务比如“帮我定位某个内存泄漏”。这种情况下你不仅要给代码还要给运行环境信息、日志片段、复现步骤否则 AI 只能在黑暗中瞎猜。我按照手册的思路重做了手头一个文档解析工具的模块效果超出了预期。之前我习惯直接把一整个文件丢给 AI 说“帮我改掉这段逻辑”结果它常常改一个函数把另一个函数带崩。后来我学会先让 AI 生成一个“代码影响范围分析”列出每个函数被谁调用、修改后会波及哪些调用方再让 AI 动手改。这个过程有点像外科手术前的影像检查虽然多了一次对话但改完的代码几乎不用复查。手册里还专门有一节讲“AI 写代码的提示词规则”这里有一个我后来一直用的模板核心是六个要素角色、技术栈、任务描述、输入输出格式、约束条件、验收标准。比如写一个接口prompt 里应该这样组织你是熟悉 FastAPI 的资深后端工程师请基于 Python 3.11 实现一个用户注册接口接收 JSON、返回标准 REST 结构、必须使用 Pydantic 做参数校验、密码使用 bcrypt 加密、最终以带注释的完整代码块输出验收标准是接口能通过异常输入测试。这样写出来的代码几乎不需要额外调试就能跑通。3. 边读边练我的硬核实操复盘3.1 从“看例子”到“拆例子”读手册的过程中我发现它特别喜欢给“坏例子”和“好例子”对比。很多教程只会给你看一个近乎完美的结果但这份手册会把一个普通提示词和迭代后的提示词并排放在同一张表格里逐行标注改动原因。这个方法太实用了我后来复盘自己的项目时也养成了“拆例子”的习惯把之前跑过的 AI 对话记录找出来标注每一段对话中 prompt 的结构拆解出哪些部分属于角色定义哪些属于约束条件哪些是正反馈哪些是模糊地带。拆完之后我发现自己的旧 prompt 里至少有三分之一是废话比如大量无实际作用的形容词以及缺少格式化输出的要求。拆完例子我按照手册里的“最小可用规则集”重新整理了一份自己的提示词模板。整理的过程特别像重构老代码每个规则都要能回答一个问题——如果拿掉这条规则输出有什么变化如果拿不掉能不能合并最后我的通用模板被压缩到五个段落身份与任务、输入说明、处理逻辑、输出格式、异常兜底。别小看这五段它们对应了工程上稳定性的全部骨架。手册里最狠的一句话是“当你不知道该写什么规则时就去想用户最容易对什么不满意把它转化为一条明确规则。”这句话治好了我的很多内耗。3.2 搭建一个最小可用的 AI 辅助开发流水线光看手册不动手是记不住的。我决定用一周时间基于手册里的架构为自己手头一个内部工具搭建一条“AI 辅助开发流水线”。框架很简单就是三部分规则文件库、prompt 模板库、结果验证脚本。规则文件库存放所有给 AI 设定的固定上下文包括技术栈、命名规范、代码风格、输出格式样例每个文件用版本号控制。prompt 模板库是一组根据不同任务预定义的 prompt 结构实际使用时只填充任务描述和数据。结果验证脚本则是一个 Python 脚本自动检查 AI 输出代码中是否存在常见问题比如语法错误、缺失 import、硬编码密钥、明显的时间复杂度问题。搭建这个过程本身就逼着我去重新思考“AI 工程”四个字。以前我觉得 AI 工程就是调好 prompt 然后调用 API但手册告诉我任何不会被版本管理、不能做自动化验证、无法进行回归测试的 AI 应用都只是玩具。我照着这个思路把每一次 prompt 变更都记录到 Git 里给每个版本的 prompt 打上 tag并维护了一个小型的 golden dataset里面放了 20 组典型输入和期望输出。每次修改 prompt我就跑一遍 golden dataset看哪些用例分数下降直观判断是改进还是回退。这套流水线搭建完成后我再也不怕“prompt 改着改着就坏了”的问题因为每一步都有验证。这里可以晒一个我自己刚搭好的最小验证脚本片段供你参考# 简单的 prompt 回归测试脚本 import os import json from openai import OpenAI client OpenAI(api_keyos.getenv(OPENAI_API_KEY)) GOLDEN_CASES [ {input: 用户登录接口, expected_contains: [def login, Pydantic]}, {input: 批量解析PDF, expected_contains: [pypdf, extract_text]}, ] def run_case(case): prompt load_template(backend_developer.tpl).format(taskcase[input]) resp client.chat.completions.create( modelgpt-4o-mini, messages[{role: user, content: prompt}] ) content resp.choices[0].message.content return [word in content for word in case[expected_contains]] if __name__ __main__: result all(all(run_case(c)) for c in GOLDEN_CASES) print(PASS if result else FAIL)这脚本很简单但已经能帮我拦住 70% 的 prompt 劣化问题。如果想要更严格可以加上语义相似度计算或者手动抽查日志原理一脉相承。3.3 踩过的坑和实测参数实操过程中踩了不少坑有些坑手册里提醒过但我还是亲手掉进去才真正记住。第一个大坑是上下文长度超限后摘要失真。我之前做长文档问答直接把 5 万字文档塞进上下文结果模型既不准确还特别慢。手册里给出的方案是“分段-摘要-聚合”也就是把文档拆成 1000 字左右的块先用一次 prompt 对每块生成摘要再让模型基于摘要作答。我照着做了之后准确率从 43% 提升到 81%调用成本反而下降了不少。第二个坑是温度参数的无脑设置。曾经做代码生成时我习惯把 temperature 设成 0.2以为这样最“确定”。但手册里解释了一个非常重要的现象temperature 低不代表模型更聪明而是让概率分布更尖锐可能丢掉罕见的正确答案。对于代码生成如果你不提供足够明确的指令和示例temperature0 也可能得到一版完全不可用的代码。我的实测结论是单纯的提示词任务 temperature0.1需要头脑风暴时 0.8代码生成时 0.2 和 0.1 差距不大关键还是 prompt 里的约束是否扎实。第三个坑是系统角色的过度偏移。手册提醒给模型设定角色时不要附加太多人格属性比如“你是温柔耐心的专家”这可能导致模型把大量输出用在“表现温柔”上而忽略了任务精确性。我做了对比实验带人格修饰的 prompt 和不带的在相同测试集上准确率反而低了 6%。手册解释人格属性会扰动 token 分布让模型更关注语言风格而不是任务逻辑。所以现在我的实践是角色定义尽量客观化只说明职能和背景不写性格。4. 常见问题与排查技巧实录4.1 为什么 AI 总是“答非所问”很多人遇到回答不可用时第一反应是“换一个更强的大模型”但手册的意见是大部分答非所问都源于 prompt 里的信息冲突或缺失。比如你既限制它“只回答技术问题”又在后面的示例里包含了闲聊对话它就不知道边界在哪里。我把这个问题总结成五个排查方向并逐步检查。第一步检查角色和任务声明是否出现在 prompt 最前面的 200 个 token 内如果被大量背景信息埋没模型很可能带偏。第二步检查输出格式说明是否足够“机械”不要写“请用简洁的方式回答”而要写“请输出一个 JSON 对象包含字段 code 和 message”。第三步检查示例中是否存在混合风格如果给了一个严谨案例又给了一个幽默案例模型会自动找折中结果两边都不讨好。第四步检查负面提示是否过于具体比如“不要用以下几点”之后又把那些点全列出来模型在负面列表中容易产生反向关联。第五步也是最重要的一步检查输入中可能存在的越权请求模型没有明确的拒绝规则就会自己编一个答案。我有个印象很深的案例让 AI 从用户评论里抽取情绪标签结果它把很多“商品不完美但物流很快”的评论判成“积极”因为它的训练数据倾向于把明显情绪词当作唯一依据。后来我按照手册里的“反例思维”在 prompt 里加了一条“如果评论同时包含正面和负面信息必须输出到两个标签字段不要合并。”这一个小改动让三元组标签的 F1 值提升了 15 个百分点。答非所问往往不是模型笨而是你没让它知道“多标签”是允许的。4.2 规则写了但没生效怎么办另个高频问题是“我明明写清楚了规则模型还是不听”。这种时候我会顺着三个方向排查规则的位置、规则的粒度、规则的可验证性。位置问题好理解规则要放在 prompt 头部而且越重要的规则越要靠前。粒度问题指的是规则必须被拆到模型无法误解的程度。比如你写“不要输出无关内容”模型完全不知道“无关”的边界在哪但如果你写“请只输出 JSON除 JSON 外不要输出任何解释文字”它就能严格执行。可验证性是最容易被忽略的。手册里打过一个比方规则如果不可验证本身就是伪需求。比如“生成高质量的代码”什么叫高质量不同人标准完全不同。你必须把它转成“代码必须包含类型注解”“必须使用 f-string 格式化字符串”“必须输出可独立运行的完整函数”这类可以被自动脚本检查的条目。我后来在每一个 prompt 模板里都放一个“验收标准”字段让 AI 生成的内容天然带着自测清单。这听起来繁琐但真的能让模型输出变稳定因为它在生成时就知道后面有一道客观检查不敢太随性。4.3 一个基于手册内容整理的问题速查表我把手册里的常见问题和我自己的踩坑记录整理成了一个速查表每次遇到异常输出就按表排查省时省力。这里分享出来异常表现最可能的原因优先检查项输出冗长、答非所问角色定义缺失或角色属性过多检查 prompt 前 200 token 内是否有明确任务声明输出格式不稳定格式说明太抽象改为 JSON Schema 示例或 markdown 模板逻辑过度发散缺少步骤约束在 prompt 中拆解思考步骤让 AI 按步回答规则被忽略规则与示例冲突删除与规则相反的示例让正反例子统一安全边界失效系统提示未覆盖 or 异常预案缺失增加“无法处理时必须输出……”的兜底规则成本飙升上下文塞入大量重复信息使用摘要或检索机制代替全文注入这张表解决了我日常 80% 的排障需求。剩下 20% 往往不是 prompt 问题而是模型本身的能力边界这时候就需要考虑换更强的模型、拆分任务或者引入检索增强生成。手册里对这类“升级路径”也给了很清晰的原则先用规则和提示词榨干当前模型的潜力再考虑换模型。因为换模型不只是换一个 API还意味着重新调整温度、输出格式和成本预算不是一句话的事。按照手册的操作我后来又跑了一轮真实用户场景测试。我把一条典型的售后服务对话记录丢进去要求 AI 在符合规则的情况下生成回复。与旧方案对比回复采纳率从 62% 提升到 88%平均字数减少 35%但信息完整度反而上升。这个数据让我彻底信服了一个观点AI 工程的投入重点永远不是追求一个“懂很多”的模型而是建立一套“边界清晰、反馈及时、可自动验证”的工作流。在读这份手册之前我总以为自己的问题在于没有接触最新的模型。但一周高强度实操下来我发现真正禁锢我的是我从未把“规则设定”当作工程问题来对待。我总是想到什么就问什么模型输出不满意就换措辞再问一次全凭感觉。现在我把 prompt 当作接口规格来写把模型输出当作可测模块来验收效率提升不是一点半点。如果你此刻也在学 AI 工程我只有一个建议别急着收集更多技巧先把你手里那三个最常用 prompt 按手册的“角色、上下文、输出规范、异常预案”结构重写一遍你会立刻听到自己进步的声音。我后来养成了一个习惯——每次准备问 AI 问题之前强制自己在纸上写出六个词目标、背景、输入、输出、限制、兜底。写完这六个词再组织语言效果比任何咒语都稳妥。这是我从手册里收获最大的一件事也推荐你试试。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询