
demo 太好做了。一个有经验的工程师通用大模型加一个简单 Prompt一天能搭出一个挺好用的原型。这不是错觉也不是你天赋异禀是这一层本来就不难。0 到 80% 这段路模型已经替你把最重的活干完了。很多人就是在这里误以为 AI 落地很容易。demo 跑通的那一刻你会觉得剩下 20% 也就是 polish 一下的事。但 demo 只覆盖最常见的路径。生产系统要面对的是长尾、异常、合规和责任边界——这三样东西在 demo 阶段根本不会出现因为你自己挑的测试用例当然挑能跑通的。真正难的是 80% 到 95%。模型会在特定场景下出错。行业术语理解偏了边界情况处理崩了用户问了个 demo 里没有的问法整个对话就歪掉。你要做的事情突然变得很不AIPrompt 优化、规则补充、数据标注、测试集构建。这些活加起来比搭 demo 那一天重得多。这里有个反直觉的点AI 测试不像传统软件测试。传统测试是确定性输入配确定性输出跑通了就是跑通了。AI 测试面对的是概率系统和长尾分布改好 A 又坏 B是常态。这不是你代码烂是系统的性质就是这样。你修一个 case另一个 case 的概率分布就动了原本稳的地方开始抖。95% 到 99% 又是另一个量级。1% 的错误也能酿事。客服答错一次可能就是一次品牌事故金融、医疗、政务里错一次可能触发合规。系统接得越多权限、审计、回滚、人工接管这些东西的复杂度是乘法上去的不是加法。到这一步你需要的是上万级真实对话数据是一个团队一个季度的活不是一个人一个周末。FDE 做的就是这一段。不是 0 到 80%是 80% 到 99%。客户愿意为 FDE 付费不是因为他没看到 demo——demo 他自己也能搭——而是因为 demo 到生产之间有一条很长的沟。这条沟里全是长尾、合规和责任demo 不会告诉你它有多深。那为什么上限是 99% 而不是 100%LLM 本质是概率系统输出空间是开放的永远存在不可预见的边缘案例。从 99% 推向 99.9%边际成本指数级涨边际收益递减。高风险场景那 1% 本就不该让 AI 覆盖应该走人工审核和回滚兜底。99% 不是技术妥协是工程经济学的最优解AI 覆盖可规模化的 99%人工守住不可自动化的 1%。硬要追 100%你花的钱和那 1% 的损失不成比例。这也能解释一个看起来矛盾的现象超过 70% 的企业已经在至少一个职能里试了生成式 AI但超过 60% 还停在试点或实验阶段。模型能力明明一直在涨为什么大家不动了卡住的不是模型能力。卡住的是最后那 20% 的生产化工程。模型每次升级拉大的不是技术能做到和做不到的距离是技术能做到和组织用得起来的距离。企业引入 AI 要穿越三个阶段——个人提效、组织转型、业务重构——每个阶段动辄以年为单位。demo 跑通是第一阶段的事后两个阶段跟模型好不好没关系。所以 demo 的意义不是替代生产系统是提前暴露风险。健康的 FDE 模式不是把 demo 当结束是把 demo 当成进入生产验证和经验积累的起点。一天搭出 80% 是正常发挥。卡在 95% 到死也是正常发挥。中间那段不是你不行是活本来就在那里。