
1大模型能用来做什么①ai自然语言编程Vibe Coding可以通过直接对ai输出自己的想法或灵感实现低代码甚至零代码完成开发真正的想法即代码。这个后期我还会再讲过程中涉及提示词还有skill一类的非常有趣)②ai对话图像处理依旧一句话精简概括所想即所得非常强大很方便。几乎可以达到以假乱真。③ai智能体操控腾讯会议重新定义了人与机器的协作边界直接让对话机器人具备自主感知规划决策与工具调用能力的数字行动者。可以通过微信对话预定腾讯会议2大模型是什么本质对人类智能的模拟• 强⼈⼯智能⽬标是制造出真正拥有⼼智、意识、能理解⾃⾝存在的机器。• 弱⼈⼯智能专注于在特定领域表现出智能⾏为像⼈⼀样做得好甚⾄更好。3机器学习(Machine Learning)机器学习Machine Learning英⽂缩写为ML,是⼈⼯智能的⼀个⼦领域其核⼼不再是⼿动编写规则⽽是通过数据训练算法让计算机从历史样本中⾃动总结规律⽤以预测或决策新问题。⼈⼯智能和机器学习到底是什么关系呢⼈⼯智能是⽬标机器学习是实现该⽬标的主要⼿段。当代⼈⼯智能≈基于机器学习的⼈⼯智能。本质给定输⼊和输出 让机器⾃⼰找到那个函数 。怎么理解这个本质呢⽐如我们打⻋起步价10元固定成本每公⾥2元求⼀下打⻋20公⾥多少钱这个公式对我们来说⾮常简单就可以求解出来y2x10,这就是费⽤的计算规律。那机器学习是什么呢告诉你有下⾯的数据然后需要计算⼀下X20公⾥的时候费⽤是多少设yaxb然后代⼊2组数据可以求出来a2,b10。然后我们根据规律求出来20公⾥的时候费⽤是50块钱。这个求出的ab就是机器学习中的参数⼈类输⼊给机器的原始素材x就是特征机器学习对⽐我们⼈⼯求出来的这个过程是⾃动化求解不需要我们⼈⼯代⼊数据去求解这个⾃动化找参数的过程就叫模型训练(training)或者学习(learning)⽽且机器的x和y在现实世界中不全是数字可以是复杂的问题图⽚语⾳等。y2x10就是我们训练好的数学模型。有了模型以后我们根据X20公⾥计算费⽤总的费⽤为50这个过程就叫做推理(inference)/预测(Prediction)。实际⼯作中我们真正的模型往往很难如此简单举个例⼦我们要实现⼀个简单的图像分类⽐如区分下图⽚⾥⾯是⻋还是⼈我们要学习的函数变成了下⾯的形式⻋和⼈我们很难⽤简单的⼏个参数来表⽰就需要⽤机器学习来完成学习到的参数往往也是⼏万⼏⼗万的参数很难通过简单的⽅式来进⾏解释。我们参与训练的图⽚和标签往往叫做样本其中图⽚称为特征Y称为标签特征和标签组成了样本整体称为训练数据.4机器学习分类4.1 按照反馈信号分类:监督学习无监督学习半监督学习(医疗影像)自监督学习(大模型核心预训练范式)强化学习4.1.1监督学习监督学习是机器学习和⼈⼯智能中的⼀种算法学习训练⽅式。模型通过标记好的训练数据进⾏学习⽬标是建⽴输⼊与输出之间的映射关系。监督学习靠“外部标准答案”⼈⼯标签反馈。有对错直接纠正。4.1.2无监督学习⽆监督学习的核⼼定义可以概括为在完全没有“标签”即标准答案的情况下让算法⾃⾏从输⼊数据中发现隐藏的结构、规律或模式靠“数据内在结构”反馈。没有对错只找规律。4.1.3半监督学习半监督学习利⽤少量“有标签”的数据带标准答案和⼤量“⽆标签”的数据⽆答案共同进⾏训练以此来提升模型的预测精度。介于两者之间在我们拥有相对较少的标记数据和⼤量未标记数据的情况下半监督学习结合了监督学习和⽆监督学习的优势于是在此时可以发挥很好的作⽤。在海量数据⾯前⼿动标记数据的成本过于⾼昂且繁琐⽽未标记的数据很多、易于获取且每⽇都会产⽣⼤量的数据。因此我们可以只标记数据集中的⼀部分⽽不是标记整个数据集然后⽤半监督学习⽅式来学习。半监督做法1.⽤500张医⽣标注好的⽚⼦训练⼀个初始模型。2.让该模型去预测10,000张未标注的⽚⼦。3.挑选模型预测结果中置信度极⾼⽐如99%确定是肺炎的图⽚给它们打上“伪标签”Pseudo-label。4.将这些带有伪标签的数据加⼊训练集重新训练模型。4.1.4自监督学习⾃监督学习利⽤数据本⾝的结构来“⾃动⽣成”监督信号即伪标签。⾃监督学习⽬前是AI界的宠⼉它是⽆监督学习的⼀种特殊形式但其“学习过程”却极像监督学习。既然⼈⼯标注Labeling太贵那就让数据“⾃⼰标注⾃⼰”。模型通过隐藏数据的⼀部分然后尝试预测这部分内容。它与半监督学习的核⼼区别在于半监督学习仍依赖少量真实标签⽽⾃监督学习完全不⽤标签。⾃监督学习Self-Supervised Learning,SSL是⼀种让机器学习模型“⾃学成才”的范式。它最⼤的特点是不需要昂贵的⼈⼯标注数据⽽是从海量的⽆标签原始数据中⾃动“创造”出训练所需的“标签”或“监督信号”** 扩散模型DiffusionModel**的⼯作过程就是⼀个⾃监督学习的过程它通过⼀套⾃给⾃⾜的逻辑来摸索世界的规律。第⼀步⾃导⾃演的“恶作剧”加噪-Forward Process想象你⼿⾥有⼀张清晰的《蒙娜丽莎》拼图。操作你往拼图上撒了⼀把沙⼦噪声遮住了⼀点细节。继续你⼜撒了⼀把沙⼦画⾯变得模糊了。终点最后你撒了⽆数把沙⼦原来的画完全看不⻅了只剩下⼀堆灰⾊的沙⼦。为什么是⾃监督因为在这个过程中“沙⼦”是你亲⼿撒的。你知道每⼀时刻加了多少沙⼦也知道原图⻓什么样。这种“答案就在⾃⼰⼿⾥”的过程就是⾃监督。第⼆步苦练“还原术”去噪-Reverse Process现在你把这堆“沙⼦”交给模型对它说“我刚才往画上撒了沙⼦请你把刚才那⼀层沙⼦从画上‘吹’⾛还原回前⼀秒的样⼦。”• 前置任务模型的⽬标不是直接变出⼀张画⽽是预测并减去那层沙⼦。• 反复横跳模型会不停地对⽐◦ 它以为的沙⼦vs实际上你撒的沙⼦。◦ 它还原出的画vs你⼿⾥的原图。学到了什么为了把沙⼦吹⼲净模型必须理解画作的内在规律。它得知道• “这⾥有⼀条弧线沙⼦下⾯可能是⼀个嘴⻆。”• “这⾥的颜⾊很暗沙⼦下⾯应该是头发。”• “如果我胡乱吹画出来的东西就不像‘画’⽽像碎纸屑。”第三步⽆中⽣有的“超能⼒”采样-Sampling当模型练成了“顶级还原术”后神奇的事情发⽣了。即使你给它⼀堆全新的、完全随机的沙⼦纯随机噪声并对它说“去吧把这堆沙⼦⾥多余的东西吹掉。”模型会凭借它在训练中学到的“经验”即图像的概率分布在虚⽆中⼀点点勾勒出线条、⾊彩和结构。它以为⾃⼰在“还原”⼀张不存在的画结果却创造出了⼀张全新的、写实的图像。这就像⼀个学画画的⼈每天的任务不是临摹名画⽽是把名画打碎成粉末再尝试把粉末粘回去。久⽽久之即便不看原图他也能⽤粉末堆出⼀幅⼤师级的作品。4.1.5强化学习如果说监督学习是“照答案做题”有标准答案⽆监督学习是“⾃⼰找规律”没有答案那么强化学习就是“在试错中积累经验追求⻓期收益最⼤化”。强化学习通过与环境交互来学习。它没有直接的标签⽽是通过“奖励”或“惩罚”来优化⾏为策略⽬标是获得最⼤的⻓期累积奖励。它的核⼼逻辑和我们训练宠物狗⼀模⼀样做对了给块⾁⼲奖励做错了轻轻呵斥惩罚。久⽽久之它就知道在什么情况下该做什么事以获得最多的⾁⼲。4.2以AlphaGo为例第⼀阶段通过“打谱”进⾏监督学习这是AlphaGo的启蒙阶段。研究⼈员会输⼊海量⼈类⾼段位棋⼿的历史对局棋谱让模型像⼈类初学者⼀样“打谱”学习。• 学习⽅式监督学习。• 具体做法模型学习“在某个棋局下⼈类⾼⼿通常会下在哪⾥”。它的⽬标不是赢棋⽽是尽可能准确地模仿⼈类的落⼦选择。• 成果经过这个阶段AlphaGo已经拥有了超越绝⼤多数⼈类棋⼿的棋感学会了合理的下法。第⼆阶段通过“左右互搏”进⾏强化学习这是AlphaGo超越⼈类、实现进化的核⼼阶段。它的学习⽅式从“模仿⼈类”转变为“⾃我探索”。• 学习⽅式强化学习。• 具体做法a. ⾃我对弈让第⼀阶段训练出的多个不同版本的策略⽹络相互对弈数⼗万甚⾄数百万局。b. 获得奖励对弈的最终结果赢或输就是唯⼀的“奖励信号”。赢了说明这局棋的策略是好的输了则说明需要改进。c. 优化策略模型的⽬标是最⼤化赢棋的概率。它会不断调整⾃⼰的下棋策略淘汰那些导致失败的策略强化那些能带来胜利的策略。• 成果通过这种“左右互搏”AlphaGo不再局限于⼈类棋谱⽽是⾃⼰创造出了许多⼈类从未⻅过的、极具创造⼒的新下法⽐如那招让所有棋⼿震惊的“第37⼿”。这标志它真正超越⼈类知识的边界。第三阶段AlphaGo Zero摆脱⼈类偏⻅值得⼀提的是DeepMind后来发布的 AlphaGo Zero 版本进⼀步印证了强化学习的强⼤。• 彻底摆脱⼈类AlphaGo Zero完全摒弃了第⼀阶段的监督学习它不再需要任何⼈类棋谱。• 真正的“从零开始”它只被告诉围棋的基本规则然后就开始和“⾃⼰”下棋通过纯粹的强化学习在短短40天内就成为了史上最强的围棋AI并以1000的战绩完胜击败李世⽯的旧版AlphaGo各个类别的反馈信号• 监督学习信号来⾃⼈⼯标注• ⽆监督学习信号来⾃数据本⾝的内在结构• ⾃监督学习信号由数据⾃动构造• 强化学习信号来⾃环境给出的奖励延迟、数值型4.3按照机器学习的任务分类:分类回归聚类序列预测深度学习4.3.1分类分类是⼀种监督学习任务旨在根据输⼊数据的特征将其划分到预先定义好的、离散的类别标签中。机器学习可以通过对已知类别的数据进⾏学习从⽽对未知类别的数据进⾏分类。⽐如在垃圾邮件识别中机器学习算法可以通过学习已知的垃圾邮件和⾮垃圾邮件来判断⼀封新收到的邮件是否是垃圾邮件。分类问题的常⻅算法有K近邻算法、逻辑回归、朴素⻉叶斯、决策树、随机森林、⽀持向量机SVM算法等。(高级的算法可以先不用具体了解,理解大体意思即可)举个例⼦假设你刚⼊职⼀家公司领导给你⼀个任务把邮件分类成“正常邮件”和“垃圾邮件”。领导扔给你5000封已经分好类的历史邮件训练数据让你⾃⼰看⾃⼰总结规律。你开始认真翻看垃圾邮件的常⻅套路• 标题含“免费”、“中奖”、“⽴即领取”?• 正⽂频繁出现“点击链接”、“转账”、“账户异常”• 发件⼈是⼀串乱码邮箱⽐如 sdf23xx.com正常邮件的常⻅特征• 发件⼈是熟悉的同事、客户• 内容涉及⼯作安排、项⽬进度• 没有诱导点击的夸张话术你看完5000封邮件后脑⼦⾥已经形成了⼀套判断规则模型。第⼆步分类推理阶段第⼆天早上你打开收件箱看到⼀封从来没有⻅过的新邮件发件⼈ serviceunknown.com标题【紧急】您的账⼾存在异常请⽴即点击链接验证你⼤脑迅速扫描• ✅发件⼈陌⽣• ✅标题含“紧急”、“⽴即”• ✅诱导点击链接你果断判断这是垃圾邮件然后⼀键拖进垃圾箱。恭喜你成功完成了⼀次分类推理。4.3.2回归回归是⼀种监督学习任务旨在建⽴⼀个数学模型来拟合输⼊特征与连续数值型输出之间的映射关系。机器学习可以通过对已知的数据进⾏学习从⽽对新的数据进⾏预测。⽐如在股票市场中机器学习算法可以通过学习历史股票价格数据来预测未来的股票价格。回归问题的常⻅算法有线性回归等。4.3.3聚类聚类是⼀种⽆监督学习任务旨在在没有预先给定类别标签的情况下根据数据样本之间的内在相似性⾃动将其划分为若⼲个不相交的Group。机器学习可以将数据按照⼀定的特征进⾏聚类从⽽将相似的数据归为⼀类。⽐如在客⼾分析中机器学习算法可以通过学习客⼾的购买⾏为和喜好将相似的客⼾归为⼀类从⽽对不同的客⼾群体进⾏针对性的营销。聚类算法属于⽆监督学习常⻅的算法有K均值算法K-means、层次聚类、DBSCAN、⾼斯混合模型GMM等。(高级的算法可以先不用具体了解,理解大体意思即可)⽐如我们常⽤的⾳乐APP第⼀步机器看什么数据特征App后台有成千上万⾸歌每⾸歌都被提取成⼀组数字特征• 节拍速度快/慢• 乐器种类有没有吉他、钢琴、电⼦合成器• ⼈声特点男声/⼥声/纯⾳乐• 能量值激昂/舒缓• 情绪值欢快/悲伤于是每⾸歌都变成了⼀个“坐标点”⽐如• 歌曲A速度120能量0.8⼈声男情绪欢快• 歌曲B速度60能量0.2纯⾳乐情绪悲伤• 歌曲C速度130能量0.9⼈声⼥情绪欢快第⼆步机器⾃动“抱团”聚类机器把所有歌曲按照这些特征“距离远近”⾃动分成若⼲堆⽐如分成了4堆机器内部标签⼈类后来赋予的名字歌曲特征第1堆“燃爆运动”速度快、能量⾼、⿎点重第2堆“深夜emo”速度慢、钢琴为主、歌词伤感第3堆“学习专注”纯⾳乐、⽆歌词、节奏平稳第4堆“轻松愉快”速度快、吉他为主、⼈声轻快第三步把你“塞”进某⼀堆机器再看你过去⼀周的听歌记录你单曲循环了20遍《起⻛了》还听了5⾸类似的歌。机器发现这些歌全部属于“深夜emo”那⼀堆。于是它得出结论“这个⽤⼾⼤概率属于‘深夜emo’群体。”第四步给你推荐机器从“深夜emo”那⼀堆⾥挑出你还没听过的其他歌曲塞进你明天的“每⽇推荐”⾥。你第⼆天打开App发现推荐的歌⾸⾸都像量⾝定做——这就是聚类的魔⼒。4.3.4关联规则关联规则是⼀种⽆监督学习任务旨在从⼤规模数据集中发现变量或项之间有趣的隐含依赖关系或共⽣模式通常表⽰为“X→Y”的蕴含式。机器学习可以从⼤规模数据中发现变量之间的有趣关联或频繁模式。例如在超市购物篮分析中通过分析顾客购买记录可以找出“购买尿不湿的顾客往往也会购买啤酒”这样的关联规则从⽽优化商品陈列和促销策略。常⻅的算法有Apriori算法、FP-Growth算法等。啤酒尿布是数据挖掘与商业分析领域最著名的经典案例之⼀讲述了超市通过数据分析发现啤酒与尿布存在关联销售机会的故事。尽管其真实性存在争议被视为“商业寓⾔”但其背后的关联规则挖掘理论对零售业营销产⽣了深远影响。4.3.5序列预测序列预测简单来说就是利⽤过去⼀串有顺序的数据来推断未来接下来会发⽣什么。它的核⼼在于数据点之间存在顺序依赖性⾮独⽴同分布。机器学习可以利⽤历史序列数据来预测未来的元素或趋势。⽐如在⾃然语⾔处理中模型可以根据已⽣成的⽂字预测下⼀个单词从⽽实现⽂本⾃动补全或机器翻译。序列预测的常⻅算法有循环神经⽹络RNN、⻓短期记忆⽹络LSTM、⻔控循环单元GRU、Transformer等。以中英⽂翻译为例核⼼的⽣成过程本质上是由⼀系列连续的序列预测构成。• 输⼊序列源语⾔ “我 爱 学习”• ⽬标序列⽬标语⾔ “I love learning”在翻译时模型并不是瞬间变出整句英⽂⽽是⼀个词⼀个词地“预测”出来的。