🧩 AI 基础原理:从机器学习到大模型
机器学习、深度学习是什么?大模型的本质又是什么?一张图串起整条 AI 底层逻辑。
从「写规则」到「喂数据」
📜 传统编程:人写规则
以前我们写规则:「如果邮件含『中奖』就判为垃圾」。
规则一多、一复杂,就写不动了——现实世界的规律根本列不完。
📊 机器学习:喂数据找规律
机器学习反过来:喂大量「输入→答案」的例子,让机器自己总结规律。
它不背规则,而是学「怎么从数据里找规律」。
机器学习:三类学习方式
🎯 机器学习是啥
机器学习 = 用数据驱动的方式让机器自动找规律,而不是人写死规则。
核心三要素:数据、模型、优化。按「喂什么数据」分成三类。
| 学习方式 | 数据 | 核心 | 例子 |
|---|---|---|---|
| 监督学习 | 有标签(输入+答案) | 学映射:输入→答案 | 垃圾邮件分类、房价预测 |
| 无监督学习 | 无标签 | 找结构 / 规律 | 聚类、降维、压缩 |
| 强化学习 | 试错 + 奖励信号 | 学策略:怎么行动 | 下棋、玩游戏、对齐 |
深度学习:机器学习的一个分支
🧠 神经网络
深度学习用多层神经网络自动学特征。
以前要人手写特征(把图片变成能算的数字);深度学习自动提取特征,一层层加工。
🚀 为什么强
层数多、参数多,能捕捉复杂规律。
配合海量数据 + 强大算力,效果碾压传统方法。现在的图像、语音、语言模型基本都是它。
模型训练的本质:优化逼近最优解
📉 损失函数
模型预测和正确答案有差距,用损失函数衡量「差多少」。
训练的目标,就是让这个差距越来越小。
🧭 优化算法
梯度下降一步步调整模型参数,让损失不断下降,逼近最优解。
这就是「用优化算法不断逼近最优解」的真身。
一句话理解训练:前向算预测 → 算损失 → 反向更新权重 → 循环。
数据越多、训练越久、模型参数越多,它就学得越准——直到损失降到够低。
大模型的本质:无监督预训练 + 强化学习
📚 无监督预训练
大模型先在海量文本上做无监督学习——让模型预测下一个 token,自己学语言规律。
这步不需要人工标注,所以能吞下整个互联网。
🤝 强化学习对齐
再通过强化学习(RLHF):用人类反馈当奖励,让模型学会「符合人类偏好」的回答。
模型的实力 = 预训练的「会」 + 后训练的「好」。
| 阶段 | 学习方法 | 数据 | 作用 |
|---|---|---|---|
| 预训练 | 无监督学习 | 海量互联网文本 | 学会语言规律(会说话) |
| 对齐/后训练 | 强化学习(RLHF) | 人类反馈 | 学会符合偏好(说得好) |
所以大模型的本质并不神秘:它先无监督地读遍全网学会语言,再用强化学习学会怎么当好助手——底层仍是机器学习/深度学习那一套「数据 + 模型 + 优化」。
一句话串起整条链路
🔗 四个环节
① 数学表示:把现实问题变成可计算的形式(数据、向量)
② 数据驱动:用机器学习/深度学习从数据里找规律
③ 优化逼近:用梯度下降等算法不断逼近最优解
④ 完成任务:最终做识别、决策或生成
AI 的基础原理 = 用数学把现实问题表示成可计算的形态,用数据驱动的方式(机器学习/深度学习)找到规律,再用优化算法不断逼近最优解,最终完成识别、决策或生成任务。
机器学习就是让机器从数据里自己找规律,而不是人写死规则。核心三要素是数据、模型、优化。区分三大类:监督学习喂有标签的数据学输入到答案的映射;无监督学习没有标签,让它自己找结构;强化学习靠试错和奖励信号学怎么做。
深度学习是机器学习的一个分支,核心是神经网络,能自动提取特征,不用人手工做特征工程。它的优势是靠海量数据和算力,模型规模大、能捕捉复杂规律,所以现在图像、语音、语言这些领域基本都是它。
大模型本质还是机器学习那一套。它先做无监督预训练——在海量文本上预测下一个 token,学会语言规律;再做强化学习对齐(RLHF),用人类反馈当奖励,学会符合人类偏好的回答。所以它的实力 = 预训练的“会” + 后训练的“好”。