📈 机器学习 🟢 入门 ⏱ 12 分钟

🧩 AI 基础原理:从机器学习到大模型

机器学习、深度学习是什么?大模型的本质又是什么?一张图串起整条 AI 底层逻辑。

1

从「写规则」到「喂数据」

📜 传统编程:人写规则

以前我们写规则:「如果邮件含『中奖』就判为垃圾」。

规则一多、一复杂,就写不动了——现实世界的规律根本列不完。

📊 机器学习:喂数据找规律

机器学习反过来:喂大量「输入→答案」的例子,让机器自己总结规律。

它不背规则,而是学「怎么从数据里找规律」。

📜 传统:人写死规则
判断垃圾邮件
1 手动列规则:含『中奖』→ 垃圾
2 规则漏一个骗术,就得补一条
3 规则无穷无尽,写不完 ❌
📊 机器学习:喂数据
给 10000 封已标记的邮件
1 喂「邮件内容 + 是否垃圾」
2 模型自己学出规律
3 新邮件自动分类 ✅
2

机器学习:三类学习方式

🎯 机器学习是啥

机器学习 = 用数据驱动的方式让机器自动找规律,而不是人写死规则。

核心三要素:数据、模型、优化。按「喂什么数据」分成三类。

学习方式数据核心例子
监督学习有标签(输入+答案)学映射:输入→答案垃圾邮件分类、房价预测
无监督学习无标签找结构 / 规律聚类、降维、压缩
强化学习试错 + 奖励信号学策略:怎么行动下棋、玩游戏、对齐
3

深度学习:机器学习的一个分支

🧠 神经网络

深度学习用多层神经网络自动学特征。

以前要人手写特征(把图片变成能算的数字);深度学习自动提取特征,一层层加工。

🚀 为什么强

层数多、参数多,能捕捉复杂规律。

配合海量数据 + 强大算力,效果碾压传统方法。现在的图像、语音、语言模型基本都是它。

📥 输入层数据进入
🧱 隐藏层×N逐层提取特征
📤 输出层给出预测
📉 算损失预测与答案差距
🔁 反向传播更新权重
🔄 训练循环:前向预测 → 算损失 → 反向更新权重 → 再来一次
4

模型训练的本质:优化逼近最优解

📉 损失函数

模型预测和正确答案有差距,用损失函数衡量「差多少」。

训练的目标,就是让这个差距越来越小。

🧭 优化算法

梯度下降一步步调整模型参数,让损失不断下降,逼近最优解。

这就是「用优化算法不断逼近最优解」的真身。

一句话理解训练:前向算预测 → 算损失 → 反向更新权重 → 循环

数据越多、训练越久、模型参数越多,它就学得越准——直到损失降到够低。

5

大模型的本质:无监督预训练 + 强化学习

📚 无监督预训练

大模型先在海量文本上做无监督学习——让模型预测下一个 token,自己学语言规律。

这步不需要人工标注,所以能吞下整个互联网。

🤝 强化学习对齐

再通过强化学习(RLHF):用人类反馈当奖励,让模型学会「符合人类偏好」的回答。

模型的实力 = 预训练的「」 + 后训练的「」。

阶段学习方法数据作用
预训练无监督学习海量互联网文本学会语言规律(会说话)
对齐/后训练强化学习(RLHF)人类反馈学会符合偏好(说得好)

所以大模型的本质并不神秘:它先无监督地读遍全网学会语言,再用强化学习学会怎么当好助手——底层仍是机器学习/深度学习那一套「数据 + 模型 + 优化」

6

一句话串起整条链路

🔗 四个环节

数学表示:把现实问题变成可计算的形式(数据、向量)
数据驱动:用机器学习/深度学习从数据里找规律
优化逼近:用梯度下降等算法不断逼近最优解
完成任务:最终做识别、决策或生成

一句话串起来

AI 的基础原理 = 用数学把现实问题表示成可计算的形态,用数据驱动的方式(机器学习/深度学习)找到规律,再用优化算法不断逼近最优解,最终完成识别、决策或生成任务。

🎤 面试问答 · 口语化回答
AI 基础是面试必考,这几问几乎必被问到:
面试官机器学习是什么?监督/无监督/强化学习怎么区分?

机器学习就是让机器从数据里自己找规律,而不是人写死规则。核心三要素是数据、模型、优化。区分三大类:监督学习喂有标签的数据学输入到答案的映射;无监督学习没有标签,让它自己找结构;强化学习靠试错和奖励信号学怎么做。

💡 加分点:补一句能串起来:大模型的预训练用无监督,对齐用强化学习,正好覆盖两类。
面试官深度学习和机器学习什么关系?

深度学习是机器学习的一个分支,核心是神经网络,能自动提取特征,不用人手工做特征工程。它的优势是靠海量数据和算力,模型规模大、能捕捉复杂规律,所以现在图像、语音、语言这些领域基本都是它。

💡 加分点:可以强调:所有深度学习本质还是“数据 + 模型 + 优化”那套,只是模型结构更复杂。
面试官大模型的本质是什么?

大模型本质还是机器学习那一套。它先做无监督预训练——在海量文本上预测下一个 token,学会语言规律;再做强化学习对齐(RLHF),用人类反馈当奖励,学会符合人类偏好的回答。所以它的实力 = 预训练的“会” + 后训练的“好”。

💡 加分点:把这个和“AI 基础原理的一句话”连起来讲,会显得你对整条链路有完整把握,是很好的加分。
00:00