Appearance
0.2 LLM 在做什么事
从你发一条消息开始
你向 Claude 发了一段话,比如"帮我写一个登录页面"。在你看到回复之前,发生了什么?
第一步:把你的话变成数字
AI 看不懂文字,只能处理数字。你的话首先被切成一个个小片段,叫做 Token(词元),每个 Token 对应一个数字编号。
"帮我写一个登录页面"
→ ["帮", "我", "写", "一个", "登录", "页面"] (大概这样分)
→ [1823, 492, 7731, 256, 3847, 9012] (每个对应一个数字)💡 类比:就像电报里把文字转成莫尔斯码,AI 把文字转成它能处理的数字序列。
什么是 Token
Token 是 AI 处理文字的最小单位,但它不等于一个字或一个单词。
- 英文里,一个单词可能是一个 Token,也可能被切成几个 Token
- 中文里,每个汉字大概是 1-2 个 Token
- 标点符号、空格也是 Token
为什么你需要理解 Token?
因为 AI 的很多限制都和 Token 直接相关:
- 上下文窗口(Context Window) 就是以 Token 数量计算的
- 费用 是按 Token 数量计费的
- 响应速度 取决于生成了多少 Token
⚠️ 常见误解:很多人以为"上下文 200k"是指 200k 个字。实际上是 200k 个 Token,中文大概是 10-15 万个汉字。
什么是上下文窗口
AI 每次处理对话,都有一个"工作内存"的上限,就是上下文窗口(Context Window)。
想象 AI 是一个人,正在处理你们的对话。但这个人有一个特殊限制:它只能看到桌面上的一叠纸,纸放满了,最早的就会滑落看不见。
[系统提示] + [历史对话] + [你的新消息] + [AI 的回复]
↑ 这些加起来不能超过上下文窗口的上限这就是为什么:
- 对话太长之后,AI 会"忘记"前面说过的事
- 给 AI 塞入太多文件,它处理质量会下降
- Agent 执行复杂任务时,上下文爆满是一个常见的失控原因
AI 怎么生成回复
理解了 Token,我们来看 AI 怎么生成回复。
它不是先想好整段话再打出来,而是一个 Token 一个 Token 地预测:
- 看当前所有内容(你的消息 + 历史对话)
- 计算"下一个 Token 最可能是哪个词"(列出所有候选词,每个词分配一个可能性分数)
- 根据概率选一个 Token
- 把这个 Token 加入内容,重复第 1 步
这个过程一直持续,直到生成了"结束"信号。
这就解释了为什么 AI 是流式输出的——因为它本来就是一个词一个词生成的,不是先有整段文字再传给你。
既然只是"预测下一个词",它怎么会分析、会做不同的任务?
这是几乎所有人都会卡住的地方:预测下一个词听起来这么笨,它怎么能翻译、写代码、做总结?
一句话先说核心:"预测下一个词"要做到极致,模型被逼着学会了文字背后的规律;而你的提示词,决定了它从这些规律里调取哪一块。
1. 要"预测得准",就不得不懂规律
想想补全这几句的最后一个词:
- "小明把杯子摔在地上,杯子碎了,地上全是____" → 要填对"水/玻璃碴",得"知道"杯子会摔碎、会洒
- "因为 3 × 7 = ____" → 要填"21",得学会乘法
- "这段代码报
IndexError,因为____" → 要填对,得"懂"列表越界
⚠️ 常见误解:"预测下一个词"不是鹦鹉学舌。正因为要预测得准,模型在训练时被迫把文字背后的规律(事实、推理、代码语义)学了进去。 能力是"预测"这个目标的副产品。
2. 提示词 = 给预测引擎设定的"目的地"
模型每一步只问自己:"给定前面这一整段文字(包含你的全部提示词),下一个词最可能是什么?" 提示词一变,"最合理的续写"就完全变了:
| 你的输入开头 | 训练数据里这种开头后面通常跟着 | 于是模型续写出 |
|---|---|---|
把下面的话翻成英文:你好 | 英文译文 | Hello |
解释这段代码:for i in… | 一段中文讲解 | 代码解释 |
给我写首关于秋天的诗 | 诗句 | 一首诗 |
💡 类比:同一台导航引擎,输入不同目的地,算出完全不同的路线。模型的预测引擎是固定的,提示词就是你输入的目的地——它把引擎导向"该这么接话"的某一类模式。所谓"不同的分析处理",其实是不同提示词激活了模型学过的不同规律。
3. 一次一个词,怎么变成一整段有条理的分析?
因为它把自己刚写出的词也当成输入,再预测下一个,像滚雪球:
解释什么是递归 → "递" → "归" → "是" → "指" → …… 一路接到写完每一步都"看着到目前为止的全部内容"再往下接,所以整段连贯有逻辑。它不是先想好答案再写,而是边写边定。这也解释了为什么让它**"先写思路再给结论"(思维链)会更准**——把推理过程写出来,等于给后面的预测铺好了更靠谱的前文。
4. 它为什么"听指令"而不是接着补全指令?
这来自训练的第二阶段 SFT(监督微调):用海量"指令 → 理想回答"的配对喂它,让"看到一条指令"后最可能的续写,变成"一段合规的回答"。所以连"听话"也是学出来的预测习惯(详见 3.3 模型是怎么训练出来的)。
这一切是"喂"出来的——但它学的是规律,不是背诵
那这些规律从哪来?就是海量数据 + 这套训练方式的结果。 但这里有个关键的、必须拧准的点:
⚠️ 常见误解:以为"它把海量数据都存进去了,用时查一下"。不是。 数据量大到根本装不进模型参数(好比把整个互联网塞进几百 GB,物理上不可能)。正因为装不下,模型被逼着总结规律,而不是死记原文。
💡 类比:一个学生刷了几百万道题。只背答案——遇到没背过的新题就废了;但题太多背不完,他只能悟出解题方法,于是全新的题照样能做。大模型是后者:它没"记住"你这句话(你这句它多半没见过),但学会了语言/逻辑/代码怎么运转,所以能处理没见过的输入。
而且光有数据还不够,是三样东西凑齐才有今天的大模型:
海量数据 → 规律藏在里面的原材料
+ 合适的架构(Transformer/注意力)→ 让它一次看全上下文、抓住词与词的关系(见 3.1/3.2)
+ 预测下一个词的训练目标 → 逼它把规律学出来
+ 之后的 SFT / RLHF → 教它听话、对齐人的偏好(见 3.3)
————————————————————————————
= 你现在用的大模型它学到的是规律、不是原文——这一点同时解释了两件看似矛盾的事:为什么它能举一反三处理新问题,又为什么会一本正经地胡说(幻觉)。下面就说幻觉。
为什么 AI 会"幻觉"
"幻觉"是指 AI 一本正经地说出错误的事实,比如编造一个不存在的论文引用、给出错误的代码。
原因就在于它的工作机制:它在预测"听起来最合理的下一个词",而不是"最真实的下一个词"。
当你问一个它不确定的问题,它不会说"我不知道",而是会生成"听起来最像答案的话"——因为那才是它训练出来的模式。
💡 类比:让一个从来没去过某个城市的人,给你描述那里的街道。他可能会结合其他城市的记忆,编出一段听起来很合理的描述,但具体细节可能是错的。
📌 关键结论
- AI 把文字切成 Token 处理,Token 数量决定了费用和上下文限制
- 上下文窗口是 AI 的"工作内存",超出了就会"忘事"
- AI 是一个 Token 一个 Token 流式生成的,不是先想好再说
- "预测下一个词"要做到准,就得学会规律——能力是这个目标的副产品;提示词则决定它调取哪一块规律
- 它是海量数据喂出来的,但学的是规律、不是背诵原文(刷题悟方法,不是背答案)——这同时解释了"举一反三"和"幻觉"
- 幻觉的根本原因是"预测合理内容"而不是"确认真实内容"