如果只记住一句话:大模型不是从数据库里“取出一句答案”,而是在上下文条件下连续生成 Token。它的能力来自大规模预训练形成的参数表示、Transformer 的上下文建模,以及之后的指令对齐。

第一步:文本先被切成 Token

模型不直接读取“文字含义”。输入会先被分词器拆成 Token,它可能是一个汉字、词的一部分、标点或代码片段。每个 Token 被映射成一个高维向量;位置信息则让模型知道它出现在序列的哪里。

这意味着模型看到的是一串向量,而不是人类意义上的句子。长文本消耗多少上下文,也取决于分词结果,而不等同于字数。

文本Token向量注意力层概率分布下一 Token

第二步:注意力决定“现在该看哪里”

2017 年的 Transformer 论文提出仅依赖注意力机制的架构,摆脱了当时序列模型对循环网络的依赖。自注意力会为当前位置构造 Query,并与上下文各位置的 Key 计算相关性,再按权重汇总对应的 Value。

Attention(Q, K, V) = softmax(QKᵀ / √d) V

直觉上,这是一种动态的信息路由:处理“它把杯子放在桌上,因为它很稳”时,不同注意力头可能分别捕捉指代、语法与语义关系。多层堆叠后,每个位置的表示都吸收了上下文信息。

第三步:预训练压缩语言世界的规律

训练时,模型反复预测被遮住或接下来的 Token,预测错误就通过梯度更新参数。规模足够大时,语法、常识、文体、代码模式和部分推理结构会以分布式方式进入参数。

GPT-3 论文展示了大规模自回归语言模型可以在不更新参数的情况下,仅依靠提示里的示例完成多种任务,也就是“上下文学习”。但参数中学到的是统计规律,不是一套随时准确、可追溯、可更新的事实库。因此,流畅表达不等于事实正确。

第四步:生成是一次次选择,不是整段吐出

推理时,模型先得到词表上每个 Token 的概率,再通过贪心、温度或 top-p 等策略选择一个 Token,把它追加到上下文,再重复计算。温度较低通常更稳定,较高则增加多样性,也增加偏离和错误的可能。

这也解释了为什么模型可能在长回答后段“走偏”:此前每一次生成都会成为下一步的新条件,小偏差可能逐步累积。

第五步:对齐让模型更像助手

只做预训练的模型擅长续写,却未必会遵循用户意图。InstructGPT 研究使用人工示范、输出排序和人类反馈进行进一步训练。在该论文的评测分布上,1.3B 参数的 InstructGPT 输出甚至比 175B 参数的 GPT-3 更受标注者偏好。这说明“参数更多”与“更会按要求办事”不是同一件事。

工程上的结论

把模型当成概率生成器,而不是确定性数据库。涉及事实时补充检索与来源;涉及行动时增加权限、验证和审计;涉及稳定格式时使用结构化输出和程序校验。

三个常见误解

  1. “模型在搜索训练数据。”通常不是。标准推理主要在参数上计算;只有接入搜索或 RAG 时才会读取外部资料。
  2. “上下文越长,模型就一定记得越好。”上下文容量只是上限,信息位置、干扰内容和模型能力都会影响实际利用率。
  3. “回答很确定,所以事实可靠。”语言模型优化的是合适的 Token 概率,而不是天然附带事实验证。

资料来源