拾星 · AI 与大模型

什么是 LLM:一台读遍人类文字、特别会「接话」的机器

从「猜下一个词」讲起,把 token、训练、注意力机制、幻觉这些概念一次讲清楚

约 8 分钟读完 · 配套视频 1:12
ChatGPT、Claude、DeepSeek 背后,都是 LLM
ChatGPT、Claude、DeepSeek 背后,都是 LLM

LLM 是什么

LLM 是 Large Language Model 的缩写,中文叫大语言模型。拆开看:

你平时用的 ChatGPT、Claude、DeepSeek、豆包等,是「产品」;它们背后驱动对话的,就是 LLM。产品会在模型之外再加上界面、记忆、联网搜索、工具调用等功能。

核心原理:它只做一件事——猜下一个词

给定前文,模型会算出每个候选词的概率
给定前文,模型会算出每个候选词的概率

一个最简单的例子

输入「今天天气真」,模型会对「下一个词」给出一个概率分布,比如:

候选 概率(示意)
好 62%
不错 18%
热 11%
冷 6%

它从中选出一个词,比如「好」,拼到句子后面,得到「今天天气真好」。然后把整句话再输入一遍,继续猜下一个词。如此循环,一个词接一个词地「写」出整段回答。这种方式叫自回归生成。

前文 今天天气真 LLM 算出每个词的概率 选出一个词 「好」 接回前文,继续猜
自回归生成:每次只预测一个 token,然后把它接回输入,反复进行

为什么同一个问题,每次回答不一样

因为模型并不总是选概率最高的那个词,而是按概率「抽签」。控制抽签方式的常见参数有:

写代码、做数学时一般用低温度;写故事、头脑风暴时可以适当调高。

准确说,它猜的是 token

模型处理的最小单位不是「字」或「词」,而是 token。一个 token 可能是一个完整的英文单词、一个词根、一个汉字,也可能是半个汉字的编码片段,取决于模型使用的分词器(tokenizer)。

这有几个实际影响:

它是怎么学会「猜」的

读海量文字,猜错就微调参数,重复无数次
读海量文字,猜错就微调参数,重复无数次

第一阶段:预训练

模型最开始是一堆随机的数字(参数),什么也不会。训练时,把海量文本切成片段,遮住每个位置的下一个 token,让模型去猜:

  1. 模型给出预测的概率分布;
  2. 和真实答案对比,算出「错了多少」(这个数叫损失);
  3. 用反向传播算出每个参数该往哪个方向调、调多少;
  4. 按这个方向把所有参数微调一点点。

这样的过程要重复成千上万亿次。训练数据包括书籍、网页、百科、论文、代码等。因为答案就藏在文本本身里,不需要人工标注,所以这种方法叫自监督学习。

为了把下一个词猜准,模型必须在内部学会语法、常识、事实,甚至一定程度的推理能力。这就是为什么「只是猜下一个词」的模型,却能表现出相当的「理解」能力。

第二阶段:让它变成「助手」

只做过预训练的模型更像一个「续写机器」:你问它一个问题,它可能会接着写出更多问题,而不是回答。要把它变成好用的助手,还需要:

参数是什么

参数就是模型内部那些可以调整的数字,视频里把它比作「旋钮」。模型学到的所有知识和能力,都以某种分布式的方式存储在这些数字里。参数越多,模型的容量通常越大,但训练和运行的成本也越高。

关键结构:Transformer 与注意力机制

注意力机制:「它」最关注的是「小猫」
注意力机制:「它」最关注的是「小猫」

「它」指的是谁

看这句话:「小猫追着球跑,因为它饿了。」人很容易知道「它」指的是小猫,因为球不会饿。模型要做到这一点,就必须在处理「它」的时候,回头看看前文里每个词,判断谁和它最相关。

这就是注意力机制(attention)做的事。在处理每个 token 时,模型会计算它与上下文中其他所有 token 的相关程度(注意力权重),然后按权重把这些信息汇总起来。

稍微技术一点的解释

在自注意力中,每个 token 会生成三个向量:

用一个 token 的 Query 去和所有 token 的 Key 做比较,得到相关度分数,再归一化成权重,最后用这些权重对 Value 做加权求和。这样,「它」就能从「小猫」那里拿到最多的信息。

真实的模型会同时运行很多组这样的计算(多头注意力),每一组可以关注不同的关系,比如指代关系、语法关系、主题关系等。再把这样的层堆叠几十层,就构成了模型的主体。

Transformer 的由来

这种以注意力为核心的结构叫 Transformer,出自 2017 年谷歌研究人员发表的论文《Attention Is All You Need》。GPT 的全称是 Generative Pre-trained Transformer,最后那个 T 指的就是它。

相比之前的循环神经网络(RNN),Transformer 可以并行处理整段文字,非常适合在大量 GPU 上训练,这也是大模型得以「做大」的关键原因之一。

上下文窗口

模型一次能「看到」的 token 数量是有限的,这叫上下文窗口。超过窗口的内容,模型就看不到了。这也是为什么很长的对话里,模型有时会「忘记」最开始说过的话。

它的短板

三个短板:会编、知识有截止时间、重要的事要核实
三个短板:会编、知识有截止时间、重要的事要核实

1. 会一本正经地胡说(幻觉)

模型的训练目标是生成「看起来合理」的文字,而不是「保证正确」的文字。当它不知道答案时,并不一定会说「我不知道」,而可能编出一个听起来很像真的回答,比如不存在的论文、错误的数据。这种现象叫幻觉(hallucination)。

2. 知识有截止时间

模型的知识来自训练数据,训练数据有截止日期。在那之后发生的事,模型原本并不知道,除非产品给它接上了搜索等工具。

3. 不擅长精确计算和「数数」

因为是按 token 生成文字,模型在大数乘法、精确计数这类任务上容易出错。很多产品会让模型调用计算器或代码执行工具来弥补。

怎么缓解

怎么用好 LLM

  1. 把背景讲清楚:你是谁、要做什么、给谁看、有什么限制。
  2. 给例子:想要什么格式,就给它一个样例。
  3. 让它分步思考:复杂问题让它先列出思路再作答。
  4. 追问和修改:第一次结果不满意,指出具体哪里不好,让它改。
  5. 核实关键信息:数字、引用、法律和医疗相关内容,务必再确认。

名词速查

名词 一句话解释
Token 模型处理文字的最小单位
参数 模型内部可调整的数字,存储学到的知识
预训练 在海量文本上练习「猜下一个词」
微调 / RLHF 让模型学会按指令回答、符合人类偏好
Transformer 以注意力机制为核心的神经网络结构
注意力 计算每个 token 该关注上下文中的哪些部分
上下文窗口 模型一次能看到的最大 token 数
温度 控制输出随机程度的参数
幻觉 模型生成看似合理但实际错误的内容

总结

LLM:Large Language Model,大语言模型
LLM:Large Language Model,大语言模型

一句话概括:LLM 是一个通过阅读海量文字、学会「猜下一个词」的模型。 它借助 Transformer 和注意力机制理解上下文,通过预训练获得知识,通过微调学会做一个助手。它很强大,但也会编造、有知识截止时间。了解它的原理,才能更好地用它。

参考资料

  • Vaswani, A., et al. (2017). Attention Is All You Need. NeurIPS.
  • Radford, A., et al. (2018). Improving Language Understanding by Generative Pre-Training. OpenAI.
  • Brown, T., et al. (2020). Language Models are Few-Shot Learners. NeurIPS.
  • Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. NeurIPS.
← 拾星首页▶ 看配套视频
← 已是第一章目录下一章:Embedding 向量 →