2014
Chapter 01 · 前夜
循环神经网络统治序列建模
在 Transformer 出现之前,处理语言序列几乎只有一条路:让模型逐词读入,把信息压缩进一个不断传递的隐状态。
- RNN / LSTM 按时间步串行计算——无法并行,长文本训练缓慢。
- 2014 年 Seq2Seq + Attention(Bahdanau)出现:解码时可以「回头看」输入,缓解信息瓶颈。
- 注意力只是 RNN 的「外挂插件」——没有人想过它可以独挑大梁。
2017
Chapter 02 · 转折点
Attention Is All You Need
2017 年 6 月,Google 八位作者发表 Transformer:彻底抛弃循环结构,仅用自注意力与全连接层处理序列。
- 自注意力:每个词直接与所有词计算关联,长距离依赖一步可达。
- 多头机制:多组注意力并行,各自捕捉不同关系模式。
- 全并行:序列位置同时计算,GPU 利用率飙升,训练成本骤降。
# 注意力机制的核心公式
Attention(Q, K, V) = softmax(Q @ K.T / sqrt(d_k)) @ V
2018
Chapter 03 · 分岔
BERT 与 GPT:两条道路
同一篇论文的两半,走出了两条截然不同的路线,最终赢家出人意料。
ENCODER · 2018.10
BERT
双向编码、完形填空式预训练。擅长理解:搜索、分类、问答。曾横扫 NLP 榜单。
DECODER · 2018.06
GPT
单向解码、预测下一个词。起初只是备选路线,却因「规模越大能力越强」一路逆袭。
2020
Chapter 04 · 涌现
规模定律与能力涌现
GPT-3 用 1750 亿参数证明:当模型、数据、算力同时放大,量变会产生质变。
- Scaling Laws(2020):损失随参数量、数据量、算力呈幂律下降——放大模型成了可预测的工程。
- 涌现能力:少样本学习、推理、翻译等能力在跨越规模阈值后突然出现。
- Transformer 从「一种架构」升格为「一条技术路线的代名词」。
「预测下一个词」,变成了理解世界的方式。
NOW
Chapter 05 · 当下
LLM 时代:基础设施化
从 ChatGPT 开始,大语言模型走向应用、走向多模态、走向 Agent——Transformer 成了 AI 时代的电网。
- 对话即界面:ChatGPT(2022.11)两个月破亿用户,创下应用增长纪录。
- 开源跟进:LLaMA 等开源权重让整条技术栈平民化。
- 多模态与 Agent:视觉、语音、工具调用逐一并入同一架构范式。
历史视角的价值:看懂来路,才押得准下一站。