2014

Chapter 01 · 前夜

循环神经网络统治序列建模

在 Transformer 出现之前,处理语言序列几乎只有一条路:让模型逐词读入,把信息压缩进一个不断传递的隐状态。

  • RNN / LSTM 按时间步串行计算——无法并行,长文本训练缓慢。
  • 2014 年 Seq2Seq + Attention(Bahdanau)出现:解码时可以「回头看」输入,缓解信息瓶颈。
  • 注意力只是 RNN 的「外挂插件」——没有人想过它可以独挑大梁。
2017

Chapter 02 · 转折点

Attention Is All You Need

2017 年 6 月,Google 八位作者发表 Transformer:彻底抛弃循环结构,仅用自注意力与全连接层处理序列。

  • 自注意力:每个词直接与所有词计算关联,长距离依赖一步可达。
  • 多头机制:多组注意力并行,各自捕捉不同关系模式。
  • 全并行:序列位置同时计算,GPU 利用率飙升,训练成本骤降。
# 注意力机制的核心公式 Attention(Q, K, V) = softmax(Q @ K.T / sqrt(d_k)) @ V
2018

Chapter 03 · 分岔

BERT 与 GPT:两条道路

同一篇论文的两半,走出了两条截然不同的路线,最终赢家出人意料。

ENCODER · 2018.10

BERT

双向编码、完形填空式预训练。擅长理解:搜索、分类、问答。曾横扫 NLP 榜单。

DECODER · 2018.06

GPT

单向解码、预测下一个词。起初只是备选路线,却因「规模越大能力越强」一路逆袭。

2020

Chapter 04 · 涌现

规模定律与能力涌现

GPT-3 用 1750 亿参数证明:当模型、数据、算力同时放大,量变会产生质变。

  • Scaling Laws(2020):损失随参数量、数据量、算力呈幂律下降——放大模型成了可预测的工程。
  • 涌现能力:少样本学习、推理、翻译等能力在跨越规模阈值后突然出现。
  • Transformer 从「一种架构」升格为「一条技术路线的代名词」。

「预测下一个词」,变成了理解世界的方式。

NOW

Chapter 05 · 当下

LLM 时代:基础设施化

从 ChatGPT 开始,大语言模型走向应用、走向多模态、走向 Agent——Transformer 成了 AI 时代的电网。

  • 对话即界面:ChatGPT(2022.11)两个月破亿用户,创下应用增长纪录。
  • 开源跟进:LLaMA 等开源权重让整条技术栈平民化。
  • 多模态与 Agent:视觉、语音、工具调用逐一并入同一架构范式。

历史视角的价值:看懂来路,才押得准下一站。

2014 2017 2018 2020 NOW
← 返回历史·星轨 1 / 5
键盘 / 滚轮翻页 · 点击时间轴节点跳转