返回笔记
LLM
GPT 系列模型演进:从 GPT-1 到 GPT-4 的技术路线
GPT
OpenAI
LLM
GPT-4
生成式AI
了解 GPT 系列的发展历程,能看到大语言模型能力跃迁的完整脉络。
GPT-1(2018):证明预训练的有效性
核心论文叫"Improving Language Understanding by Generative Pre-Training"。核心思想是:先在大量无标注文本上做语言模型预训练,再在下游任务上微调。这种做法在当时并不是主流,但效果远超当时的 SOTA。
参数规模:1.17 亿。
GPT-2(2019):涌现能力的曙光
GPT-2 的参数扩大到 15 亿,能力出现了质的变化。它能生成连贯的长文本,甚至在不专门训练的情况下完成翻译、摘要等任务——这就是零样本学习的雏形。
OpenAI 最初因为"担心被滥用"而拒绝公开完整模型,引发了 AI 安全的大讨论。
GPT-3(2020):小样本学习
参数膨胀到 1750 亿。最震撼的发现是:只需要在 prompt 里给几个例子,模型就能完成各种新任务——这就是上下文学习。不需要任何参数更新,模型就"学会"了翻译、算术、代码生成等能力。
GPT-3 催生了 API 商业模式,也开启了"Prompt Engineering"的时代。
GPT-3.5 / InstructGPT(2022):学会听人话
GPT-3 虽然强大但不一定按照人类意图行事。InstructGPT 通过RLHF让人工标注员对模型输出排序,然后用强化学习优化模型,使其更符合人类的期望。
这一步让 GPT 从"会说话"变成"懂人话"。
GPT-4(2023):多模态与推理
GPT-4 不仅文本能力大幅提升,还首次支持了多模态输入(图像理解)。在律师资格考试、SAT 等标准化测试中取得了顶尖成绩。推理能力、代码能力、长文本理解都上了一个台阶。