返回笔记
LLM
LLaMA 模型家族:开源大模型的中流砥柱
LLaMA
Meta
开源大模型
LLaMA3
GQA
Meta 开源的 LLaMA 系列彻底改变了 AI 格局。它证明了高性能大模型不需要闭源,任何人都有机会参与。
LLaMA 1(2023年2月)
Meta 第一个开源大语言模型,7B 到 65B 参数。核心创新是训练数据的优化:用更多的训练数据(1.4T tokens)训练更小的模型。结果是 13B 的 LLaMA 在多数基准上超过了 175B 的 GPT-3。
这一发现改变了行业认知:数据质量比模型大小重要。
LLaMA 2(2023年7月)
- 训练数据翻倍到 2T tokens
- 上下文窗口从 2048 扩到 4096
- 引入 GQA(分组查询注意力)提升推理效率
- 首次加入 RLHF 对齐,开源了奖励模型
- 商业友好许可,引爆了开源大模型生态
Code LLaMA
在 LLaMA 2 基础上用代码数据继续训练,编程能力大幅提升。支持代码填充、长上下文代码理解。
LLaMA 3(2024年4月)
- 8B 和 70B 两个版本,训练数据暴增到 15T tokens
- 词汇表扩大到 128K,多语言能力大幅提升
- 采用分组查询注意力,推理效率再提升
- 128K 上下文窗口
- 全新的 tokenizer,对代码和数学符号更友好
LLaMA 3 8B 在多项基准上超越了 LLaMA 2 70B,展示了训练效率的惊人提升。
LLaMA 对行业的影响
LLaMA 的开源催生了 Alpaca、Vicuna、Mistral 等众多衍生模型,形成了繁荣的开源 LLM 生态。它证明了闭源不是唯一的路径。