返回笔记
LLM

LLaMA 模型家族:开源大模型的中流砥柱

LLaMA Meta 开源大模型 LLaMA3 GQA

Meta 开源的 LLaMA 系列彻底改变了 AI 格局。它证明了高性能大模型不需要闭源,任何人都有机会参与。

LLaMA 1(2023年2月)

Meta 第一个开源大语言模型,7B 到 65B 参数。核心创新是训练数据的优化:用更多的训练数据(1.4T tokens)训练更小的模型。结果是 13B 的 LLaMA 在多数基准上超过了 175B 的 GPT-3。

这一发现改变了行业认知:数据质量比模型大小重要

LLaMA 2(2023年7月)

  • 训练数据翻倍到 2T tokens
  • 上下文窗口从 2048 扩到 4096
  • 引入 GQA(分组查询注意力)提升推理效率
  • 首次加入 RLHF 对齐,开源了奖励模型
  • 商业友好许可,引爆了开源大模型生态

Code LLaMA

在 LLaMA 2 基础上用代码数据继续训练,编程能力大幅提升。支持代码填充、长上下文代码理解。

LLaMA 3(2024年4月)

  • 8B 和 70B 两个版本,训练数据暴增到 15T tokens
  • 词汇表扩大到 128K,多语言能力大幅提升
  • 采用分组查询注意力,推理效率再提升
  • 128K 上下文窗口
  • 全新的 tokenizer,对代码和数学符号更友好

LLaMA 3 8B 在多项基准上超越了 LLaMA 2 70B,展示了训练效率的惊人提升。

LLaMA 对行业的影响

LLaMA 的开源催生了 Alpaca、Vicuna、Mistral 等众多衍生模型,形成了繁荣的开源 LLM 生态。它证明了闭源不是唯一的路径。