AI 2025-12-20 · 15 min 阅读

大模型发展全景

大模型发展全景 从 RNN/CNN 到 Transformer、再到 MoE 与模型压缩的核心脉络。 2010年以来,数据和算力增长推动深度学习的繁荣发展,深度学习时期,核心网络架构为RNN、CNN,到大模型时代已发展成Transformer架构。RNN支撑了早期语言模型的发展,语言模型的发展体现在学习语言两个由浅入深的特征:语法和语义特征。


Transformer架构的诞生

注意力模型:捕捉长距离依赖

注意力模型最早应用于机器翻译问题,解决RNNs带来的问题:

自注意力机制:语义理解的钥匙

多头注意力:并行计算不同子空间的特征

其中包括前馈网络(Feed Forward),全连接层。

位置编码:引入序列位置信息

并行计算的挑战:为何需要位置信息?

结论:Transformer需要⼀种显式的⽅法,将序列中每个词语的位置信息注⼊到其向量表示中,以便模型能够理解词语之间的顺序和相对距离。

大模型技术突破与前沿趋势

大模型有什么特点?

  1. 参数规模巨大,AlexNet参数规模(0.06B), 经典的图像分类CNN,参数量很小。GPT-3 (davinci) 参数规模(175B),早期的超大型语言模型,需多张高端GPU并行。DeepSeek-V3 (MoE) 参数规模总计6710亿 (671B)。
  2. 训练数据海量,GPT-3预训练数据集Tokens超5000亿,LLaMA 1预训练数据集 Tokens超万亿,DeepSeek-v3预训练数据集Tokens 14.8万亿。
  3. 令人惊艳的“涌现能力” (Emergent Abilities),上下⽂学习 (In-context Learning)、思维链 (Chain-of-Thought)、零样本/少样本学习 (Zero/Few-shot Learning)。
  4. 强大的泛化与通用性,泛化性强、通⽤性好 (Foundation Models),⽐如:同⼀个⼤语⾔模型,可以⽤来做翻译、写摘要、当客服、写代码、创作故事等。

混合专家模型(MoE):动态路由机制

DeepSeek-V2提出DeepSeekMoE(DeepSeek, 2024):

  1. 细粒度专家分割:将专家划分为更细粒度(如160个路由专家),并通过2个共享专家隔离减少冗余,提升专家专业化能力。
  2. 设备限制路由与负载平衡:引入设备级路由限制(每token最多访问3台设备)和三级平衡损失(专家级、设备级、通信级),降低并行通信开销,同时通过Token丢弃策略缓解负载不均问题。
  3. 参数激活稀疏性:每个token仅激活21B参数(总参数236B),结合专家并行和优化框架(HAI-LLM),训练成本较DeepSeek 67B降低42.5%(每万亿token消耗172.8K GPU小时)。
  4. 混合精度与算子优化:使用FP8参数和6位KV缓存量化,结合定制化的CUDA内核(如FlashAttention-2改进版)提升计算效率。

模型压缩与加速:量化、知识蒸馏

⽬标:在尽量不损失模型性能的前提下,减⼩模型体积、降低计算量、提⾼推理速度,主要的技术方向有:

  1. 模型剪枝 (Pruning): 移除模型中不重要的参数(权重、连接、甚至神经元)。
  2. 模型量化 (Quantization): 降低模型参数和计算的数值精度。
  3. 知识蒸馏 (Knowledge Distillation): 用大模型的输出/行为指导训练一个小模型。
  4. 网络结构搜索 (NAS) / 低秩分解 (Low-Rank Factorization) 等。

模型压缩:知识蒸馏 (Knowledge Distillation),利⽤⼀个已经训练好的、性能强⼤的⼤模型(“教师模型”)的知识,来训练⼀个更⼩、更快的模型(“学⽣模型”)。

# AI