大模型发展全景
大模型发展全景 从 RNN/CNN 到 Transformer、再到 MoE 与模型压缩的核心脉络。 2010年以来,数据和算力增长推动深度学习的繁荣发展,深度学习时期,核心网络架构为RNN、CNN,到大模型时代已发展成Transformer架构。RNN支撑了早期语言模型的发展,语言模型的发展体现在学习语言两个由浅入深的特征:语法和语义特征。
Transformer架构的诞生
注意力模型:捕捉长距离依赖
注意力模型最早应用于机器翻译问题,解决RNNs带来的问题:
- 解决传统编码器-解码器模型的挑战,避免信息损失和无法建模输入输出对齐问题。
- 允许解码器访问整个编码的输入序列,通过注意力权重选择性地关注相关信息。
- 自动学习注意力权重,捕捉编码器和解码器之间的相关性。
- 构建上下文向量,使解码器能够全面访问输入序列并重点关注相关部分。
- 提高模型性能,改善输出质量,并提供更好的解释性。
自注意力机制:语义理解的钥匙
- 注意力机制有助于克服循环神经网络(
RNNs)的一些挑战,例如输 入序列长度增加时性能下降和顺序处理输入导致的计算效率低下。 - 在自然语言处理(
NLP)、计算机视觉(Computer Vision)、跨模 态任务和推荐系统等多个领域中,注意力机制已成为多项任务中的最 先进模型,取得了显著的性能提升。 - 注意力机制不仅可以提高主要任务的性能,还具有其他优势。它们被 广泛用于提高神经网络的可解释性,帮助解释模型的决策过程,使得 原本被认为是黑盒模型的神经网络变得更易解释。这对于人们对机器 学习模型的公平性、可追溯性和透明度的关注具有重要意义。
多头注意力:并行计算不同子空间的特征
其中包括前馈网络(Feed Forward),全连接层。
位置编码:引入序列位置信息
并行计算的挑战:为何需要位置信息?
- 序列模型的演进: 传统的循环神经⽹络(
RNN)及其变体(LSTM,GRU)通过顺序处理输⼊序列,其隐藏状态天然地编码了词语的上下⽂和位置信息。 Transformer的优势:Transformer架构的核⼼是⾃注意⼒机制,它允许模型并⾏处理整个输⼊序列,极⼤地提⾼了计算效率和捕捉⻓距离依赖的能⼒。- 并⾏化的代价:然⽽,纯粹的⾃注意⼒计算会同时关注序列中的所有词语,计算每个词与其他所有词之间的关系。在这个过程中,模型并不知道词语在原始序列中的位置或顺序。
- 信息丢失: 如果不引⼊额外的位置信息,“我爱你” 和 “你爱我” 这两个句⼦,虽然词语相同,但顺序不同,含义完全相反。仅依赖⾃注意⼒机制,模型难以区分这种顺序差异。
结论:Transformer需要⼀种显式的⽅法,将序列中每个词语的位置信息注⼊到其向量表示中,以便模型能够理解词语之间的顺序和相对距离。
大模型技术突破与前沿趋势
大模型有什么特点?
- 参数规模巨大,
AlexNet参数规模(0.06B), 经典的图像分类CNN,参数量很小。GPT-3(davinci) 参数规模(175B),早期的超大型语言模型,需多张高端GPU并行。DeepSeek-V3(MoE) 参数规模总计6710亿 (671B)。 - 训练数据海量,
GPT-3预训练数据集Tokens超5000亿,LLaMA 1预训练数据集Tokens超万亿,DeepSeek-v3预训练数据集Tokens 14.8万亿。 - 令人惊艳的“涌现能力” (
Emergent Abilities),上下⽂学习 (In-context Learning)、思维链 (Chain-of-Thought)、零样本/少样本学习 (Zero/Few-shot Learning)。 - 强大的泛化与通用性,泛化性强、通⽤性好 (
Foundation Models),⽐如:同⼀个⼤语⾔模型,可以⽤来做翻译、写摘要、当客服、写代码、创作故事等。
混合专家模型(MoE):动态路由机制
DeepSeek-V2提出DeepSeekMoE(DeepSeek, 2024):
- 细粒度专家分割:将专家划分为更细粒度(如
160个路由专家),并通过2个共享专家隔离减少冗余,提升专家专业化能力。 - 设备限制路由与负载平衡:引入设备级路由限制(每
token最多访问3台设备)和三级平衡损失(专家级、设备级、通信级),降低并行通信开销,同时通过Token丢弃策略缓解负载不均问题。 - 参数激活稀疏性:每个
token仅激活21B参数(总参数236B),结合专家并行和优化框架(HAI-LLM),训练成本较DeepSeek 67B降低42.5%(每万亿token消耗172.8K GPU小时)。 - 混合精度与算子优化:使用
FP8参数和6位KV缓存量化,结合定制化的CUDA内核(如FlashAttention-2改进版)提升计算效率。
模型压缩与加速:量化、知识蒸馏
⽬标:在尽量不损失模型性能的前提下,减⼩模型体积、降低计算量、提⾼推理速度,主要的技术方向有:
- 模型剪枝 (
Pruning): 移除模型中不重要的参数(权重、连接、甚至神经元)。 - 模型量化 (
Quantization): 降低模型参数和计算的数值精度。 - 知识蒸馏 (
Knowledge Distillation): 用大模型的输出/行为指导训练一个小模型。 - 网络结构搜索 (
NAS) / 低秩分解 (Low-Rank Factorization) 等。
模型压缩:知识蒸馏 (Knowledge Distillation),利⽤⼀个已经训练好的、性能强⼤的⼤模型(“教师模型”)的知识,来训练⼀个更⼩、更快的模型(“学⽣模型”)。