2024-12-10:Transformer 与 DeepSeek 创新


基本信息

  • 日期: 2024-12-10
  • 主题: Transformer 架构基础 + DeepSeek 的创新
  • 关键词: Transformer, Self-Attention, Multi-Head Attention, MLA, MoE, DeepSeek

探索背景

首次系统性学习大模型的核心架构——Transformer,并了解国产模型 DeepSeek 在此基础上的创新优化。


探索路径

Transformer 是什么?
      ↓
它解决了什么问题?(RNN 的局限)
      ↓
核心机制:自注意力(Self-Attention)
      ↓
多头注意力(Multi-Head Attention)
      ↓
DeepSeek 的创新:MLA + MoE

核心收获

1. Transformer = 大模型的骨架

  • 2017 年 Google 提出
  • 解决了 RNN 无法并行、长距离依赖的问题
  • 核心是”注意力机制”——让每个词都能看到所有其他词

2. 注意力机制 = 学会”抓重点”

  • Q(Query):我想找什么?
  • K(Key):我有什么特征?
  • V(Value):我的实际内容
  • 通过 Q×K 计算相关性,用相关性加权 V

3. 多头注意力 = 多角度分析

  • 单头只能学一种关注模式
  • 多头可以同时学习:语法关系、位置关系、语义关系等
  • 最后综合所有头的分析结果

4. DeepSeek 的两大创新

创新解决的问题效果
MLAKV Cache 太大压缩 93%+
MoE参数大=计算大671B 只激活 37B

关键类比

  • Transformer = 学霸的大脑结构
  • 注意力机制 = 学霸的”抓重点”能力
  • 多头注意力 = 多位专家会诊
  • MoE = 按需咨询不同专家

建立的笔记

文件路径
Transformer 详解Transformer.md
注意力机制注意力机制.md
DeepSeek 架构DeepSeek.md

待探索问题

  • 位置编码(Positional Encoding)的细节
  • Layer Normalization 为什么重要
  • RLHF 是如何训练的
  • GPT 系列的演进历程
  • MoE 的路由机制更多细节

感想

Transformer 的核心思想其实很直觉——让每个词都能”看到”其他词,自己决定该关注谁。DeepSeek 的创新则展示了:在基础架构上做精细优化,可以大幅降低成本,让更多人能参与 AI 的发展。


记录时间: 2024-12-10