DeepSeek Engram:给大模型加一本”字典”

来源:DeepSeek 2026 年 1 月发表 论文:Conditional Memory via Scalable Lookup 代码:github.com/deepseek-ai/Engram


一句话理解

Engram 给大模型加了一个”查字典”模块:高频固定知识直接查表拿答案,省下来的计算力留给真正需要动脑子的复杂推理。


解决什么问题

大模型有一个浪费:很多知识是固定模式(“中华人民共和国”、“machine learning”、常见短语搭配),但模型每次遇到都要用神经网络重新”算”一遍。

类比:你每次被问”1+1等于几”都要重新推导,而不是直接从记忆里说出”2”。Engram 就是让模型学会”这种简单的直接记住,别浪费脑子算”。


核心思想:记忆和推理分开

条件计算(MoE)条件记忆(Engram)
做什么选一个”专家”现场计算直接查表取已存好的答案
类比遇到问题找专家现场解答遇到问题翻字典直接查
适合需要推理的复杂问题固定的、反复出现的知识
速度要算,花时间查表,O(1) 常数时间

关键洞察:不是所有参数都需要”会思考”,有些只需要”记得住”。


怎么实现的(简化版)

输入一段文字
    ↓
① 识别常见短语组合(N-gram)
    ↓
② 用哈希函数查记忆表,取出预存的向量
   (就像用拼音查字典,O(1) 直接定位)
    ↓
③ 上下文门控:问自己"这个记忆和当前语境匹配吗?"
   匹配 → 用它
   不匹配 → 丢掉(防止张冠李戴)
    ↓
④ 和正常的神经网络输出合并

三个关键设计:

  • 哈希查表:不用遍历,直接定位,速度极快
  • 多头哈希:多个哈希函数防止”撞车”(确保”苹果公司”和”苹果水果”不会查到同一条记忆)
  • 上下文门控:不盲目信任记忆,必须和当前语境对得上才注入

放在模型的哪一层

实验结论:

  • 第 2 层最好:刚有了基本上下文,此时注入记忆最高效
  • 第 12 层最差:到这么深时模型已经花了大量算力去”重新推导”那些本该直接查表的东西——记忆来晚了,白费了前面的计算

类比:考试时应该一开始就把公式表摆出来(第 2 层),而不是做到一半才想起来翻公式表(第 12 层)。


最优配比:U 型曲线

DeepSeek 发现了一个”黄金比例”:

模型的参数预算怎么分配?

100% 全给推理(纯 MoE)    → 浪费算力在重复知识上
100% 全给记忆(纯 Engram) → 没有推理能力
75-80% 推理 + 20-25% 记忆  → 最优 ✅

画成图是 U 型:两个极端都差,中间平衡点最好。

类比:一个人如果只会背书不会思考(100% 记忆),或者只会推理但啥都记不住(100% 计算),都不行。最聪明的人是”该记的记住,该想的再想”。


效果数据(27B 模型)

能力没有 Engram有 Engram变化
知识问答57%61%+4
推理任务70%74%+4
长文本大海捞针84%97%+13

关键:计算成本没有增加。查表几乎不花 GPU 算力,相当于免费提升。


硬件意义

  • 记忆表存在普通内存(DRAM,便宜)里,不占 GPU 显存(HBM,天价)
  • 通过 PCIe 异步预取,性能损失 < 3%
  • 意味着:可以用便宜硬件让模型”记住”更多知识

类比:GPU 显存像你的工作台(贵但快),普通内存像旁边的书架(便宜但稍慢)。Engram 把”字典”放书架上,工作台只留给需要动手操作的活。


与 DeepSeek 产品线的关系

  • Engram 是 2026 年 1 月发表的独立研究论文
  • 已应用于 DeepSeek V4(2026 年 4 月发布),支撑了 1M token 上下文长度
  • 与 DeepSeek 之前的 MoE(混合专家)、MLA(多头潜在注意力)互补,不是替代关系

对 AI 行业的启发

  1. 不是所有问题都需要”算”:区分”该记的”和”该想的”,是一种更高效的智能架构
  2. 稀疏性有两个维度:以前只在”计算”上做稀疏(MoE 选专家),现在”记忆”也可以稀疏(Engram 选记忆)
  3. 硬件成本可以降:用便宜内存替代昂贵显存存储知识,降低大模型部署门槛
  4. 更长的上下文:记忆模块帮助模型在超长文本中保持准确率(84% → 97%)

延伸阅读