DeepSeek Engram:给大模型加一本”字典”
来源:DeepSeek 2026 年 1 月发表 论文:Conditional Memory via Scalable Lookup 代码:github.com/deepseek-ai/Engram
一句话理解
Engram 给大模型加了一个”查字典”模块:高频固定知识直接查表拿答案,省下来的计算力留给真正需要动脑子的复杂推理。
解决什么问题
大模型有一个浪费:很多知识是固定模式(“中华人民共和国”、“machine learning”、常见短语搭配),但模型每次遇到都要用神经网络重新”算”一遍。
类比:你每次被问”1+1等于几”都要重新推导,而不是直接从记忆里说出”2”。Engram 就是让模型学会”这种简单的直接记住,别浪费脑子算”。
核心思想:记忆和推理分开
| 条件计算(MoE) | 条件记忆(Engram) | |
|---|---|---|
| 做什么 | 选一个”专家”现场计算 | 直接查表取已存好的答案 |
| 类比 | 遇到问题找专家现场解答 | 遇到问题翻字典直接查 |
| 适合 | 需要推理的复杂问题 | 固定的、反复出现的知识 |
| 速度 | 要算,花时间 | 查表,O(1) 常数时间 |
关键洞察:不是所有参数都需要”会思考”,有些只需要”记得住”。
怎么实现的(简化版)
输入一段文字
↓
① 识别常见短语组合(N-gram)
↓
② 用哈希函数查记忆表,取出预存的向量
(就像用拼音查字典,O(1) 直接定位)
↓
③ 上下文门控:问自己"这个记忆和当前语境匹配吗?"
匹配 → 用它
不匹配 → 丢掉(防止张冠李戴)
↓
④ 和正常的神经网络输出合并
三个关键设计:
- 哈希查表:不用遍历,直接定位,速度极快
- 多头哈希:多个哈希函数防止”撞车”(确保”苹果公司”和”苹果水果”不会查到同一条记忆)
- 上下文门控:不盲目信任记忆,必须和当前语境对得上才注入
放在模型的哪一层
实验结论:
- 第 2 层最好:刚有了基本上下文,此时注入记忆最高效
- 第 12 层最差:到这么深时模型已经花了大量算力去”重新推导”那些本该直接查表的东西——记忆来晚了,白费了前面的计算
类比:考试时应该一开始就把公式表摆出来(第 2 层),而不是做到一半才想起来翻公式表(第 12 层)。
最优配比:U 型曲线
DeepSeek 发现了一个”黄金比例”:
模型的参数预算怎么分配?
100% 全给推理(纯 MoE) → 浪费算力在重复知识上
100% 全给记忆(纯 Engram) → 没有推理能力
75-80% 推理 + 20-25% 记忆 → 最优 ✅
画成图是 U 型:两个极端都差,中间平衡点最好。
类比:一个人如果只会背书不会思考(100% 记忆),或者只会推理但啥都记不住(100% 计算),都不行。最聪明的人是”该记的记住,该想的再想”。
效果数据(27B 模型)
| 能力 | 没有 Engram | 有 Engram | 变化 |
|---|---|---|---|
| 知识问答 | 57% | 61% | +4 |
| 推理任务 | 70% | 74% | +4 |
| 长文本大海捞针 | 84% | 97% | +13 |
关键:计算成本没有增加。查表几乎不花 GPU 算力,相当于免费提升。
硬件意义
- 记忆表存在普通内存(DRAM,便宜)里,不占 GPU 显存(HBM,天价)
- 通过 PCIe 异步预取,性能损失 < 3%
- 意味着:可以用便宜硬件让模型”记住”更多知识
类比:GPU 显存像你的工作台(贵但快),普通内存像旁边的书架(便宜但稍慢)。Engram 把”字典”放书架上,工作台只留给需要动手操作的活。
与 DeepSeek 产品线的关系
- Engram 是 2026 年 1 月发表的独立研究论文
- 已应用于 DeepSeek V4(2026 年 4 月发布),支撑了 1M token 上下文长度
- 与 DeepSeek 之前的 MoE(混合专家)、MLA(多头潜在注意力)互补,不是替代关系
对 AI 行业的启发
- 不是所有问题都需要”算”:区分”该记的”和”该想的”,是一种更高效的智能架构
- 稀疏性有两个维度:以前只在”计算”上做稀疏(MoE 选专家),现在”记忆”也可以稀疏(Engram 选记忆)
- 硬件成本可以降:用便宜内存替代昂贵显存存储知识,降低大模型部署门槛
- 更长的上下文:记忆模块帮助模型在超长文本中保持准确率(84% → 97%)