🔍

🧠 AI知识体系全景图 - 究极融合版 v8.0 (2026.03)

涵盖人工智能所有主要分支和技术|AI ⊃ ML ⊃ DL(以NN为核心)|新增2026.03最新技术(GPT-5.4/Claude 4.6/Gemini 3/DeepSeek V3.2/MCP/SLM等)标红|基于Claude Opus 4.6整理

850+
技术知识点
200+
2025-2026新技术
25+
应用领域
4
层级体系

📊 层级包含关系说明

AI(人工智能) 包含:机器学习、符号AI、进化计算、专家系统等多个分支

ML(机器学习) 包含:监督学习、无监督学习、强化学习、深度学习等

DL(深度学习) 包含:CNN、RNN、Transformer、GAN等基于神经网络的方法

⚡ 关于NN(神经网络)的位置说明:
NN是深度学习的基础工具和技术,而非包含关系。本图谱中NN层展示的是构建DL模型的底层技术细节(激活函数、优化器、正则化等)。

NN(神经网络) 是深度学习的核心工具和基础架构

🧠 人工智能 (AI)
定义:模拟、延伸和扩展人类智能的理论、方法、技术及应用系统的总称
📚 符号AI/知识表示
专家系统 - 模拟人类专家决策的计算机系统,如医疗诊断系统MYCIN
知识图谱 - 实体-关系-属性的语义网络,如Google知识图谱
本体工程 - 定义领域概念和关系的形式化规范
语义网络 - 用节点和边表示概念及关系的图结构
框架系统 - 结构化知识表示,包含槽和值
产生式规则 - IF-THEN规则,如"IF发烧 THEN可能感冒"
🔍 搜索与推理
启发式搜索 - 利用经验知识引导搜索方向
A*算法 - 路径规划常用,结合实际代价和启发估计
博弈树搜索 - 游戏AI核心,如国际象棋的Minimax算法
约束满足问题 - 在约束条件下寻找解,如数独求解
逻辑推理 - 基于逻辑规则进行推导,包括演绎/归纳
定理证明 - 自动化数学定理证明系统
🧬 进化计算
遗传算法(GA) - 模拟生物进化,通过选择/交叉/变异优化
遗传编程(GP) - 进化计算机程序而非参数
进化策略(ES) - 强调变异,适用于连续优化
粒子群优化(PSO) - 模拟鸟群觅食,粒子在解空间中移动
蚁群算法(ACO) - 模拟蚂蚁寻找食物,用于路径优化
差分进化 - 简单高效的全局优化算法
💭 模糊系统
模糊逻辑 - 处理不确定性,值在0-1之间而非0或1
模糊控制 - 应用于家电/汽车,如模糊洗衣机
模糊推理 - 基于模糊规则进行推理决策
模糊集合论 - 元素部分属于集合,隶属度表示程度
🎲 概率推理
贝叶斯网络 - 有向无环图表示变量间概率依赖关系
马尔可夫模型 - 状态转移只依赖当前状态
隐马尔可夫模型(HMM) - 状态不可观测,用于语音识别
概率图模型 - 统一的概率推理框架
因果推断 - 识别因果关系而非相关关系
🤖 AI Agent智能代理 2025
多智能体系统 - 多个Agent协同工作完成复杂任务
协作与竞争 - Agent间的合作博弈
分布式AI - 智能分布在多个节点上
群体智能 - 简单个体产生复杂集体行为
Agentic AI - 2025核心趋势,具有自主决策能力的AI系统
记忆与推理 - Agent的长期记忆和复杂推理能力
工具使用能力 - Agent调用外部工具和API完成任务
任务规划 - 自动分解目标、设定子目标并执行
LangChain/LangGraph - 最流行Agent框架,LangSmith监控
LlamaIndex - 数据连接框架,RAG专精
AutoGen - 微软多Agent框架,对话式Agent
CrewAI - 角色扮演Agent,团队协作模式
Claude Agent SDK - Anthropic官方SDK,Claude Code基础
DSPy - 编程式提示优化,斯坦福研究
Computer Use - Claude/GPT计算机操控能力
GraphRAG - 微软知识图谱增强RAG
向量数据库 - Pinecone/Weaviate/Milvus/Qdrant/Chroma
MCP协议 - Anthropic提出的Model Context Protocol,Agent工具集成行业标准
Agentic AI Foundation - Linux基金会下MCP治理组织,Anthropic/OpenAI/Google等共建
Agent团队协作 - Claude Code Agent Teams,多Agent并行协作完成复杂任务
Agentic Workflow - 规划→执行→记忆→工具→评估的自主工作流
MetaGPT - 多Agent软件开发框架,模拟软件公司
🔌 MCP协议生态 2026
MCP定义 - Anthropic 2024.11提出的AI工具集成开放标准,"AI的USB-C"
行业标准化 - OpenAI/Google/Microsoft/AWS全部采纳MCP
Agentic AI Foundation - 2025.12成立,Linux基金会旗下MCP治理组织
生态规模 - 10000+公开MCP服务器,月SDK下载量9700万+
平台集成 - ChatGPT/Cursor/Gemini/VS Code/Copilot全面支持
JSON-RPC协议 - 有状态管道,连接AI主机与上下文服务器
异步+无状态 - 2025.11规范更新:异步操作、服务器身份、社区注册表
安全挑战 - 提示注入、工具权限、仿冒工具等安全问题持续改进中
多Agent编排 - 2026趋势:多Agent协作经MCP动态编排
🎯 规划与决策
经典规划 - STRIPS语言,状态空间搜索
分层任务网络 - 将复杂任务分解为子任务
不确定性规划 - 处理不完全信息和随机性
多目标决策 - 平衡多个冲突目标
🎨 计算创造力
AI艺术生成 - 生成绘画/插画,如Midjourney
音乐生成 - 作曲和演奏,如MuseNet
创意写作 - 生成故事/诗歌/剧本
游戏AI - NPC行为、程序化内容生成
🌐 世界模型 2025
物理世界建模 - 理解现实世界动态和物理属性
时空一致性 - 保持时间和空间上的逻辑一致
因果推理 - 理解物理规律和因果关系
NVIDIA Cosmos - 专为理解物理世界打造的世界模型
Meta V-JEPA 2 - 100万小时视频训练的世界模型
自动驾驶应用 - 生成海量场景进行测试验证
具身智能训练 - 为机器人提供虚拟训练环境
视频预测 - 预测物理感知的未来帧
Genie 2 - DeepMind交互世界模型,可玩3D环境生成
UniSim - 通用交互仿真模型
JEPA/V-JEPA - Yann LeCun联合嵌入预测架构
World Labs Marble - Fei-Fei Li创立,首个商业世界模型产品,10亿美元融资
AMI Labs - Yann LeCun离开Meta创立,专注世界模型研究,估值目标50亿欧元
Google Genie 3 - DeepMind首个实时交互世界模型,公开发布
世界模型竞赛 - 2026年初超13亿美元涌入世界模型创业公司
⚡ 物理AI 2025
Physical AI概念 - AI从数字世界走向物理世界的关键
环境交互 - AI理解和操控真实物理环境
物理规律理解 - 掌握重力、摩擦力、碰撞等物理规则
感知-决策-执行闭环 - 完整的物理交互循环
人形机器人 - 物理AI的重要载体
自动驾驶 - 物理AI在交通领域的应用
🤖 机器人学 NEW
路径规划 - 从起点到终点的最优路径
运动控制 - 控制机器人关节和执行器
SLAM定位建图 - 同时定位和构建环境地图
抓取规划 - 计算如何抓取物体
人机交互 - 自然的人机协作界面
传感器融合 - 整合多种传感器数据
Tesla Optimus - 2025年开始量产,目标5000-10000台
端到端神经网络 - 从感知到控制的统一神经网络
仿真训练 - 在虚拟环境中训练机器人行为
Optimus V3 - 计划2026 Q1发布,年产能100万
Figure 03 - 第三代人形机器人,Helix VLA模型驱动
Figure 02 - 完成20小时连续工作,BMW合作
Boston Dynamics Atlas - 全电动版,动态敏捷性标杆
Agility Digit - 仓储物流部署,已产生商业价值
Unitree H1 - 国产人形机器人,价格优势
NVIDIA Isaac - 机器人仿真平台,Omniverse集成
物理AI趋势 - Musk称80%Tesla价值将来自Optimus
Hyundai+Boston Dynamics - CES 2026联合推进智能伴侣机器人
模块化机器人平台 - 物流+个人助理双用途机器人
👁️ 计算机视觉基础 NEW
图像处理 - 滤波/增强/变换等基础操作
特征检测(SIFT/SURF) - 检测关键点和描述符
边缘检测 - Canny/Sobel算子检测边界
光流法 - 跟踪像素运动
立体视觉 - 双目相机恢复深度信息
3D重建 - 从2D图像重建3D模型
💬 NLP传统方法 NEW
词袋模型 - 忽略语序,只统计词频
TF-IDF - 词频-逆文档频率,衡量词重要性
N-gram模型 - N个连续词的统计模型
隐马尔可夫模型 - 用于词性标注/命名实体识别
条件随机场(CRF) - 序列标注的判别式模型
句法分析 - 分析句子语法结构
🤖 机器学习 (ML)
定义:通过数据和经验自动改进算法性能的AI子领域
📊 监督学习 - 分类
逻辑回归 - 二分类基础算法
朴素贝叶斯 - 基于贝叶斯定理的分类器
K近邻(KNN) - 基于距离的分类方法
支持向量机(SVM) - 寻找最大间隔超平面
决策树 - CART, ID3, C4.5等
线性判别分析(LDA) - 线性分类器
感知机 - 最简单的神经网络
📈 监督学习 - 回归
线性回归 - 拟合直线关系
多项式回归 - 拟合非线性关系
岭回归(Ridge) - L2正则化线性回归
Lasso回归 - L1正则化,产生稀疏性
弹性网络 - 结合L1和L2正则化
支持向量回归(SVR) - SVM的回归版本
回归树 - 决策树用于回归
🔍 无监督学习 - 聚类
K-means - 基于质心的聚类算法
层次聚类 - 自底向上或自顶向下
DBSCAN - 基于密度的聚类
高斯混合模型(GMM) - 概率聚类方法
谱聚类 - 基于图论的聚类
均值漂移 - 密度梯度上升
亲和传播 - 基于消息传递
📐 降维技术
主成分分析(PCA) - 线性降维,保留最大方差
奇异值分解(SVD) - 矩阵分解技术
t-SNE - 非线性降维,可视化高维数据
UMAP - 保持全局结构的降维
因子分析 - 发现潜在变量
独立成分分析(ICA) - 信号分离
自编码器降维 - 深度学习降维
🔗 关联规则学习
Apriori算法 - 频繁项集挖掘
FP-Growth - 无候选集生成
Eclat算法 - 垂直数据格式
序列模式挖掘 - 时间序列中的模式
🎮 强化学习 - 基础
马尔可夫决策过程(MDP) - 强化学习数学框架
Q-Learning - 学习状态-动作价值函数
SARSA - 在线策略时序差分学习
时序差分学习(TD) - 自举学习方法
蒙特卡洛方法 - 完整轨迹学习
动态规划 - 值迭代和策略迭代
Bandit算法 - 探索与利用平衡
🚀 强化学习 - 高级
策略梯度方法 - 直接优化策略
Actor-Critic - 结合价值和策略
A3C算法 - 异步优势演员评论家
PPO - 近端策略优化,稳定训练
TRPO - 信赖域策略优化
DDPG - 深度确定性策略梯度
SAC - 软演员-评论家,最大熵RL
🌲 集成学习 - Bagging
随机森林 - 多个决策树集成
Extra Trees - 极端随机树
Bagging分类器/回归器 - 自助聚合
Bootstrap聚合 - 有放回抽样
🚀 集成学习 - Boosting
AdaBoost - 自适应提升
Gradient Boosting - 梯度提升
XGBoost - 梯度提升的高效实现
LightGBM - 微软的高效梯度提升
CatBoost - 处理类别特征
🎯 集成学习 - 其他
Stacking堆叠 - 多层模型堆叠
Blending混合 - 加权组合
投票集成 - 多数投票或平均
🔄 半监督学习
自训练 - 用模型预测标注数据
协同训练 - 多视角互相训练
标签传播 - 标签在图上传播
生成模型方法 - 利用生成模型
伪标签 - 高置信度预测作为标签
🎓 迁移学习
领域自适应 - 源域到目标域
多任务学习 - 共享表示学习
零样本学习 - 识别未见过的类别
少样本学习 - 少量样本快速学习
元学习 - 学习如何学习
🔧 特征工程
特征选择 - 过滤式/包裹式/嵌入式
特征提取 - 变换到新特征空间
特征构造 - 组合生成新特征
特征缩放 - 标准化/归一化
编码技术 - One-hot/标签编码
📊 概率图模型
贝叶斯网络 - 有向图模型
马尔可夫随机场 - 无向图模型
条件随机场(CRF) - 判别式模型
隐马尔可夫模型 - 序列建模
🎯 在线学习
随机梯度下降 - 在线优化
增量学习 - 持续学习新数据
主动学习 - 选择最有价值样本
流式学习 - 处理数据流
🔐 异常检测
孤立森林 - 基于隔离的异常检测
One-Class SVM - 单类分类
LOF局部异常因子 - 基于密度
自编码器异常检测 - 重构误差
🔥 深度学习 (DL)
定义:使用多层神经网络进行表征学习的机器学习子领域
🖼️ 卷积神经网络 (CNN)
LeNet-5 - 1998年,手写数字识别
AlexNet - 2012年,ImageNet冠军,深度学习爆发
VGG - 小卷积核堆叠,网络加深
ResNet - 残差连接,突破深度限制
Inception/GoogLeNet - 多尺度特征提取
DenseNet - 密集连接网络
MobileNet - 轻量化网络,移动端部署
EfficientNet - 复合缩放,效率最优
SENet - 通道注意力机制
🎯 目标检测
R-CNN系列 - 区域建议+CNN分类
Fast R-CNN - ROI池化加速
Faster R-CNN - RPN区域建议网络
YOLO系列 - 实时单阶段检测(v1-v8)
SSD - 多尺度单阶段检测
RetinaNet - Focal Loss处理类别不平衡
Mask R-CNN - 实例分割
DETR - Transformer目标检测
✂️ 图像分割
FCN - 全卷积网络,开创语义分割
U-Net - 医学图像分割经典
SegNet - 编码器-解码器结构
DeepLab系列 - 空洞卷积
PSPNet - 金字塔池化模块
Mask R-CNN - 实例分割
🔄 循环神经网络 (RNN)
基础RNN - 处理序列数据,存在梯度消失
LSTM - 长短期记忆网络,解决长期依赖
GRU - 门控循环单元,比LSTM更简单
双向RNN/LSTM - 同时考虑过去和未来
深层RNN - 多层堆叠
Seq2Seq - 序列到序列,机器翻译
🔄 新型架构 2025
Mamba架构 - 基于状态空间模型(SSM)的新架构
Mamba-2 - 改进版,状态维度扩展至256
混合架构 - Mamba-Transformer融合架构
线性复杂度 - 解决Transformer的二次复杂度问题
长序列处理 - 擅长处理长上下文
选择性机制 - 根据输入过滤无关信息
硬件感知算法 - 在A100上实现3倍加速
腾讯混元-Mamba - 混合架构实际应用
NVIDIA Nemotron-H - Mamba混合架构,3倍速度提升
RWKV - 线性复杂度RNN变体,开源社区活跃
Hyena - 基于长卷积的亚二次复杂度架构
⚡ Transformer架构
原始Transformer - 2017年,"Attention is All You Need"
自注意力机制 - 计算序列内部关系
多头注意力 - 并行多个注意力,捕获不同信息
位置编码 - 注入位置信息
Vision Transformer(ViT) - Transformer用于视觉任务
Swin Transformer - 层次化视觉Transformer
💬 自然语言处理模型
Word2Vec - 词向量,CBOW和Skip-gram
GloVe - 全局词向量
ELMo - 上下文词嵌入
BERT - 双向编码器,预训练+微调
GPT系列 - 生成式预训练(GPT-1/2/3/4)
T5 - Text-to-Text统一框架
RoBERTa - BERT改进版
ALBERT - 轻量化BERT
XLNet - 排列语言模型
🤖 大语言模型 (LLM) 2025
GPT-3/GPT-4 - OpenAI超大规模模型
GPT-5 - 2025年8月发布,高级推理和多模态处理
o3模型 - 2025年领先的推理模型
Gemini 2.5 - Google最新多模态模型
LLaMA系列 - Meta开源大模型
PaLM - Google Pathways语言模型
Claude - Anthropic的对话模型
Gemini - Google多模态模型
Mistral - 欧洲开源模型
Qwen - 阿里通义千问
Chain-of-Thought原生推理 - GPT-5支持自主多步骤问题分解
稀疏混合专家(MoE) - 高效的模型架构
Claude Opus 4.5 - Anthropic 2025.11最新旗舰,综合能力最强
Claude Sonnet 4.5 - 编程/Agent/计算机使用最强,SWE-bench领先
Claude Opus 4 - 世界最强编程模型,Terminal-bench 43.2%
DeepSeek-V3.2 - 2025.12发布,思考+工具一体化,MIT开源
DeepSeek-V3.2-Speciale - 超越GPT-5,IMO金牌,IOI第10
Gemini 3.0 Pro - Google 2025最新旗舰,多模态+推理
GPT-5 Mini/Nano - 轻量版GPT-5,边缘部署
gpt-oss-120b/20b - OpenAI首次开源推理模型,MIT许可
Llama 4 - Meta 2025开源,Scout/Maverick变体
Qwen 2.5 Max - 阿里最新,多模态+工具调用
Claude Opus 4.6 - 2026.2发布,1M上下文,Agent团队协作,编码/知识工作第一
Claude Sonnet 4.6 - 自适应思考模式,性价比旗舰
GPT-5.4 Thinking - 2026.3 OpenAI最新旗舰,多步推理+工具工作流
GPT-5.4 Pro - 1.05M上下文,更深度思考版本
GPT-5.2-Codex - OpenAI最强Agentic编码模型,上下文压缩长任务
Gemini 3 Pro - 2026年初发布,LMArena 1501 Elo,超越2.5 Pro 50%+
Gemini 3 Flash - 超越2.5 Pro性能,3倍速度,成本大幅降低
Gemini 3.1 Pro - 2026.2发布,最新迭代
Grok 4 - 2025.7发布,xAI旗舰,128K上下文,支持工具使用
Grok 4.1 - 幻觉率从12%降至4.2%,LMArena 1483 Elo
gpt-oss-120b/20b - OpenAI首次开源,Apache 2.0,MoE架构,单GPU可运行
DeepSeek-V3.1 - 2025.8发布,思考/非思考混合模式,工具调用增强
DeepSeek-V3.2 - 2025.12发布,思考+工具一体化,MIT开源
多模型并存范式 - 行业共识:按任务路由模型,无单一最优解
🎨 生成对抗网络 (GAN)
原始GAN - 生成器vs判别器,对抗训练
DCGAN - 深度卷积GAN,稳定训练
WGAN - Wasserstein距离,解决训练不稳定
CycleGAN - 无配对图像转换
StyleGAN系列 - 风格控制,生成高质量人脸
Pix2Pix - 成对图像翻译
BigGAN - 大规模GAN
🌊 扩散模型 2025
DDPM - 去噪扩散概率模型
DDIM - 确定性采样加速
Stable Diffusion - 文生图,开源扩散模型
DALL-E系列 - OpenAI的文生图模型
Midjourney技术 - 艺术风格图像生成
Imagen - Google的文本到图像
Sora - OpenAI文本生成视频模型,最高1080p
Sora 2 - 2025年10月发布,音画同步生成
物理一致性 - Sora视频遵循真实物理规律达88%
多模态联合训练 - 实时环境音效同步
视频编辑工具 - 支持多种比例和编辑功能
Sora 2 Cameo - 人物植入功能,可将任意人物放入AI视频
Sora 2规格 - 20秒1080p,对话+音效同步,物理准确
Veo 3 - Google 2025.5发布,1080p+同步音频,$0.40/秒
Veo 3.1 - Veo最新迭代,ElevenLabs集成
Kling 2.5 - 快手可灵,ElevenLabs Studio集成
Runway Gen-3 Alpha Turbo - 专业视频生成加速版
Sora 2 Pro - 2026.1发布,1080p 20秒,对话+音效同步
Veo 3.1 - Google DeepMind最新,电影级真实感+原生音频同步
Kling 3.0 - 快手2026新版,与Sora 2/Veo 3同台竞技
Seedance 1.5 Pro - 字节跳动视频生成模型
视频AI格局 - 2026年从"哪个更好"转向"哪个更适合特定任务"
🔄 自编码器
经典自编码器(AE) - 编码-解码结构
变分自编码器(VAE) - 概率生成模型
去噪自编码器(DAE) - 鲁棒特征学习
稀疏自编码器 - 稀疏表示
卷积自编码器 - 处理图像
🕸️ 图神经网络 (GNN)
图卷积网络(GCN) - 图上的卷积
图注意力网络(GAT) - 图上的注意力
GraphSAGE - 归纳式图学习
消息传递神经网络 - 统一框架
图生成网络 - 生成图结构
🎮 深度强化学习
DQN - 深度Q网络,经验回放
Double DQN - 解决过估计
Dueling DQN - 分离优势函数
Rainbow - 结合多种改进
AlphaGo/AlphaZero - 围棋/通用棋类
MuZero - 无需环境模型
🎬 视频理解
C3D - 3D卷积视频分类
I3D - 膨胀3D卷积
TSN - 时序分段网络
SlowFast网络 - 双路径视频理解
🎵 音频处理网络
WaveNet - 原始波形生成
Tacotron - 端到端语音合成
Whisper - OpenAI多语言语音识别
Wav2Vec - 自监督语音表示
📦 胶囊网络
CapsNet - 保留空间层次信息
动态路由 - 胶囊间路由机制
EM路由 - 期望最大化路由
🔮 神经架构搜索 (NAS)
NASNet - 强化学习搜索架构
ENAS - 高效神经架构搜索
DARTS - 可微分架构搜索
AutoML - 自动机器学习
🌐 多模态学习 NEW
CLIP - 图文对比学习,OpenAI
ALIGN - Google的图文对齐
DALL-E - 文生图
Flamingo - 少样本多模态学习
GPT-4V - 支持视觉输入的GPT-4
Gemini多模态 - 原生多模态理解
🎯 对比学习 NEW
SimCLR - 简单对比学习框架
MoCo - 动量对比
BYOL - 无需负样本
SwAV - 聚类对比学习
对比损失函数 - 拉近相似,推远不同
💡 提示学习 NEW
Prompt Engineering - 提示词工程
Few-shot Prompting - 少样本提示
Chain-of-Thought - 思维链推理
In-Context Learning - 上下文学习
Instruction Tuning - 指令微调
RLHF - 人类反馈强化学习
DPO - 直接偏好优化,无需奖励模型
ORPO - 优化比率偏好优化
Constitutional AI - Anthropic宪法AI,自我纠正
Extended Thinking - Claude/o系列扩展思考模式
Tool Use in Thinking - DeepSeek思考中调用工具
System 2 Thinking - 慢思考模式,深度推理
Adaptive Thinking - Claude 4.6自适应思考,动态决定思考深度
可调推理深度 - GPT-5.4支持Light/Standard/Extended三档思考
推理+通用融合 - o系列与GPT系列逐步融合为统一模型线
⚙️ 模型优化技术 NEW
模型量化 - 降低精度减小模型
模型剪枝 - 删除不重要连接
知识蒸馏 - 大模型教小模型
LoRA - 低秩适应,高效微调
QLoRA - 量化+LoRA
神经网络压缩 - 综合压缩技术
BitNet - 1-bit量化,微软研究
FlashAttention 3 - 高效注意力机制
Ring Attention - 超长上下文支持
DeepSeek Sparse Attention - DSA高效注意力
vLLM - 高吞吐推理,PagedAttention
llama.cpp - CPU推理,量化支持
Ollama - 本地模型运行
混合精度训练 - FP16+FP32加速
MXFP4量化 - OpenAI gpt-oss使用的4位MoE量化方案
上下文压缩(Compaction) - Claude/GPT长任务自动摘要上下文
推测性解码 - 小模型草稿+大模型验证加速推理
连续批处理 - Continuous Batching,动态请求调度
🧠 前沿大模型格局 (2026.Q1) 2026
Claude Opus 4.6 - Anthropic 2026.2旗舰,1M上下文,Agent团队,编码/知识工作第一
GPT-5.4 Thinking - OpenAI 2026.3旗舰,多步推理+工具工作流,错误率降33%
GPT-5.4 Pro - 深度思考版,1.05M上下文
GPT-5.3 Instant - 快速响应版,写作和叙事能力优化
GPT-5.2-Codex - Agentic编码专用,长任务上下文压缩
Gemini 3.1 Pro - Google 2026.2最新旗舰,LMArena领先
Gemini 3 Flash - 超越2.5 Pro,3倍速度,成本降60-70%
Grok 4.1 - xAI旗舰,幻觉率降至4.2%,2M上下文窗口
Llama 4 Scout - Meta开源,17B/16专家MoE,10M上下文,单H100可运行
Llama 4 Maverick - 17B/128专家,400B总参数,多模态开源
Llama 4 Behemoth - 288B激活/2T总参数,训练中的教师模型
DeepSeek-V3.2 - 思考+工具一体化,V3.2-Speciale达IMO/IOI金牌
gpt-oss-120b - OpenAI首次开源,Apache 2.0,MoE,单80GB GPU可运行
多模型并存范式 - 无单一最优:Claude编码/GPT推理/Gemini多模态/Grok创意
⚡ 推理模型范式 2026
推理模型崛起 - 2025-2026最重要趋势:用计算换准确率
o3 - 2025.4发布,首个可"图像思考"的推理模型
o4-mini - AIME 2025数学92.7%,Codeforces ELO 2719
o3-pro - 2025.6发布,更长思考时间,最可靠响应
Adaptive Thinking - Claude 4.6自适应思考,动态决定思考深度
DeepSeek-R1 - 2025.1发布,全球震动,开源推理模型,MIT授权
过程奖励模型(PRM) - 对推理步骤逐步打分,提升准确率
推理+通用融合 - o系列与GPT系列合流,推理成为标配
任务时长倍增定律 - METR:模型独立完成任务时长每7个月翻倍
System 2 vs System 1 - 推理=慢思考,Instant=快思考,混合部署
🌊 文本扩散模型 2026
文本扩散原理 - 将扩散方法迁移至文本,并行解码而非逐token生成
Mercury Coder - Inception Labs 2025.2首款商用文本扩散模型
Mercury 2 - 2026.2发布,首个扩散推理模型,Blackwell上1009 token/s
速度优势 - 比自回归LLM快5-10倍
Masked Diffusion - 主流路径:对masked token逐步去噪
团队背景 - Stanford Stefano Ermon,Flash Attention/DPO原作者
Transformer替代候选 - 2026年被视为自回归架构重要替代方向
📏 小语言模型(SLM)与端侧AI 2026
SLM定义 - 1B-13B参数轻量模型,可本地/边缘部署
2026年SLM元年 - 80%生产场景SLM够用,成本降低95%
Phi系列 - 微软Phi-3/Phi-4,小参数高性能
Gemma 3n - Google首个多模态端侧SLM
gpt-oss-20b - OpenAI开源,16GB内存即可运行
端侧部署 - 手机NPU+SLM离线AI,苹果/三星/高通布局
Ollama - 本地模型运行行业标准框架
Apple MLX - Apple Silicon统一内存优化
SLM+Agentic AI - NVIDIA论文:轻量专家协作优于巨型模型
🔍 RAG 2.0 知识增强 2026
Naive RAG - 基础检索增强生成
Advanced RAG - 查询改写、重排序、混合检索
Agentic RAG - Agent驱动的自主检索决策
GraphRAG - 知识图谱增强,结构化推理
混合搜索 - 向量+关键词+图谱三路混合
Reranker - 二阶段排序提升精度
长上下文RAG - 百万Token上下文减少对RAG依赖
⚡ 神经网络 (NN) - 深度学习的基础构建模块
定义:受生物神经系统启发,由大量简单处理单元相互连接形成的计算系统。
说明:以下是构建所有深度学习模型的底层技术细节和核心组件

📋 NN层技术细节分类说明

🔬 NN基础模块 - 构建神经网络的基本材料(神经元、激活函数、层类型、网络结构)

🎯 NN训练过程 - 如何训练神经网络(前向传播、损失函数、反向传播、优化器)

⚡ NN优化技术 - 让训练更好更快的方法(正则化、归一化、初始化、学习率、训练技巧)

📚 NN相关内容 - 历史发展、实现框架、可解释性分析

🔬 基本组件
神经元/节点 - 模拟生物神经元的计算单元
权重(Weights) - 连接强度,决定信息传递的重要性
偏置(Bias) - 调整激活阈值,增加模型灵活性
突触连接 - 神经元之间的连接方式
阈值函数 - 决定神经元是否激活
⚙️ 激活函数
Sigmoid - 输出0-1,用于二分类,存在梯度消失问题
Tanh - 输出-1到1,零中心化,收敛更快
ReLU - 最常用,f(x)=max(0,x),计算简单,缓解梯度消失
Leaky ReLU - 负值有小梯度,解决ReLU"死亡"问题
ELU - 指数线性单元,负值平滑
GELU - Transformer常用,平滑的ReLU变体
Softmax - 多分类输出层,输出概率分布
Swish/SiLU - 自门控激活函数
🗃️ 网络架构
前馈神经网络(FNN) - 信息单向流动
多层感知机(MLP) - 经典前馈网络
全连接层 - 每个神经元连接所有输入
卷积层 - 提取局部特征
池化层 - 降维,提取主要特征
循环层 - 处理序列数据
注意力层 - 关注重要信息
📊 网络结构
输入层 - 接收原始数据
隐藏层 - 特征提取和变换,可多层堆叠
输出层 - 产生最终预测结果
残差连接 - 跳过层直接相加,缓解梯度消失
跳跃连接 - 连接非相邻层,增强信息流动
密集连接 - 每层连接前面所有层
🎯 前向传播
输入处理 - 数据标准化/归一化
加权求和 - z = Σ(wi·xi) + b,计算神经元输入
激活函数应用 - a = f(z),引入非线性
逐层计算 - 从输入层到输出层依次计算
输出预测 - 得到模型预测值ŷ
📉 损失函数
均方误差(MSE) - 回归任务,L = 1/n·Σ(y-ŷ)²
交叉熵损失 - 分类任务,衡量概率分布差异
Hinge损失 - SVM使用,最大间隔分类
对比损失 - 度量学习,拉近相似样本,推远不同样本
Focal Loss - 解决类别不平衡问题
KL散度 - 衡量分布差异
🔙 反向传播
误差反向传递 - 从输出层向输入层传播误差
链式法则 - ∂L/∂w = ∂L/∂a · ∂a/∂z · ∂z/∂w,计算梯度
梯度计算 - 计算每个参数的梯度∇w, ∇b
自动微分 - PyTorch/TensorFlow自动计算梯度
计算图 - 可视化计算过程和梯度流动
🚀 优化器
SGD - 随机梯度下降,w = w - lr·∇w
Momentum - 加入动量,v = β·v + ∇w,加速收敛
AdaGrad - 自适应学习率,适合稀疏数据
RMSprop - 解决AdaGrad学习率递减问题
Adam - 最常用,结合Momentum和RMSprop,自适应学习率
AdamW - Adam改进版,解耦权重衰减
Nadam - Nesterov + Adam
RAdam - 修正Adam方差
🛡️ 正则化技术
L1正则化 - 权重绝对值惩罚,产生稀疏性
L2正则化 - 权重平方惩罚,权重衰减
Dropout - 训练时随机丢弃神经元(p=0.5常用)
DropConnect - 随机丢弃连接而非神经元
早停 - 验证集性能不提升时停止训练
数据增强 - 扩充训练数据(旋转/裁剪/噪声)
标签平滑 - 软化one-hot标签,提高泛化能力
🔧 归一化技术
Batch Normalization - 对batch归一化,CNN常用,加速收敛
Layer Normalization - 对层归一化,Transformer/RNN常用
Instance Normalization - 对单样本归一化,风格迁移
Group Normalization - 分组归一化,小batch适用
Weight Normalization - 权重归一化
⚡ 权重初始化
全零初始化 - ❌不推荐,导致对称性问题
随机初始化 - 小随机数,打破对称性
Xavier初始化 - 适用于Sigmoid/Tanh,保持方差稳定
He初始化 - 适用于ReLU,考虑ReLU将负值置零的特性
预训练权重 - 迁移学习,使用已训练好的权重
📐 学习率策略
固定学习率 - 简单但可能不是最优
Step Decay - 每N个epoch衰减一次
余弦退火 - 余弦曲线平滑衰减
循环学习率(CLR) - 在范围内周期变化
Warmup预热 - 开始用小学习率逐渐增大
自适应学习率 - 根据训练情况自动调整
📊 训练技巧
Mini-batch训练 - 折中单样本和全批量(32/64/128常用)
梯度裁剪 - 限制梯度范数,防止梯度爆炸
梯度累积 - 模拟更大batch size
混合精度训练 - FP16+FP32,加速训练省显存
知识蒸馏 - 大模型教小模型,模型压缩
模型集成 - 多模型投票/平均,提升性能
🎓 历史发展
1943 - McCulloch-Pitts神经元模型
1958 - Rosenblatt感知机,首个可学习的神经网络
1986 - Rumelhart等人重新发现反向传播算法
2006 - Hinton提出深度学习概念
2012 - AlexNet在ImageNet夺冠,深度学习爆发
💻 实现框架
PyTorch - 最流行,动态图,科研首选
TensorFlow - Google开发,工业部署强
Keras - 高层API,简单易用
JAX - Google新框架,自动微分+JIT编译
MXNet - 亚马逊支持
Caffe - 早期视觉任务框架
🔍 可解释性
特征可视化 - 可视化学到的特征
注意力机制可视化 - 显示模型关注位置
梯度类激活图(Grad-CAM) - 热力图显示重要区域
LIME - 局部可解释模型
SHAP - 博弈论解释模型

🌟 主要应用领域

AI技术已广泛应用于各个行业和领域

👁️ 计算机视觉应用 NEW
人脸识别 - 身份验证、安防监控
物体检测与识别 - 自动驾驶、工业检测
图像分类 - 医学影像诊断
语义分割 - 场景理解
姿态估计 - 人体动作识别
OCR文字识别 - 文档数字化
医学图像分析 - 病灶检测
自动驾驶视觉 - 环境感知与理解
💬 自然语言处理应用 NEW
机器翻译 - 跨语言交流
文本分类 - 垃圾邮件过滤、新闻分类
情感分析 - 舆情监控、用户反馈分析
命名实体识别 - 信息提取
问答系统 - 智能客服、搜索引擎
文本摘要 - 自动生成摘要
对话系统/聊天机器人 - 虚拟助手
代码生成 - AI辅助编程
🎵 语音与音频 NEW
语音识别(ASR) - 语音转文字
语音合成(TTS) - 文字转语音
说话人识别 - 身份认证
音乐生成 - AI作曲
声纹识别 - 生物特征识别
音频分类 - 环境声音识别
💻 AI编程助手 2025.12
GitHub Copilot - 微软/GitHub提供,Claude Sonnet 4驱动
Cursor - AI原生代码编辑器,Agent模式+YOLO全自动
Codeium - 快速响应,丰富免费功能
智能代码补全 - 多行连续补全,上下文理解
代码生成与重构 - 自动生成函数、优化代码结构
代码解释 - 理解复杂代码逻辑
复杂算法生成 - Cursor数学建模准确率87.6%
多文件修改 - 跨文件代码编辑和重构
Claude Code - Anthropic官方CLI,SWE-bench 72%+领先
Claude Code集成 - VS Code/JetBrains集成,GitHub Actions后台任务
Devin - Cognition Labs全自主AI工程师(测试中)
Replit Agent - 云端全栈开发,零配置50+语言
Windsurf - Codeium编辑器,Cascade Agent
Aider - 开源CLI助手,Git集成对话式编程
v0.dev - Vercel AI应用生成,React/Next.js
Bolt.new - StackBlitz全栈生成,即时预览
行业趋势 - 从AI辅助补全→AI自主委托,开发者变为Agent指导者
Claude Opus 4.6编码 - Terminal-Bench 2.0最高分,16个Agent写出C编译器
GPT-5.4编码 - 计算机操控能力,Agent交互验证任务
Gemini 3编码 - Google称其为最强vibe coding和agentic coding模型
Gemini CLI - Google官方命令行AI编码工具
多模型路由 - 2026共识:Claude编码/GPT推理/Gemini多模态按需切换
🧬 AI for Science 2025
AlphaFold - 蛋白质结构预测,2024年诺贝尔化学奖
OpenComplex-2 - 2025年中国新一代蛋白质预测模型
分子相互作用 - 原子级分辨率捕获
药物研发 - 新药研发周期从13年缩短至8年
疫苗设计 - 疟疾疫苗开发
酶工程 - 塑料降解酶设计
农业科技 - 抗旱抗病水稻研发
生态保护 - 蜜蜂免疫蛋白研究
全球用户 - 超250万用户,亚太地区破百万
👤 数字人/虚拟人 2025
AI直播带货 - 数字人主播24小时直播
一键克隆 - 真人形象快速复制
智能互动 - 自动回答观众问题
ByteDance LatentSync - 高精度音视频同步
成本优势 - 年成本2万vs真人5万/月
3D全息成像 - 虚拟陪伴应用
百度慧播星 - 无需设备和人工监管
市场规模 - 2025年中国市场达6402.7亿元
✍️ AIGC内容创作 2025
AI写作 - 博客、营销文案、教育课程
AI绘画 - 自动生成插画、设计图
AI视频制作 - 自动化视频内容生成
AI语音生成 - 文字转语音、配音
AI设计 - 平面设计、UI设计辅助
AI营销 - 自动生成营销内容
学术检测 - 2025年毕业论文AI率不超过20%
AIGC竞赛 - 多个百万奖金池竞赛
🏢 企业AI应用 2025
企业普及率 - 近90%企业已实施AI应用
数据分析决策 - 57.03%企业应用率
技术创新研发 - 49.22%企业应用率
智能客服 - 46.09%企业应用率
Agent市场 - 2025年中国达69亿元,增长140%
工业应用 - 47.5%工业企业应用大模型
平安智能体 - 部署23000个,覆盖11万员工
DeepSeek应用 - 超30家企业深度应用
🥼 医疗健康 NEW
疾病诊断辅助 - 影像诊断、病理分析
药物研发 - 分子设计、药效预测
基因组学分析 - 基因序列分析
医学影像分析 - CT、MRI自动分析
健康监测 - 可穿戴设备数据分析
蛋白质结构预测 - AlphaFold
辅助诊疗系统 - 诊断2000+疾病,准确率95%+
导诊准确率 - 超过99%
癌症筛查 - 效率提高20倍
DNA读写 - 成本降低99%以上
🚗 自动驾驶 NEW
环境感知 - 摄像头、激光雷达数据处理
路径规划 - 动态路线规划
决策控制 - 驾驶决策系统
车道检测 - 实时车道线识别
障碍物识别 - 行人、车辆检测
行为预测 - 预测其他交通参与者行为
💰 金融科技 NEW
风险评估 - 信用评分、风险预测
欺诈检测 - 异常交易识别
算法交易 - 量化投资策略
信用评分 - 贷款审批辅助
智能投顾 - 个性化投资建议
反洗钱 - 可疑交易检测
🎮 游戏与娱乐 NEW
游戏AI - NPC智能行为
内容推荐 - 个性化推荐系统
虚拟角色 - AI驱动的虚拟人
程序化生成 - 自动生成游戏内容
动作捕捉 - 实时动作识别
🏭 工业制造 NEW
质量检测 - 自动化缺陷检测
预测性维护 - 设备故障预测
供应链优化 - 智能库存管理
机器人控制 - 工业机器人自动化
智能制造 - 生产流程优化
🛒 电商零售 NEW
个性化推荐 - 商品推荐系统
智能客服 - 自动化客户服务
需求预测 - 销量预测
价格优化 - 动态定价
视觉搜索 - 以图搜图
虚拟试穿 - AR试衣
🔒 网络安全 NEW
入侵检测 - 网络异常检测
恶意软件识别 - 病毒检测
异常行为检测 - 用户行为分析
垃圾邮件过滤 - 邮件分类
威胁情报分析 - 安全态势感知
🌾 农业科技 NEW
作物病虫害识别 - 自动诊断
产量预测 - 收成预估
精准农业 - 智能灌溉施肥
智能温室 - 环境自动调控
无人机巡检 - 农田监测
📚 教育科技 NEW
智能辅导 - 个性化学习建议
自动评分 - 作业批改
个性化学习 - 自适应学习路径
知识图谱构建 - 知识体系可视化
学习路径推荐 - 课程推荐
⚡ AI基础设施与芯片 2025.12
NVIDIA B200/GB200 - Blackwell架构,20 PFLOPS FP4
NVIDIA H200 - Hopper升级版,141GB HBM3e
NVIDIA H100 - 数据中心主力,80GB HBM3
AMD MI300X - 192GB HBM3,NVIDIA替代
Intel Gaudi 3 - AI加速器
Google TPU v5p - 定制张量处理器
AWS Trainium2 - Amazon定制芯片
Groq LPU - 超低延迟推理,语言处理单元
Cerebras WSE-3 - 晶圆级引擎,4万亿晶体管
华为昇腾910B - 国产AI芯片
Azure AI Foundry - 微软AI平台
AWS Bedrock - 托管基础模型
Google Vertex AI - 全栈ML平台
Hugging Face - 模型社区,100万+模型
Modal - 无服务器GPU
Together AI - 开源模型托管
NVIDIA Blackwell Ultra (B300) - 2025 Q4出货,1.5倍B200性能,288GB HBM3E
NVIDIA Rubin (R200) - 2026 Q2出货,首款HBM4+NVLink 6芯片
Blackwell产能 - 已售罄至2026年中,积压360万台
GW级算力集群 - 单集群100万GPU耗电1-1.4GW,电力成主要瓶颈
超算军备竞赛 - Meta 2026 CapEx超1000亿美元,微软季度350亿
液冷数据中心 - GB200 NVL72要求液冷,推动数据中心基础设施大改造
🔬 AI科学研究前沿 2025.12
AlphaFold 3 - 蛋白质+分子结构预测
AlphaProteo - 蛋白质设计
AlphaGeometry 2 - IMO几何题求解
AlphaProof - 数学定理证明
GNoME - 材料发现,220万新材料
GraphCast - 天气预测
Med-PaLM 3 - 医疗AI
FunSearch - 数学发现
Process Reward Models - 过程奖励,数学推理
MoE (混合专家) - 稀疏激活,DeepSeek/Mixtral
Mamba/SSM - 状态空间模型,线性复杂度
OpenComplex-2 - 中国新一代蛋白质预测模型
扩散语言模型 - Mercury系列,非自回归文本生成新范式
推理模型融合 - o系列与GPT系列融合,推理能力成标配
📊 AI评估体系 2026
LMArena (Chatbot Arena) - 人类偏好投票ELO排名,行业权威
MMLU/MMLU-Pro - 多任务语言理解基准
GPQA Diamond - 博士级科学问答
SWE-bench Verified - 真实软件工程任务评测
Terminal-Bench 2.0 - Agentic编码评测
ARC-AGI-2 - 抽象推理与通用智能评测
AIME 2025 - 数学竞赛推理评测
Humanity's Last Exam - 最高难度综合考试
METR任务时长 - 模型自主完成任务时长评估
HealthBench - 医疗健康AI评测
安全对齐评测 - Safety/Alignment/Robustness评估
⚖️ AI治理与全球法规 2026
EU AI Act - 2026.8高风险AI系统合规截止日,全球首部综合AI法律
高风险AI要求 - 风险管理/数据治理/技术文档/人工监督/透明度
AI生成内容标注 - 2026.8起合成内容和深度伪造必须标识
AI监管沙盒 - 各成员国须在2026.8前建立至少一个AI沙盒
美国州法推进 - AI透明度法/训练数据透明度法2026.1生效
中国网络安全法修订 - 2026.1实施,首次明确AI条款
版权诉讼 - 多起AI训练数据版权案2026年进入审判
AI福利议题 - AI意识/道德地位被Anthropic等机构提上议程
全球影响 - EU AI Act如同GDPR,正在成为全球AI监管标杆
🏎️ AI大事记:2025-2026 2026
🇨🇳 2025.1 DeepSeek-R1震撼全球 - 开源推理模型,训练仅560万美元,NVIDIA市值蒸发6000亿
2025.3 OpenAI采纳MCP - MCP从Anthropic协议升级为行业标准
2025.4 Llama 4发布 - Meta"战时动员"推出MoE架构三兄弟
2025.4 o3/o4-mini - 首个可"图像思考"的推理模型
2025.5 Claude Opus 4 - 混合推理模式,代码能力大幅跃升
🇨🇳 2025.5 DeepSeek-R1-0528 - "小版本升级"实测接近o3-high,LiveCodeBench刷榜
🇨🇳 2025.5 华为盘古Ultra MoE - 7180亿参数,昇腾全栈国产化训练,首个国产万亿级MoE
🇨🇳 2025.6 字节豆包1.6 - 日均Token量增长137倍,公有云API市场份额46.4%第一
2025.7 Grok 4 - xAI旗舰发布,$300/月SuperGrok Heavy
🇨🇳 2025.7 Kimi K2 - 月之暗面开源推理模型,灵感源自DeepSeek架构
2025.8 gpt-oss开源 - OpenAI GPT-2后首次开放权重,Apache 2.0
🇨🇳 2025.8 DeepSeek-V3.1 - MIT开源,SWE-bench/Terminal-bench提升超40%
🇨🇳 2025.9 阿里Qwen3-Max - 多项基准超越DeepSeek和Claude
🇨🇳 2025.9 DeepSeek-R1登上Nature封面 - 首次披露训练成本仅29.4万美元,国际学术界轰动
2025.9 Sora 2 - OpenAI视频生成"GPT-3.5时刻"
🇨🇳 2025.9 腾讯混元图像3.0 - LMArena图像编辑全球第一梯队,开源最强
2025.11 Claude Opus 4.5 - SWE-bench首破80%,AI编码里程碑
2025.11 Gemini 3 Pro - Google旗舰刷新多模态基准
🇨🇳 2025.11 智谱GLM-5 - "Pony Alpha"揭晓,编码性能惊艳AI社区
🇨🇳 2025.12 豆包DAU破1亿 - 中国首个日活过亿AI产品,字节发布豆包1.8
🇨🇳 2025.12 腾讯混元2.0 - 406B MoE,256K上下文,前OpenAI科学家姚顺雨任首席AI科学家
🇨🇳 2025.12 DeepSeek-V3.2 - 思考+工具一体化,V3.2-Speciale达IMO金牌
2025.12 MCP捐赠Linux基金会 - Agentic AI Foundation成立
🇨🇳 2025年 中国开源模型全球下载量占比17.1% - 反超美国15.8%,位居全球第一
🇨🇳 2025年 中国生成式AI用户达5.7亿 - 半年增长106.6%,Qwen系列Hugging Face下载量超Llama
2026.1 Gemini 3 Flash - 超越2.5 Pro,速度3倍成本降7成
🇨🇳 2026.1 中国网络安全法AI条款生效 - 首次明确AI监管法律框架
🇨🇳 2026春节 豆包央视春晚AI合作 - 除夕AI互动19亿次,月活飙至3.15亿
🇨🇳 2026春节 千问30亿元投入 - 日活一度逼近豆包,夸克AI眼镜整合支付宝/高德/淘宝
2026.2 Claude Opus 4.6 - 1M上下文,Agent团队,知识工作第一
2026.2 Mercury 2 - 首个扩散推理模型,1009 token/s
2026.2 World Labs 10亿融资 - Fei-Fei Li世界模型公司估值50亿
🇨🇳 2026.3 两会:AI产业规模目标10万亿 - "十五五"开局年,国家发改委明确AI发展路线
🇨🇳 2026格局 文心/千问/DeepSeek三足鼎立 - C端前五:豆包/千问/夸克/DeepSeek/腾讯元宝
2026.3 GPT-5.4 - OpenAI最新旗舰,Thinking+Pro+Instant三版本