虚拟形象与数字人技术全景

从 VTuber 到 AI 数字分身:一张”假人”是怎么造出来的


开篇 · 一个”假人”是怎么造出来的

想象一下你此刻点开一个直播间。

里面可能是一只会眨眼的卡通狼,能随着主播的情绪咧嘴大笑;也可能是一个穿水手服的二次元少女,每次歪头都带着恰到好处的呆萌;还可能是一位和某流量明星一模一样的主播,眉眼间神似得让你怀疑”是不是真的是他”;又或者是一位永远精神饱满、24 小时不下播的新闻主播,每条新闻都字正腔圆。

镜头前是四个截然不同的”人”。但镜头后呢?

  • 第一个,可能是一个戴着 AirPods 的男大学生,对着 iPhone 手舞足蹈;
  • 第二个,可能是一位坐在电脑前的美术生,仅凭一个摄像头就驱动着她的 Live2D;
  • 第三个,可能只是一段 20 秒的参考视频 + 一段 AI 克隆的声音,跑在一张 RTX 4090 上;
  • 第四个——很可能根本没有”人”在操作,只有一条 AI 流水线在执行。

这四种”假人”分别代表了当今虚拟形象和数字人技术的四种典型形态。它们看起来相似,内部的技术栈却天差地别。

这篇笔记就是把这个”假人造真”的技术世界拆开给你看——从摄像头捕捉到一个眨眼动作的那一刻,到观众手机屏幕上出现栩栩如生的虚拟角色,中间究竟发生了什么,以及你要是想玩这个领域,该从哪下手。


第一章 · 地图导览

1.1 两条根本不同的主线

整个”假人”技术世界,其实只有两条大路:

                ┌─────────────────────────────────────┐
                │      想要一个"会动的虚拟人"            │
                └─────────────────────────────────────┘
                              │
                  ┌───────────┴───────────┐
                  ▼                       ▼
         ┌────────────────┐      ┌────────────────┐
         │ 路线 A:         │      │ 路线 B:         │
         │ 虚拟形象         │      │ 真人克隆         │
         │ ──────────     │      │ ──────────     │
         │ 造一个从无到有    │      │ 复制一个已存在    │
         │ 的动画角色       │      │ 的真人           │
         │                │      │                │
         │ 代表:           │      │ 代表:           │
         │ VTuber/Memoji  │      │ 换脸/数字分身    │
         │ 抖音特效        │      │ 新华社 AI 主播   │
         └────────────────┘      └────────────────┘
  • 路线 A 虚拟形象:角色本身是虚构的(一只狼、一个二次元女孩、一个拟人化的西瓜)。真人的作用仅仅是提供表情和动作数据,驱动这个虚构角色。没有法律风险,完全合规。
  • 路线 B 真人克隆:目标是让虚拟角色看起来像某个真实存在的人(你自己、一个演员、一位明星)。涉及人脸、人声的 AI 生成,直接踩到法律红线的灰色地带。

你能看到的几乎所有”假人”内容,都能归到这两条线的某一条上。

1.2 所有技术的共同骨架:那 52 个 Blendshape

不管是 iPhone 的 Memoji、抖音的西瓜头特效,还是 A-SOUL 的嘉然小姐、新华社的 AI 主播,它们的内部都有同一个”中间层”——

52 个 Blendshape 参数

这是苹果在 ARKit 里定义、后来被整个业界采纳的一套标准化表情数值

eyeBlinkLeft          0.32   ← 左眼闭合度 32%
eyeBlinkRight         0.30
jawOpen               0.78   ← 嘴张开 78%
mouthSmileLeft        0.45   ← 左嘴角上扬
mouthSmileRight       0.48
browInnerUp           0.12   ← 眉心上挑
browDownLeft          0.05
cheekPuff             0.00   ← 腮帮鼓起
tongueOut             0.00
...(共 52 个,每个数值都在 0.0 ~ 1.0 之间)

可以把这 52 个数字理解成**“表情的普通话”**。

  • 输入端(摄像头、深度相机、语音、动捕服)负责把真实世界的表情信号翻译成这 52 个数字
  • 输出端(Live2D、VRM、MetaHuman、2D 漫画滤镜)负责把这 52 个数字翻译回某种虚拟形象

看懂了这个中间层,你就看懂了整个领域的积木结构。输入端换一种(比如从摄像头换成语音),输出端换一种(比如从二次元换成真人渲染),组合出来的就是一个新产品

1.3 应用层五层金字塔(地图预览)

按硬件门槛和技术成熟度排序,目前能见到的产品粗略分成五层(本章仅做地图预览,具体内容见后续章节):

层级典型代表硬件技术路线
1. 消费级高精度iPhone MemojiiPhone X+虚拟形象 / TrueDepth
2. 消费级普惠抖音特效、Snapchat Lens任意手机虚拟形象 / 纯 RGB
3. 个人 VTuberVTube Studio + Live2DPC + 摄像头虚拟形象 / 桌面级
4. 企业虚拟偶像A-SOUL / 星瞳专业动捕室虚拟形象 / 企业级
5. AI 全自动主播新华社数字人服务器 GPU真人克隆 / AI 驱动

前四层都属于虚拟形象路线,第五层开始涉及真人克隆


第二章 · 虚拟形象路线(VTuber & 实时特效)

2.1 表情捕捉:从红外点阵到单目 AI

要驱动一个虚拟角色,你得先把真人的表情”数据化”。这一步的质量决定了整个系统的上限。

路径 A:深度相机(硬件方案)

iPhone X(2017)之后的前置摄像头里藏了一套 TrueDepth 原深感系统

  • 红外点阵投影器:每帧投出 30,000+ 个不可见红外点在你脸上;
  • 红外摄像头:读取这些点的形变分布;
  • 泛光灯:暗光下仍能正常工作。

这套硬件原本是给 Face ID 用的,Memoji / Animoji 就是它的”副产品”。因为它直接测量深度,提取出来的 52 个 Blendshape 参数精度极高——侧脸不崩、暗光不丢、大张嘴不变形

路径 B:纯 RGB 摄像头(算法方案)

绝大多数安卓手机、电脑摄像头、直播 OBS,都没有深度硬件。它们用的是 Google 的 MediaPipe 这类纯算法方案:

摄像头帧 (640×480, RGB)
   ↓
① BlazeFace 人脸检测       →  找到脸的包围框
   ↓
② FaceMesh (MobileNet CNN) →  输出 468 个 3D 面部关键点
   ↓
③ Blendshape Regression    →  468 点 → 52 参数
   ↓
[52 个 0~1 的浮点数] ─── 60 fps 输出

底层的核心是一个非常轻量的 CNN 网络,能在手机 CPU 上跑到 60fps。精度比 TrueDepth 差一些,但兼容性覆盖几乎所有设备

核心结论:iPhone 是”硬件派”,Android / 抖音 / MediaPipe 是”算法派”。硬件派精度高但设备受限,算法派普惠但在极端光照/角度下会露馅。

2.2 虚拟形象:Live2D(纸片人) vs 3D VRM(立体骨骼)

有了 52 个数字,还得有一个”收件人”来接收它们。虚拟形象的实现方式大致分两派:

Live2D 派 —— 2D 纸片人的魔法

美术师在 Live2D Cubism Editor 里做的事:

  1. 画一张完整的角色立绘;
  2. 把立绘切成几十甚至上百个图层:左眼白、左眼黑、上眼皮、下眼皮、左眉毛、嘴型 A、嘴型 E、嘴型 I……
  3. 为每一类变形定义参数轴,比如:
    • ParamEyeLOpen(左眼开度,范围 -1~1)
    • ParamMouthOpenY(嘴张开程度)
    • ParamBrowLY(左眉毛高度)
  4. 录制”极端姿态”:参数 = 0 时的样子 vs 参数 = 1 时的样子,中间画面由软件自动插值生成

驱动软件(比如 VTube Studio)在做的事,其实是一张参数映射表

ARKit 的 52 个 Blendshape       Live2D 的参数轴
  eyeBlinkLeft     = 0.7   →   ParamEyeLOpen    = 0.3
  jawOpen          = 0.8   →   ParamMouthOpenY  = 0.8
  mouthSmileLeft   = 0.5   →   ParamMouthForm   = 0.7
  ...

Live2D 的特点:永远是 2D,但因为画师精心设计了图层切片,看起来比真 3D 还灵动(特别是二次元审美下)。90% 的中腰部 VTuber 都用这套方案。

3D VRM 派 —— 立体骨骼的严谨

.vrm 是一个开放标准(基于 glTF),内部是:

  • 蒙皮骨骼(Rig):一副像木偶一样的骨架,每根骨头控制一部分皮肤;
  • Morph Target(形变目标):存储”眼睛闭上”、“嘴巴张开”、“微笑”等若干形变快照,实时按权重混合。

代表工具:

  • VRoid Studio:免费,捏脸式创建 VRM 角色,上手最快;
  • Blender:专业建模,自由度最高;
  • VSeeFace / Animaze:驱动 VRM 角色做直播。

3D VRM 的优势在于可以从任意角度观看,做 VR 互动和 MMD 舞蹈视频友好。劣势是美术成本高,没有 Live2D 的”小透明感”。

2.3 动物拟人化的”秘密”:不是 AI 让动物会笑,是画师预设的

很多人以为”AI 能让一只狼有人类表情”是某种黑科技,其实完全不是。

真相是:在 Live2D / VRM 模型的制作阶段,美术师就已经给这只狼预先画好了笑脸、怒脸、哀脸、乐脸等形变目标。当主播的表情驱动 ParamMouthForm = 0.7(嘴型偏”笑”的方向)时,软件把”笑脸形变”按 70% 权重混合到基础形态上——狼就笑了。

换句话说,“AI” 在这里只干了一件事:实时把真人的表情参数插值到艺术家预设的形变之间。动物会笑、会哭、会惊讶,都是画师的功劳,而不是某个神奇的 AI 模型的功劳。

这也解释了为什么不同 VTuber 的”表情丰富度”差异极大——模型的形变做得越细,表情就越自然。顶级 Live2D 模型有几百个参数轴,中低端只有几十个。

2.4 四个层级的案例走马观花

【第一层】 iPhone Memoji —— TrueDepth 硬件天花板

  • 硬件:iPhone X+ 的 TrueDepth
  • 软件栈:ARKit → RealityKit/Metal 渲染 → 导出 iMessage 或 FaceTime
  • 为什么精度最高:深度相机直接测量,不是推算
  • 开发者也能用这套 API(ARFaceTrackingConfiguration),所以你看到的很多 iOS 虚拟形象 App(派对岛、Zepeto)精度明显优于 Android 版

【第二层】 抖音/TikTok 特效(西瓜头、狗头、变声贴纸)

  • 硬件:任意手机
  • 技术:字节自研 CV SDK + 单目 RGB + 轻量 CNN
  • 创作者工具:海外是 Effect House,国内是剪映特效编辑器
  • “西瓜头”这类头部挂件原理:
    1. 检测头部关键点;
    2. 估计头部 3D 姿态(yaw/pitch/roll 三个角度);
    3. 将西瓜 3D 模型绑定到头顶锚点;
    4. 每帧跟随头部姿态旋转平移;
    5. Z-buffer 处理遮挡(手挡在脸前能正确遮住特效)。

抖音特效的设计哲学是”宁可效果夸张点,也要在千元机上流畅跑”——所以你看到的大多是卡通化、强风格,让算法的瑕疵不那么显眼。

【第三层】 个人 VTuber(Live2D + PC + OBS)

这是中腰部 VTuber 的标准配置。一条典型的运营链路:

主播 iPhone(面捕设备)
    ↓ 运行 iFacialMocap / Waidayo App
    ↓ 提取 ARKit 52 Blendshape
    ↓ 通过 WiFi UDP 实时广播
    ↓
主播 PC(渲染机)
    ↓ VTube Studio 接收数据包
    ↓ 加载 Live2D 水手服角色模型
    ↓ 按参数映射表驱动形变
    ↓
OBS Studio 场景合成:
    · 虚拟形象层(绿幕抠掉 VTube Studio 背景)
    · 游戏画面层
    · 聊天框层
    · 礼物动画层
    ↓
RTMP 推流到 B站 / 抖音 / Twitch

关键技巧:大多数头部主播用 iPhone 做面捕(精度高),用 PC 做渲染和推流(性能强)。两机通过 WiFi 连接,有专用协议(VMC Protocol、iFacialMocap UDP)。

投入参考

  • 一个现成的 Live2D 水手服模型:2000~5000 元
  • 定制专属模型:10000~50000 元
  • 软件(VTube Studio 免费版):0 元
  • iPhone + 中配 PC + 摄像头:已有就行

【第四层】 企业虚拟偶像(A-SOUL、星瞳)

这是”中之人 + 专业动捕室 + UE5 实时渲染”的重型方案。

模块方案成本
面捕iPhone + Live Link Face(Epic 免费 App)几千元
身体动捕Xsens MVN 惯性动捕服(17 个传感器)~20 万
手指动捕Manus VR Gloves~3 万
虚拟形象Unreal MetaHuman(免费)或定制0~数十万
渲染引擎Unreal Engine 5免费
推流UE5 → NDI → OBS → B站-

一场 A-SOUL 级别的直播,中之人身上穿着超过 20 万的设备,背后还有实时调音、导演、切机位的整组团队。综合成本每场数千到数万元,这也是为什么这类虚拟偶像的票房能做起来——画面质感接近动画电影,完全不是个人 VTuber 能比的。

一个冷知识:好莱坞大片现在拍摄动捕电影(比如《阿凡达》续作)也在用 iPhone 做面部预演。ARKit 的面部数据质量在免费方案里独一档。


第三章 · 真人克隆·视觉篇(换脸 → 数字人的四级进阶)

从这一章开始,事情变得更敏感也更有意思。前面是”造一个虚构角色”,这里是”复制一个真实的人”。

我把这条路线拆成 4 个 Level,难度和能力逐级上升:

Level 1 换脸       ── 只换脸部像素
Level 2 Talking Head ── 让一张照片开口说话
Level 3 数字分身    ── 录几分钟视频生成你的克隆
Level 4 全身克隆    ── NeRF / Gaussian Splatting 重建整个人

3.1 Level 1:换脸(ArcFace + InSwapper 双核心)

换脸是最轻量的一档:真人出镜、身体和声音都是自己的,只有脸被 AI 换成另一个人。直播中你能看到的”实时换脸”、抖音”AI 漫画脸”的强力版,基本都属于这一层。

两代技术路线

维度第一代(训练式 DFL)第二代(零训练 InSwapper)
输入目标人几千张照片目标人 1 张照片
训练数小时~数天不用训练
模型产物.dfm 针对特定人通用 inswapper_128.onnx
效果更像、表情细节好通用但”像但不够像”
代表工具DeepFaceLab、DeepFaceLiveRoop / FaceFusion / Rope

第二代把换脸门槛降到了”一张目标照片 + 显卡 + 十分钟配环境”。也因此,绝大多数你能在网上玩到的换脸项目,内核都是同一个文件:inswapper_128.onnx。Roop / FaceFusion / Rope 可以理解成”同一个引擎的不同皮肤”。

核心双模型详解

换脸流水线里藏着两个协同工作的神经网络:

① ArcFace —— 给脸做”身份指纹”

  • 输入:一张 112×112 的人脸图
  • 输出:一个 512 维向量,代表”这个人的身份”
  • 同一个人不同角度的照片 → 向量方向几乎一致
  • 不同人 → 向量方向差得明显

这就是”人脸识别”门禁刷脸的底层原理。在换脸里它用来告诉系统目标脸是谁

② InSwapper —— 用身份向量重建脸

  • 输入:原图(含源脸)+ 目标身份向量(来自 ArcFace)
  • 输出:保留原图的姿态、表情、光照,但”长相”换成目标身份
  • 架构类似 GAN 生成器 + 风格注入(AdaIN 机制)

所以换脸的本质操作是:

目标明星照片一张 ──ArcFace──→  512 维身份向量("这个人是谁")
                                     ↓ 保存下来
                                     
主播摄像头每一帧  ──RetinaFace──→  找到脸的位置
        ↓
   裁剪对齐 112×112
        ↓
   InSwapper(主播脸图, 目标身份向量)  ──→  换脸后的脸图
        ↓
   贴回原图位置 + 边缘羽化 + 色调匹配
        ↓
   输出给虚拟摄像头

不需要训练的秘密:所有”脸长什么样”的通用知识已经预训练进 inswapper_128.onnx 的权重里了,身份信息由 ArcFace 向量动态注入——想换谁就换谁。

每一帧做了什么(RTX 3060 实测)

┌─ 摄像头输入 (1080p, 30fps) ────────────────────────┐
│                                                   │
│  ① RetinaFace 人脸检测                              │ ~3ms
│                                                   │
│  ② 5 点关键点对齐(裁到 112×112)                    │ ~1ms
│                                                   │
│  ③ InSwapper 换脸                                  │ ~15ms
│                                                   │
│  ④ GFPGAN 画质修复(512×512 超分)                  │ ~20ms
│                                                   │
│  ⑤ 反向仿射贴回原图 + 泊松融合                         │ ~5ms
│                                                   │
│  ⑥ 输出虚拟摄像头                                   │ ~1ms
│                                                   │
└─ 总延迟 ~45ms,~22 fps ──────────────────────────┘

帧率瓶颈永远是 GFPGAN 画质修复(占 40%+),关掉能提到 30+ fps 但脸会糊。

3.2 Level 2:Talking Head —— 让一张照片开口说话

你给一张人的静态照片 + 一段音频,AI 让照片里的嘴动起来念那段音频。最近两年卷得最狠的方向。

方案类型效果年份
Hedra商业极好2024
Hallo2(阿里 / Fudan)开源接近商业水平2024
EchoMimic(蚂蚁)开源2024
V-Express(腾讯)开源2024
SadTalker开源2023
D-ID商业老牌中高2022

现代 Talking Head 方案已经能做到:对口型 + 头部微晃 + 自然眨眼 + 轻度表情。给马云一张照片 + 一段 AI 克隆的声音 → 产出的”马云说这段话”视频,90% 的人一眼看不出问题。

技术路线:从 SadTalker 的 3DMM 驱动,到 2024 年以来主流的 Stable Video Diffusion + 音频条件控制(Hallo2、EchoMimic 走这条),生成质量有质的飞跃。

3.3 Level 3:数字分身(HeyGen 路线)

这是商业最火的赛道。流程:

用户操作:
  ① 按平台要求录 3~5 分钟视频
     (正面镜头、不同表情、念几段标准文本)
  ② 录 30 秒 ~ 1 分钟声音样本
  ③ 提交给平台
  ④ 等 30 分钟 ~ 2 小时训练
  ⑤ 之后只需输入文字,平台产出
     「你的数字分身念这段话」的 1080p 视频

代表产品:

平台定位特点
HeyGen行业标杆美国,中英文都强
Synthesia企业培训英国,NVIDIA 投资
D-ID入门友好平价、易用
腾讯智影国内合规中文生态完善
百度曦灵国内企业百度云集成
讯飞智作新闻播报风中文 TTS 顶级

为什么这条路线商业化这么快:因为它不追求”绝对真实”,只需要达到”商用演示可接受”的水平。企业培训、电商带货、新媒体口播——这些场景对”一眼能看出是 AI”的容忍度很高,只要效率和成本打得过真人就行。

3.4 Level 4:全身克隆(NeRF / Gaussian Splatting / MetaHuman)

最重型的一档,目标是从任意角度观看一个真人的完整 3D 克隆体

  • AD-NeRF / GeneFace++:用 1~2 分钟视频重建会说话的 3D 头部,可任意角度观看
  • MagicDance / Champ:学习目标人的全身动作风格(动态)
  • 3D Gaussian Splatting 路线:2024 爆红的新方法,比 NeRF 快 10 倍
  • MetaHuman + 扫描:Epic 的工业方案,让好莱坞级电影角色变得平民化

应用:好莱坞”数字替身”、游戏里的 NPC 扮演演员、逝者复活(伦理敏感)、未来的元宇宙化身。

3.5 识别 AI 人物的六大破绽

哪怕是最顶级的数字人方案,目前仍有以下破绽(按从明显到微妙排序):

  1. 光照不一致:脸换了但原图环境光没跟着调整,脸特别亮/暗,边缘色调突兀;
  2. 边缘伪影:贴合处能看到色块或模糊带,尤其戴眼镜、头发遮挡时;
  3. 遮挡失败:手遮住脸的瞬间,AI 把手也一起”换”掉,出现诡异的肉色斑块;
  4. 眨眼频率异常:早期模型几乎不眨眼(每 30 秒一次),现在好多了但仍偏低;
  5. 侧脸崩坏:模型训练以正脸为主,大角度侧脸(>60°)经常扭曲;
  6. 光影不对称:一侧阴影一侧高光,换脸后变成两侧都打光,违反物理直觉。

进阶识别(专业级):

  • 瞳孔反光形状异常(真人眼睛会映出环境光源)
  • 牙齿细节不足(AI 通常只生成一片”白色块”)
  • 耳朵/头发边界模糊
  • 脖子皮肤和脸色差(接缝处)

大部分视频平台已经在部署实时深伪检测 AI(微软的 Video Authenticator、阿里安全盾),扫描这些特征。


第四章 · 真人克隆·声音篇(Voice Cloning)

克隆了脸还不够,声音也得跟上。

4.1 两条根本不同的路线

维度TTS 克隆(Voice Cloning)实时变声(Voice Conversion / VC)
输入文本 + 目标人参考音频你说话的音频 + 目标人参考
输出目标人声线念这段文本目标人声线说你正在说的内容
实时?非实时(秒级生成)实时(< 300ms 延迟)
用途有声书、数字人配音、明星朗读直播变声、实时打电话
难度中等(延迟是天然瓶颈)

抖音/B 站你刷到的”AI 孙燕姿唱周杰伦”是 VC;HeyGen 里”输入文字让我数字分身念出来”是 TTS 克隆。完全不同。

4.2 底层通用结构:三模块嵌套

和人脸的”ArcFace + InSwapper”双模型结构类似,声音克隆也是三个神经网络配合

参考音频 (3~30 秒目标人声音)
   ↓
[ 声纹编码器 ]  ← ECAPA-TDNN / Resemblyzer
   输出:192~512 维「声纹向量」
   (相当于人脸的 ArcFace 向量,同一人不同录音向量几乎相同)

文本 或 你的语音
   ↓
[ 内容编码器 ]  ← HuBERT / ContentVec / Whisper Encoder
   输出:「只有内容、剥除了声线」的特征序列
   ("你说了什么" 而不是 "谁在说")

       [声纹向量] + [内容特征]
                ↓
       [ 声码器 Vocoder ]  ← HiFi-GAN / BigVGAN / Vocos
                ↓
        输出:合成的音频波形

灵魂设计:把”谁在说”和”说了什么”拆成两个向量,想克隆谁就换一个声纹向量塞进去。这和换脸里”身份向量 + 姿态信息”的拆分思想完全一致。

4.3 “AI 孙燕姿” 是怎么做到的

这是 2023 年爆火的现象级案例。原理:

  1. 采集数据:从孙燕姿的歌曲里切出几百条 干声(无伴奏、只有人声)
  2. 训练 RVC / so-vits-svc 模型:学习她的声纹特征(约需 RTX 3090 训练 6~24 小时)
  3. 推理:把周杰伦歌曲的干声输入模型,输出孙燕姿声线的同一首歌
  4. 后期:原伴奏 + 新人声混音 → 成品

为什么这个方案效果特别好:因为它是歌声对歌声的转换(so-vits-svc 专为歌声优化),保留了节奏、音高、换气——只换了声线。纯 TTS 克隆做不到这个效果。

4.4 2026 年最强方案清单

TTS 克隆(非实时,质量优先)

方案类型效果中文所需样本
ElevenLabs v3商业 APISOTA10 秒~3 分钟
OpenAI GPT-4o Audio商业 API极强 + 情感预设声音
CosyVoice 2(阿里达摩院)开源极强最强5~30 秒
F5-TTS开源强,速度快10~30 秒
XTTS-v2(Coqui)开源中等6+ 秒
GPT-SoVITS开源中高1~5 分钟,需训练

实时变声(低延迟优先)

方案类型延迟质量场景
Seed-VC(字节 2024)开源~200ms实时直播
RVC开源150~400ms中高AI 孙燕姿
so-vits-svc开源非实时最高歌声转换专用
ElevenLabs Voice Changer商业 API~500ms录播变声

硬件要求

场景推荐显卡CPU 能跑?
TTS 克隆(非实时)RTX 3060 12G能,很慢
实时变声 RVCRTX 3060 以上勉强,质量掉
训练专属声音模型RTX 4080/4090 或云 A100不现实

第五章 · 合成一体:完整数字人流水线

单独的换脸、单独的换声、单独的面部捕捉——都只是零件。真正的数字人是把它们全部串起来的系统工程。

5.1 六个模型串联的流水线

以 HeyGen 类平台”输入文字 → 产出我的数字分身念稿视频”为例,内部跑的是这样一条链路:

┌──────────────────────────────────────────────────────────┐
│                                                          │
│   用户输入稿子:"大家好,欢迎来到我的频道……"                │
│                     ↓                                    │
│   [ 1. TTS Voice Cloning ]                               │
│     用你的声音克隆模型(CosyVoice / 专属)                  │
│     输出:你的声线念这段的音频(mel 谱 + waveform)         │
│                     ↓                                    │
│   [ 2. Audio2Expression ]                                │
│     从语音提取面部 Blendshape 时序                         │
│     (EMO / Audio2Face 原理)                            │
│     输出:52 个 Blendshape × 时间序列                      │
│                     ↓                                    │
│   [ 3. Audio2Pose ](可选)                               │
│     从语音预测头部晃动、手势                                │
│                     ↓                                    │
│   [ 4. 视频生成 ]  三选一:                                │
│     (a) 2D Diffusion 驱动:Stable Video + 参考视频         │
│         代表:Hallo2、EchoMimic                           │
│     (b) 3D Avatar 驱动:MetaHuman 按 Blendshape 渲染      │
│         代表:HeyGen、腾讯智影                              │
│     (c) 真人视频替换:训练时录的基础视频 + 换嘴型区域         │
│         代表:早期 D-ID                                   │
│                     ↓                                    │
│   [ 5. 画质修复 ]                                         │
│     GFPGAN / CodeFormer 修复细节                         │
│                     ↓                                    │
│   [ 6. 音视频封装输出 ]                                    │
│                                                          │
└──────────────────────────────────────────────────────────┘

关键认知:HeyGen 这种商业产品的核心竞争力,不是单点技术最强(每个模块都有开源替代),而是整条流水线调优得好——延迟、质量、稳定性的平衡是一个工程问题,不是算法问题。

5.2 真人驱动 vs AI 全自动

                        数字人的两种驱动模式
                              │
                ┌─────────────┴─────────────┐
                ▼                           ▼
    ┌───────────────────┐       ┌───────────────────┐
    │ 真人驱动            │       │ AI 全自动          │
    │ (中之人模式)        │       │ (无人模式)         │
    ├───────────────────┤       ├───────────────────┤
    │ 输入:摄像头+动捕服  │       │ 输入:文本稿        │
    │ 谁在"表演":真人      │       │ 谁在"表演":AI       │
    │ 表情来源:直接捕捉    │       │ 表情来源:Audio2Face │
    │ 延迟:极低(<100ms)  │       │ 延迟:离线/秒级      │
    │ 成本:贵(人 + 设备)  │       │ 成本:GPU 电费       │
    │                   │       │                   │
    │ 代表:A-SOUL 直播    │       │ 代表:新华社 AI 主播 │
    │       VTuber 直播    │       │       HeyGen 分身   │
    │       电影动捕       │       │       抖音数字人带货 │
    └───────────────────┘       └───────────────────┘

判断诀窍:看它能不能实时互动回答新问题

  • 能 → 背后大概率有真人(或 AI 大模型实时对话)
  • 只能播固定稿 → 大概率是 AI 全自动

5.3 Audio2Face:让文字自动开口

AI 全自动数字人的灵魂模块。

它做的事:根据语音波形,自动生成同步的面部 Blendshape 参数时序

1 秒音频 (16kHz, 16000 个采样点)
     ↓
    Audio2Face CNN (常用 Wav2Vec2 + Transformer)
     ↓
30 帧 × 52 个 Blendshape 值
(30 fps 的面部动画序列)

模型是怎么学会这个映射的?——从大量”人说话的视频”里学习:

  • 发 /a/ 音时下巴必张开到某个角度
  • 发 /m/ 音时嘴唇必闭合
  • 发 /s/ 音时牙齿微露
  • 这些音素到嘴型的关联非常稳定,CNN 能很好地拟合

开源代表:NVIDIA Omniverse Audio2Face(免费),效果优秀。

新华社 AI 主播工作流

编辑写稿
   ↓
TTS 合成某主播的声线音频
   ↓
Audio2Face 自动生成面部表情序列
   ↓
Unreal MetaHuman 渲染该主播的 3D 数字分身
   ↓
后期合成新闻画面
   ↓
播出

全程无人参与”表演”——这就是 2018 年以来”永不下播的 AI 主播”背后的技术。


第六章 · 云端 API 全景(不用显卡也能玩)

前面讲的技术栈都需要本地显卡。但如果你只是想快速做出点东西、不想折腾本地环境——云端 API 足够了。

6.1 声音克隆 API

服务价格(2026 参考)特点
ElevenLabs330/月效果最强,50+ 语言
OpenAI TTS$15/百万字符集成在 GPT-4o Audio
Azure Custom Neural Voice企业签约微软生态
阿里 CosyVoice 云 API按调用计中文最强
讯飞语音合成按次/字符中文老牌
Resemble AI$19/月起专业克隆
PlayHT$39/月起有声书友好

6.2 数字人视频生成 API

服务价格特点
HeyGen API165/月行业标杆
Synthesia API企业定制企业培训
D-ID API$5.9/月起便宜入门
Tavus$59+/月实时交互
腾讯智影 API按次国内合规
百度曦灵按分钟百度云
讯飞智作按次新闻播报风

6.3 实时交互数字人(流式 API,2025~2026 爆点)

用户说话 → 数字人实时回答,嘴型表情同步,这是当前最前沿的形态。

方案方式特点
HeyGen Interactive AvatarWebSocket 流式延迟 < 1s
Tavus Conversational Video流式客服场景
ConvaiSDK + 云游戏 NPC
Inworld AISDK + 云角色扮演
NVIDIA ACE云端企业高保真
OpenAI Realtime API + D-ID组合 DIY延迟最低
Gemini 2.5 Live原生多模态视频输入输出

6.4 组合拳示例:$100/月搭一条端到端流水线

假设你要做一个”输入文字 → 一分钟后收到我的数字分身念这段话的视频”的服务。不用任何本地 GPU,一条 Python 脚本就能搭起来:

"""
虚拟数字人视频生成服务(云端 API 组合版)
依赖:requests
成本:~$30/月(个人档),每分钟视频 $0.3~$1
注:下列代码为示意,省略了错误处理与 HeyGen 音频上传 (上传_到_heygen) 的具体实现
     真实项目请查阅两家 API 的最新官方文档
"""
import requests
import time
 
ELEVENLABS_API_KEY = "sk-elevenlabs-xxx"
HEYGEN_API_KEY = "hg-xxx"
VOICE_ID = "your-cloned-voice-id"     # 提前在 ElevenLabs 克隆好
AVATAR_ID = "your-heygen-avatar-id"   # 提前在 HeyGen 训练好
 
def 上传_到_heygen(音频数据: bytes) -> str:
    """占位:把音频上传到 HeyGen 资产库,返回 audio_asset_id"""
    # 真实实现调用 HeyGen 的 /v1/asset 接口
    ...
 
def 生成数字人视频(文字稿):
    # 第一步:ElevenLabs 克隆声音 → MP3
    音频响应 = requests.post(
        f"https://api.elevenlabs.io/v1/text-to-speech/{VOICE_ID}",
        headers={"xi-api-key": ELEVENLABS_API_KEY},
        json={"text": 文字稿, "model_id": "eleven_multilingual_v2"}
    )
    音频数据 = 音频响应.content  # MP3 bytes
 
    # 第二步:把音频上传到 HeyGen → 数字人视频
    音频ID = 上传_到_heygen(音频数据)
    视频任务 = requests.post(
        "https://api.heygen.com/v2/video/generate",
        headers={"X-Api-Key": HEYGEN_API_KEY},
        json={
            "video_inputs": [{
                "character": {"type": "avatar", "avatar_id": AVATAR_ID},
                "voice": {"type": "audio", "audio_asset_id": 音频ID},
            }],
            "dimension": {"width": 1920, "height": 1080}
        }
    ).json()
 
    # 第三步:轮询等待渲染完成
    任务ID = 视频任务["data"]["video_id"]
    while True:
        状态 = requests.get(
            f"https://api.heygen.com/v1/video_status.get?video_id={任务ID}",
            headers={"X-Api-Key": HEYGEN_API_KEY}
        ).json()
        if 状态["data"]["status"] == "completed":
            return 状态["data"]["video_url"]
        time.sleep(10)
 
# 使用
url = 生成数字人视频("大家好,欢迎来到我的频道。")
print(f"你的数字分身视频:{url}")

就这 30 行,一个端到端的数字人视频生成服务就搭完了。


第七章 · 实战指南 + 法律红线

7.1 按场景推荐(六种典型需求)

场景 1:只想做几个好玩视频(低频一次性)

  • HeyGen 网页版(免费额度 3 分钟,然后 $24/月)
  • D-ID 更便宜,效果略弱
  • 零技术门槛,零硬件

场景 2:自媒体/公司需要持续输出数字人视频

  • HeyGen Creator($89/月,每月 30 分钟额度)
  • 国内合规:腾讯智影 / 讯飞智作

场景 3:做产品,需要 API 接入

  • 声音:ElevenLabs(海外)/ CosyVoice(国内)
  • 视频:HeyGen API(海外)/ 腾讯智影 API(国内)
  • 参见第六章代码示例

场景 4:做直播变声(实时)

  • 本地:RVC + OBS(免费,RTX 3060+)
  • 云:ElevenLabs Voice Changer(有延迟)

场景 5:完全自主可控、二次开发

  • 声音:CosyVoice 2 + F5-TTS + RVC(开源栈)
  • 数字人:Hallo2 + EchoMimic(开源栈)
  • 硬件:RTX 4090 × 1(约 1.6 万元)

场景 6:企业级高端直播/交互

  • NVIDIA ACE + MetaHuman + Omniverse
  • 硬件:单张 A100 / H100 起
  • 投入数十万

7.2 成本对比总表

方案初始投入月度成本产出质量适合谁
VTube Studio + Live2D2000~10000 元(模型)0★★★★个人 VTuber
HeyGen 个人版089★★★★内容创作者
D-ID 入门049★★★低频尝鲜
云 API 组合0300★★★★★开发者
本地开源栈16000 元(4090)+ 画师费~50 元电费★★★★技术控
NVIDIA ACE 企业20 万+(动捕+GPU)服务器成本★★★★★企业/MCN

7.3 法律红线(中国法规)

核心法规

  • 《互联网信息服务深度合成管理规定》(2023.1 起施行)
  • 《生成式人工智能服务管理暂行办法》(2023.8 起施行)

关键条款(简化版)

  1. 深度合成内容必须显著标识(视频角落加”AI 合成”字样或水印)
  2. 使用真实他人肖像 / 声音必须获得本人明确同意(口头不算,要书面/电子协议)
  3. 不得生成虚假新闻、政治敏感、色情、诈骗等内容
  4. 服务提供者需备案

能做 vs 不能做清单

✅ 合规❌ 红线
用虚构 Avatar 做 VTuber 直播未经授权用名人脸/声做直播
换自己的脸 / 克隆自己的声音冒充他人身份与人交谈/视频通话
商业授权后的明星数字人代言伪造领导人讲话/新闻画面
数字人念自己写的稿子做科普用数字人做政治宣传/散布谣言
有授权协议的逝者数字复活(家属同意)擅自”复活”公众人物
影视行业合规动捕/数字替身深伪视频骚扰/诋毁他人

实操建议

  • 个人娱乐:换自己的脸、克隆自己的声音——没问题
  • 商业使用:必须签合规协议,明确肖像权归属
  • 发布平台:抖音 / B 站 / YouTube 都有深伪检测,越界作品大概率被下架/封号

尾声 · 所有”假人”的共同骨架(一页总结)

┌────────────────────────────────────────────────────────────┐
│                                                            │
│  输入层(真实世界信号)                                       │
│  ├─ 摄像头 RGB(MediaPipe)                                 │
│  ├─ 深度相机(TrueDepth)                                    │
│  ├─ 语音(Audio2Face)                                      │
│  ├─ 动捕服(Xsens)                                         │
│  └─ 文本(TTS)                                             │
│          ↓                                                 │
│  中间层(标准化的表情/姿态参数)                                │
│  └─ 52 个 Blendshape + 头部/身体 6DoF 姿态                 │
│          ↓                                                 │
│  输出层(虚拟形象渲染)                                       │
│  ├─ Live2D 纸片人                                          │
│  ├─ 3D VRM / VRoid                                         │
│  ├─ Unreal MetaHuman                                       │
│  └─ 2D Stable Video Diffusion                              │
│                                                            │
└────────────────────────────────────────────────────────────┘

理解这个三层架构后:
  · 抖音西瓜头 = 摄像头输入 + 轻量模型中间层 + 3D 挂件输出
  · iPhone Memoji = TrueDepth 输入 + ARKit 中间层 + 预制卡通 Avatar 输出
  · A-SOUL 直播 = 动捕服+iPhone 输入 + UE5 中间层 + MetaHuman 输出
  · 新华社 AI 主播 = TTS 音频输入 + Audio2Face 中间层 + MetaHuman 输出
  · 换脸直播 = 摄像头输入 + InSwapper 中间层 + 真实身份向量输出
  · HeyGen 数字分身 = 文本输入 + 六模型流水线中间层 + 真人视频合成输出

积木不多,组合无穷。

附录 A · 术语速查

术语含义
Blendshape52 维表情参数,苹果 ARKit 定义、业界标准
Morph Target3D 模型的形变目标,功能等同 Blendshape
Live2D日本开发的 2D 纸片人动画技术
VRM3D 虚拟角色文件标准(基于 glTF)
ArcFace提取人脸 512 维身份向量的识别模型
InSwapperInsightFace 开源的一键换脸生成器
中之人操纵虚拟主播的真人演员(日语直译)
TTSText-to-Speech,文本转语音
VCVoice Conversion,声音转换
Vocoder声码器,梅尔频谱 → 音频波形
HuBERT / ContentVec内容编码器,提取说话内容特征
Audio2Face语音 → 面部表情的神经网络
MetaHumanEpic Games 的高保真数字人方案
ARKit苹果的增强现实开发框架(含面部追踪)
MediaPipeGoogle 开源的跨平台 CV 框架
NeRF神经辐射场,用神经网络表示 3D 场景
3DGS3D Gaussian Splatting,2024 新兴 3D 重建技术
Lip Sync嘴型同步
Deepfake深度伪造,AI 生成虚假人物影像

附录 B · 相关笔记


整理日期:2026-04-20 · 基于多轮与 Claude 的技术对话沉淀