跳至正文

什么是 Digital Human?AI 数字人技术如何工作

展示写实、线框与骨骼动画层的 digital human

Digital human 是为了以类似人类的方式交流或行动而设计的计算机生成角色。AI digital human 会把这种视觉界面与语音、智能结合,但它并不自动等于完整 AI agent。在实时系统中,聆听、推理、说话、动画、渲染和传输通常由不同技术负责。

什么是 digital human?

这个词既描述视觉角色,也描述围绕角色构建的体验。Unreal Engine将 digital human 定义为由计算机生成、通过动画表现得像人的 3D 形象。在商业软件中,它通常还包括在 Web、移动端、Kiosk、游戏引擎或空间计算界面中与用户说话和回答问题的写实或风格化角色。

“Digital human” 并没有规定唯一的渲染风格或智能水平。角色可以是 2D 或 3D、写实或品牌化、实时或录播;可以阅读固定脚本、执行工作流,也可以连接使用 RAG 和工具的 AI agent。

真正有用的问题不是产品有没有 digital human,而是它包含哪些技术层、在哪里运行,以及角色在真实交互中能做什么。

Digital human、avatar、chatbot 与生成视频

术语通常描述什么不代表什么
Digital human人类形态的数字角色及呈现体验实时交互或完整 AI 技术栈
Avatar用户、角色或 agent 的任意视觉表示人类写实度、语音或智能
AI agent能使用上下文、工具并采取行动的软件面孔、声音或视觉存在
Chatbot通常以文字为主的对话界面自主 agent 或视觉角色
数字人生成视频根据脚本或媒体输入渲染的片段实时回答、打断或双向对话

这些类别可以重叠,但不能互换。实时 digital human 可以是 AI agent 的脸和声音;生成视频可以展示同一个角色,却无法参与实时对话;chatbot 也可以使用相同的 LLM 与业务工具而没有视觉层。

AI digital human 技术如何工作?

完整系统通常由五层组成:

  1. **感知:**ASR 转写语音,可选摄像头或应用事件提供额外上下文。
  2. **智能:**LLM、RAG、工作流或业务系统决定说什么、做什么。
  3. **语音:**TTS 用指定声音和语言把回答转成音频。
  4. **动画:**数字人模型根据语音节奏和声学信号生成口型、面部、眼神与身体动作。NVIDIA 的 Audio2Face 介绍是音频驱动动画的一个例子。
  5. **渲染与交付:**客户端或云服务渲染角色,并将画面与声音同步到用户设备。

NVIDIA 的 digital human 概览也把这个类别描述为语言、语音、动画与图形技术的组合。任何单层都无法独立保证体验。即使模型很快,如果转写等待过久、TTS 不流式输出、渲染卡顿或数字人无法响应打断,用户仍会觉得慢。

Spatius 聚焦动画与渲染层。当前 Spatius 文档描述了接收语音并返回口型动作数据的 Motion Server,以及面向 Web、iOS、Android 和 Flutter 的 AvatarKit。团队可以保留现有 ASR、LLM、工具和 TTS,而不是更换整个 agent。

实时与录播 digital human 解决不同任务

录播 digital human 适合可重复媒体。创作者提供脚本或音频、审核生成结果,再发布完整视频,适用于讲解、培训、本地化公告和营销内容。

实时 digital human 面对不确定输入。系统不知道用户接下来会问什么,也不知道 agent 的完整回答,必须在会话进行中生成、动画化并交付每一轮内容,还要明确处理打断、沉默、工具调用、错误和人工转接。

这会改变采购标准。视频生成更重视视觉效果和编辑能力;实时产品还必须测试对话延迟、口型同步、传输、设备表现、session 恢复、可观测性、并发和完整运行成本。

数字人应该在哪里渲染?

云端渲染系统在供应商基础设施上生成最终视频帧并传给客户端。客户端渲染系统发送动作数据,由用户设备绘制数字人。混合架构还可以把模型推理、动画、资源和渲染拆分到两端。

这个选择不只影响带宽,还会决定数字人如何与产品 UI 组合、应用能控制哪些镜头和图层、客户端需要什么硬件,以及哪些数据会离开设备。选择 SDK 前,可先阅读端侧与云端数字人架构对比

如何把 digital human 接入现有 AI agent

先定义 agent 边界,再选择角色:

  1. 画出现有用户输入经过 ASR、推理、工具、TTS 到播放的完整路径。
  2. 确定数字人接收文字、完整音频,还是流式音频。
  3. 定义 session 所有权、凭据、传输,以及哪个组件加入实时房间。
  4. 同步音频播放与动作,并为用户打断建立唯一取消路径。
  5. 在 UI 中呈现加载、聆听、思考、说话、报错和重连状态。
  6. 在代表性浏览器、手机、Kiosk 和网络上测试同一工作负载。

LiveKit 的 virtual avatar 模型提供了一个参考:voice agent session 把音频输出发送给 avatar worker,再由后者发布同步媒体。Spatius agent 架构指南则解释如何在现有 agent 已经工作的情况下保持视觉层可替换。

采购时应该评估什么?

  • **归属:**明确谁负责 ASR、推理、工具、TTS、动画、渲染、传输、文字记录和审核。
  • **响应速度:**测量完整对话轮次与打断路径,而不是单个服务器指标。
  • **视觉控制:**测试自定义角色、场景组合、品牌、眼神、待机动作和 fallback。
  • **部署:**核实 SDK 成熟度、浏览器与设备支持、资源传输、GPU 要求和升级策略。
  • **数据流:**记录哪些服务会接收语音、文字、媒体、动作、身份信息和分析数据。
  • **无障碍:**提供字幕、文字记录、非语音控制和替代界面;可参考 W3C 媒体无障碍规划指南
  • **成本:**计算并发、空闲时间、数字人使用、语音服务、LLM token、网络、存储和运维人力。

可通过 AI 数字人平台对比建立 shortlist,再用同一生产场景测试候选。也可以先在 Spatius Playground中体验实时 digital human。

常见问题

Digital human 是真人吗?

不是,它是计算机生成角色。产品应明确说明自动化身份,避免让用户误以为正在与真人交流。

所有 digital human 都使用生成式 AI 吗?

不是。有些只执行固定脚本或确定性工作流;有些会使用生成模型、RAG、业务工具或多种系统组合。

什么让 digital human 成为实时产品?

它可以在活跃交互中生成并呈现新的回答,而不是提前渲染完整体验。关键测试包括轮次延迟、打断、同步和恢复。

Digital human 会替代 AI agent 平台吗?

不一定。供应商可能打包完整对话技术栈,也可能只提供视觉层。比较价格和工程投入前必须先确认边界。

最后核验:2026 年 9 月 14 日。定义相对稳定,但供应商能力、SDK 支持、价格和技术限制都可能变化。

Add a real-time digital human to the AI stack you already use Request a demo, or ,或Try the playground.

让你的智能体拥有一张会回应的脸。

开始构建