给现有 AI Agent 加上数字人,应该是扩展,而不是替换。你的 SaaS 产品仍然可以保留既有的对话逻辑、知识、权限、工具调用和业务工作流;数字人只在适合的时刻,把已生成的语音答案以更直观的方式呈现出来。
在 Spatius 的集成里,边界应当很清楚:你的应用产生数字人要说的语音音频;Motion Server 将这段语音转换为动作数据;AvatarKit 在客户端本地渲染数字人。Spatius 不会返回一段成品视频,也不会接管你的 ASR、LLM、TTS、上下文、检索、权限、工具调用、工作流、分析、轮次管理或人工交接。以 Spatius 开发者文档总览 为准,可以查看当前架构。
核心结论
- 把数字人视为现有 Agent 外的一层展示能力,而不是另一个 Agent。
- 知识、权限、数据、工具调用和业务决策继续由应用或 Agent 后端掌握。
- 集成方式应取决于你当前的运行时和语音链路,而不是某个协议听起来是否“更实时”。
- 先验证一个明确的产品时刻,再决定是否扩展到更多页面和场景。
先划清系统边界
在选 SDK 或传输方式之前,先明确数字人负责什么。它可以让解释更易跟上、引导用户完成一个产品任务,或让既有对话更具有人际感;但它不应该悄悄接管对话策略、客户数据或产品操作。
你现有的 AI Agent 仍然负责理解用户输入、检索上下文、决定要调用什么工具、执行权限判断,并产出被允许的回复。现有的 TTS 服务或其他音频来源,再把要由数字人呈现的语音交给展示层。
这种拆分让集成更容易推理,也让你能继续使用已经选定的 Agent 技术栈,而无需为了数字人重新搭建一套对话系统。
选择匹配现有架构的集成路径
Spatius 支持不同的集成形态。应根据语音音频在哪里生成、运行时需要由谁负责,以及你的技术栈目前有哪些已文档化路径来选择,而不是笼统地偏好某一种传输协议。
已有语音链路时,考虑 Direct Mode
如果你的应用已经能从 TTS、Agent 框架、预录内容或其他来源获得数字人语音音频,并希望客户端负责数字人播放,可使用 Direct Mode。
在这条路径中,后端签发 Session Token。客户端中的 AvatarKit 使用该 Token 通过 WebSocket 连接到 Motion Server,发送数字人语音音频、接收动作数据,并在本地完成渲染。这个 Token 接口不是 Agent 运行时的替代品:ASR、LLM、TTS、上下文、检索、策略和工作流仍然由你的应用负责。
只有在运行时确有需要时,才选择其他路径
如果你的现有语音 Agent 运行时有当前已文档化的集成路径,应结合既有系统来评估。若后端必须拥有音频链路和到客户端的下游传递,可评估 Backend Mode。这意味着团队还需要自行负责所选择的传递、恢复和可观测性行为。
关键不是“功能最多”,而是职责是否符合你现有产品的边界。不要只因为一张架构图看上去更可定制,就引入更重的运行时。
围绕一个明确的产品时刻接入
第一版应当有一个很窄的职责。比如:引导完成入门步骤、在关键操作后解释下一步、在支持流程中帮助用户跟上复杂说明,或为已经由 Agent 支撑的产品演示增加展示层。
不要从“到处放一个数字人”开始。选择一个视觉化讲解能让既有答案更容易理解的时刻,再定义 Agent 能说什么、能访问什么信息,以及哪些产品操作始终由用户决定。
保持原有的对话契约
加入数字人不应削弱既有的保护机制。检索、权限校验、数据处理、工具调用、升级处理和人工交接,都应继续遵守原先的产品规则。数字人负责呈现回复;允许什么回复、能够执行什么动作,仍由应用决定。
在实现前写清楚:
- 哪些类型的 Agent 回复适合由数字人呈现;
- Agent 可以继续使用哪些数据源和工具;
- 用户如何打断、退出或切换到另一种交互方式;
- 何时应该转给人工或另一个产品工作流。
把集成当作完整的产品体验来测试
技术连通只是上线的一部分。应走通完整链路:用户输入进入 Agent;应用判断上下文和权限;TTS 或其他音频来源产出被允许的语音;Motion Server 将数字人语音转成动作数据;AvatarKit 在客户端本地渲染。
试点阶段可围绕产品本身提出问题,而不是套用外部基准:
- 这个数字人是否让具体回复更容易理解或完成?
- 它是否保持了用户对现有 Agent 的预期?
- 用户能否清楚地打断、退出或转去其他工作流?
- 应用日志和支持反馈是否足以帮助团队理解体验?
Direct Mode 在 WebSocket 连接未能于 15 秒内建立时,包含音频优先的回退行为。把它当作需要在自身流程里验证的一个具体情形,而不是产品级错误处理和恢复设计的替代。具体要求请查看 Direct Mode 文档。
实施检查清单
- 确认职责归属。 明确应用或 Agent 后端拥有 ASR、LLM、TTS、知识、上下文、检索、权限、工具、业务逻辑、分析、轮次管理和人工交接。
- 选择路径。 从集成路径说明开始,选择符合现有架构的方案。
- 正确处理凭据。 Direct Mode 中让后端签发 Session Token,而不是把服务端凭据放到客户端。
- 完成一个真实流程。 选择一个小而具有代表性的产品时刻,而非脱离产品的数字人演示。
- 验证控制与恢复。 测试打断、退出、错误处理和工作流需要的人工交接。
- 审慎扩展。 只有团队已经理解第一个场景后,再接入更多产品时刻。
常见问题
接入 Spatius 会替换我的 SaaS AI Agent 吗?
不会。应用或 Agent 后端仍然拥有 ASR、LLM、TTS、上下文、检索、权限、工具调用、工作流、分析、轮次管理和人工交接。Spatius 将数字人语音音频转换为动作数据,AvatarKit 在客户端本地渲染数字人。
Spatius 会向客户端传输成品数字人视频吗?
不会。Motion Server 返回的是动作数据,AvatarKit 在客户端本地完成渲染。开发者文档总览解释了这一产品边界。
接入数字人必须使用某种特定的实时传输方式吗?
不必。Direct Mode 使用客户端到 Motion Server 的 WebSocket 连接。其他路径只有在其运行时和传输职责符合你现有架构时才值得选择。
什么情况下用 Backend Mode,而不是 Direct Mode?
当后端需要拥有音频链路和下游传递时,可使用 Backend Mode。若已经具备数字人语音音频,且希望从专注的客户端集成开始,Direct Mode 往往是更直接的起点。请以当前集成文档为准。
给你已拥有的 Agent 加上一层更直观的呈现
最强的实现并不是动画最多的实现,而是在一个具体产品时刻,数字人确实帮助用户理解,同时 SaaS 应用仍然掌控智能、数据、用户控制和工作流。
如果你正在规划集成,并想评估适合自身技术栈的路径,预约演示。