试点 AI 数字人,并不意味着重建你的 Agent 或重新设计整个产品。更适合的做法是:选定一个用户时刻,验证带有语音和视觉呈现的数字人,是否能让这个时刻更易理解。例如一个较难的入门步骤、产品内解释,或需要引导的支持工作流。
在 Spatius 的集成里,系统边界应保持清楚。应用负责智能与产品决策:ASR、LLM、TTS、知识、上下文、检索、权限、数据、工具调用、工作流、分析、轮次管理和人工交接。Spatius 将数字人语音音频转换为动作数据,AvatarKit 在客户端本地渲染数字人。它不返回成品视频,也不会接管你的 Agent。Spatius 开发者文档总览是当前架构的权威参考。
核心结论
- 从一个摩擦较高的产品时刻开始,而不是在所有界面都加入数字人。
- 保留团队已经在运行的应用和 Agent 职责边界。
- 选择与现有运行时匹配的集成路径,不要把某一种协议当成通用答案。
- 给试点用户明确的打断、退出和切换路径。
- 在扩展第一个工作流前,先定义需要看到什么证据。
选择一个要验证的产品时刻
第一个问题不该是“哪里能放数字人”,而是“在哪个既有任务中,带语音的视觉说明可能让用户更容易理解?”先选择一个用户本来就需要指导的时刻,并确保团队能观察用户接下来的产品动作。
对于 B2B SaaS,这可以是一个设置检查点、复杂功能的解释、已有明确困惑点的支持流程,或产品演示中的一个环节。合适的试点应有清晰的目标用户、经过批准的回复范围,以及始终由用户控制的下一步产品操作。
不要把首次发布当成“数字人无处不在”的实验。小范围试点能让产品、工程和面向客户的团队围绕同一个实现进行评估,也能更容易区分交互本身的价值与新界面的新鲜感。
定义对话契约
实现前,要写清楚数字人可以呈现什么、不能做什么。至少应包括:
- 纳入试点的用户时刻和回复类型;
- Agent 可使用的知识来源、权限和工具调用;
- 哪些动作必须始终由用户确认;
- 打断、退出、回退和人工交接的路径。
数字人可以呈现一个答案;但该答案是否被允许、是否适合当前上下文、是否连接到正确工作流,仍由应用判断。
保持系统边界不变
团队很容易把“AI 数字人”和“AI Agent”混为一类,但两者位于不同层。Agent 负责理解输入、检索信息、应用业务规则并决定下一步;数字人使最终的语音回复更可见、更具有人际感。
在 Spatius 的实现中,应用或既有 Agent 栈产生数字人语音音频。Motion Server 将音频转换为动作数据,AvatarKit 在客户端接收动作数据并完成本地渲染。
这让试点期间的产品归属很明确。团队仍然决定 Agent 可访问哪些信息、可以说什么、可以做什么,以及用户如何在产品中前进。
选择适合当前运行时的集成路径
不要因为某个传输标签在对比表里听起来很合适,就选择一种架构。先看你已经拥有的运行时,以及后端需要掌握到什么程度。Spatius 集成指南列出了当前已文档化的路径。
已有语音音频时使用 Direct Mode
当应用已能通过 TTS、Agent 框架或其他音频来源获得数字人语音音频,并希望客户端负责播放时,可以使用 Direct Mode。后端签发 Session Token;客户端的 AvatarKit 使用它通过 WebSocket 连接 Motion Server,发送数字人语音音频,接收动作数据,并在本地渲染。
后端仍是 Agent 运行时的拥有者。ASR、LLM、TTS、检索、Agent 策略和产品工作流仍然在那里运行;Token 接口并不取代这些职责。
只有在后端确实需要负责时,才使用其他路径
若现有语音 Agent 运行时具有已文档化的集成路径,请在自身系统语境中评估。后端需要拥有音频链路和到客户端下游传递时,可以使用 Backend Mode。这也意味着团队需要承担自己选择的传递、恢复和可观测性职责。
把试点作为完整的产品体验来上线
技术接通只是试点的一部分。还要确定谁能访问、开始前用户看到什么、怎样退出或更改交互。如果团队已有 feature flag,可以先针对内部用户或自愿加入的用户群体开放,再考虑更大范围的发布。
测试整条路径,而不只是数字人播放
按用户实际会经历的方式走完整流程:
- 用户开始已限定的产品任务;
- 应用判断上下文、权限和 Agent 策略;
- 语音层产出被允许的数字人语音音频;
- Motion Server 将语音转换为动作数据,客户端完成本地渲染;
- 用户可以打断、离开、选择另一条路径,或完成下一步产品动作。
恢复行为也必须在同一流程中测试。Direct Mode 在 Motion Server WebSocket 未能于 15 秒内建立时,包含音频优先的回退行为。将它与产品自己的错误处理、支持和恢复设计一起验证,而不是把它视为替代品。当前要求以 Direct Mode 文档为准。
衡量这次试点是否值得扩展
在团队拥有所选工作流的证据前,不应承诺数字人会改善激活、支持成本或留存。更实用的做法是:先为选定用户和场景定义什么样的结果才算有价值。
可以查看:
- 符合条件的用户是否开始、完成、打断或离开交互;
- 是否到达预期的下一步产品动作;
- 明确的“是否有帮助”反馈与定性支持反馈;
- 暴露摩擦的恢复、退出和人工交接事件;
- 应用日志是否给团队足够上下文来理解体验。
如果合适,可以与同一用户时刻的常规体验比较。目标不是对数字人给出普遍结论,而是判断这个交互是否在这个上下文中为产品带来价值。
常见问题
Spatius 试点会替换我的 SaaS AI Agent 吗?
不会。应用或 Agent 后端仍拥有 ASR、LLM、TTS、知识、上下文、检索、权限、数据、工具调用、工作流、分析、轮次管理和人工交接。Spatius 将数字人语音转换为动作数据,AvatarKit 在客户端本地渲染。
Spatius 会向客户端传输一段完成的数字人视频吗?
不会。Motion Server 返回的是动作数据;AvatarKit 在客户端完成本地渲染。可查看开发者文档总览了解产品边界。
数字人试点需要某个特定的传输方式吗?
不需要。Direct Mode 使用客户端到 Motion Server 的 WebSocket 连接。只有当其他路径的运行时和传输职责符合已经运行的架构时,才应选择它们。
什么时候应该从试点扩展到更大范围?
只有当团队能清楚解释用户时刻、Agent 与数据控制、技术恢复行为,以及支持扩展的用户证据时,才进入下一阶段。不要因为一次演示顺利,就假定它适用于每个产品场景。
从一个能让团队真正学习的试点开始
最好的首个数字人部署是范围清晰、治理明确且可衡量的。它保留团队原本拥有的 Agent 与产品控制,同时让你评估一次真实的用户交互。
如果你在规划 AI 数字人试点,并希望评估适合技术栈的集成路径,预约演示。