不应仅因为对话式界面已经可用,就在 SaaS 产品中加入 AI 数字人。更有价值的问题是:在产品的哪个时刻,一个会说话、可视化的引导者能让用户的任务变得更轻松?
对大多数 B2B SaaS 团队而言,答案并不是“到处都放”。当用户正在学习复杂工作流、判断下一步、练习一段对话,或处理从类人讲解者中获益的信息时,数字人才值得出现。在这些时刻之外,标准界面、书面引导或紧凑的文本聊天可能是更好的体验。
本文提供一套产品设计框架,用于选择正确的界面位置、定义用户控制方式,并保持清楚的技术边界。在 Spatius 中,应用仍负责智能体和产品逻辑;Spatius 将数字人语音音频转换为动作数据,AvatarKit 则在客户端本地渲染数字人。请参阅 Spatius 文档地图。
核心结论
- 将数字人放进真实的用户任务中,而不是作为装饰性的助手覆盖每个页面。
- 让入口与场景相关:用户打开前就应理解数字人为何在这里。
- 将任务逻辑、客户上下文、权限、工具、ASR、LLM 和 TTS 保留在你的应用或智能体技术栈中。
- 给用户简单的控制方式:打开、暂停、打断、切换为文本或离开该体验。
- 从一个工作流开始,衡量数字人是否帮助用户完成下一个有意义的步骤。
从用户任务开始,而不是从界面形态开始
团队常常先讨论数字人应该作为悬浮气泡、侧边面板还是全屏体验出现。这些都是实施选择。先向前退一步:
用户此刻究竟需要理解、判断、练习或完成什么?
如果答案很模糊——“让产品看起来更 AI 化”——数字人通常会变成背景噪音。如果答案很具体——“帮助新管理员配置第一个工作流”或“让销售人员在通话前练习应对异议”——你就可以围绕这个任务设计专注的体验。
在选择位置前,可使用以下测试:
| 问题 | 适合使用数字人的强信号 | 不太适合使用数字人的弱信号 |
|---|---|---|
| 是否存在明确的用户任务? | 用户有清晰的目标或需要作出的判断。 | 当前页面只是通用仪表盘或列表视图。 |
| 口头讲解是否能增加价值? | 任务需要操作引导、练习或有细节的说明。 | 用户只需要一条简短指令或一张数据表。 |
| 此刻是否具有丰富上下文? | 产品已经知道用户的工作流、对象、角色或下一步。 | 数字人需要用户重复提供基本上下文。 |
| 用户能否控制体验? | 用户可开始、停止并选择另一条路径。 | 数字人自动出现并阻塞主要任务。 |
| 是否有可衡量的下一步操作? | 可观察到完成、进展或有帮助的交接。 | 成功仅仅意味着“展示过数字人”。 |
最终应得到一句简洁的产品陈述,例如:“在首次创建营销活动时,提供可选的数字人引导,解释需要作出的选择。”这比“在入门流程中放一个数字人”更有用。
AI 数字人可适配的四种位置
不存在放之四海皆准的最佳位置。正确的模式取决于用户意图、工作的复杂度,以及一个可见的讲解者是否确实能改善互动。
| 位置模式 | 最适合的情况 | 产品设计说明 |
|---|---|---|
| 上下文入口 | 用户来到一个已知的不确定时刻,例如首次配置或不熟悉的功能。 | 清楚说明价值:“获取引导式说明”比通用数字人图标更有用。 |
| 嵌入式工作流步骤 | 用户在完成多步骤任务时,需要理解各项选择。 | 保持表单、文档或工作流可见,让说明始终与工作相连。 |
| 专门的练习空间 | 目标是演练、模拟、辅导或基于场景的学习。 | 为这个空间定义起点、场景和完成状态,而不要让它成为永久的产品覆盖层。 |
| 可选帮助界面 | 用户在尝试标准界面后,可能仍需要解释。 | 让用户能从相关帮助入口或空状态轻松调用,也同样容易关闭。 |
这些模式可以在同一产品中共存,但不应同时上线。当第一个实现只绑定在一个高价值工作流上时,也更容易评估效果。
1. 在已知的不确定时刻提供上下文入口
当产品拥有足够上下文、能提出有用的帮助邀请时,数字人会很有效。例如,新指派的工作区管理员第一次配置集成时,一个小而可选的入口可以用通俗语言解释设置选项,再让用户回到表单。
关键是相关性。体验应继承页面上下文——用户正在处理什么、处于哪个阶段、接下来可以做什么——而不要变成干扰性的弹窗。
好的产品文案会明确说明用途:
- “带我完成这项设置”
- “练习这段客户对话”
- “解释本页的选项”
除非用户能马上看到它可以提供什么帮助,否则应避免“问问数字人”这类模糊标签。
2. 将数字人嵌入讲解与操作必须并列的地方
有些工作流会因引导停留在独立帮助中心或脱离任务的聊天窗口而变得更难。当用户正在配置流程、审阅结果或推进结构化任务时,嵌入式讲解者可以让说明更贴近控件。
这并不意味着数字人应该接管页面。紧凑的面板、抽屉或步骤级视图可能就够了。用户应保留对底层表单、文档或记录的访问,并能在口头引导与标准界面之间切换。
设计问题不是“这能不能做成动画?”,而是“这种呈现是否能帮助用户作出更好的下一步选择?”
3. 为练习类互动提供独立空间
角色扮演、模拟发现电话、销售话术练习或基于场景的培训,都是专门数字人体验的自然候选。用户是主动进入这场对话的,因此产品可以在开始前设定预期:场景、用户的角色、如何打断,以及结束后会发生什么。
这通常比在 CRM 页面或任务列表中突然放入一个实时数字人更清楚。独立空间赋予互动明确目的,也让周围的工作免受不必要的动作或音频干扰。
4. 在用户尝试标准路径后提供可选帮助
并非每位用户在刚遇到摩擦时都希望由数字人带领说明。可选帮助界面让他们在需要时再作选择。可以把它放在空状态中、复杂设置旁边、需要解释的错误之后,或产品教育中心内。
数字人应补充书面产品引导,而不是取代它。对于不愿使用语音或动态呈现的用户,应提供可阅读的摘要或文本路径。
数字人通常不该放在哪里
“随处可用”很少是一种产品策略。以下情况要谨慎对待在每页常驻一个数字人:
- 用户反复浏览表格、仪表盘或列表;
- 任务时间敏感,增加一次互动会拖慢进度;
- 数字人没有页面特定的用途;
- 产品已经有一个紧凑、熟悉的控件能解决这个需求;
- 用户正在处理敏感信息,而这项新增体验还未针对该工作流完成审查。
在这些情形中,上下文提示、书面说明、短视频或现有支持路径,可能更尊重用户的注意力。
让数字人层与产品智能保持分离
位置设计与架构是相连的。一个有用的体验可能需要产品上下文、账户权限、检索、工具调用和 AI 智能体。这些都属于应用责任,而不是应自动移交给数字人层的功能。
根据 Spatius 已文档化的架构,你的应用或智能体技术栈负责语音识别、LLM 逻辑、文本转语音、轮次管理、知识检索、权限和产品工作流。口头回复会以数字人语音音频的形式发送到 Motion Server,后者返回动作数据;AvatarKit 在客户端本地渲染数字人。文档地图介绍了这些边界,Direct Mode 概览则展示了客户端如何通过会话令牌连接 Motion Server。
这种分离为产品团队提供了一条实用的设计原则:
将数字人放在用户需要讲解者的地方。把决策、客户上下文和操作留在拥有它们的产品系统中。
先确定呈现形态,再选择技术路径
先决定用户应该看到什么、能控制什么。然后选择符合应用情况的集成方式。Spatius 文档列出了多种路径——包括 Direct Mode、LiveKit Agents、Agora Convo AI 和 Backend Mode——而不是把单一路线视作通用选择。请在官方指南中比较集成选项。
对于产品设计师和产品经理,重要的决定通常是:
- **谁来启动互动?**用户本人、一个有意识的行动号召,还是一个经过清楚说明的产品事件?
- **数字人说话时,用户还能看到什么?**任务本身、文字记录、进度状态,还是下一步操作?
- **用户如何改变方向?**暂停、打断、使用文本、关闭界面,或请求帮助。
- **说明结束后会发生什么?**继续设置、执行操作、练习另一个场景,或转交给人工。
技术实现应支持这些选择,而不是反过来决定它们。
简单的位置决策流程
使用以下顺序,将宽泛的想法收敛为可测试的上线方案:
1. 映射一个客户时刻
选择一个目标和摩擦点都明确的工作流阶段。不要从主页数字人或全局助手开始。
2. 写下用户的下一步操作
定义用户在互动后应能完成什么。例如:完成一项配置、选择行动方案、提交请求,或开始一个练习场景。
3. 选择最轻量、但足够有用的界面
在投入全屏体验前,先使用内嵌提示、抽屉或步骤级面板。更大的呈现方式应由任务本身证明其必要性,而不是由数字人的新鲜感决定。
4. 在上线前设计退出路径
每个数字人体验都需要清晰可见的关闭控件,以及另一种继续任务的方法。视产品情况,考虑文本引导、标准产品导航,或支持 / 人工交接路径。
5. 为工作流埋点,而不仅是为数字人埋点
跟踪用户是否打开体验、到达预期的下一步、放弃工作流、使用替代路径或请求帮助。这样团队才能了解该位置是否真正解决了问题。
设计能够保护用户注意力的控制方式
数字人界面应让人感到有意设计,而不是有侵入感。至少应让以下控制和状态清晰、可预期:
| 控制或状态 | 为什么重要 |
|---|---|
| 清晰的启动点 | 在音频或动作开始前,用户就知道数字人会提供什么帮助。 |
| 暂停或打断 | 当用户已经得到答案,或需要继续前进时,可以停止回复。 |
| 文本或文字记录路径 | 用户可以阅读、搜索,或不依赖音频继续完成任务。 |
| 关闭并返回 | 用户可以离开,而不会丢失底层任务。 |
| 下一步操作链接 | 体验以有用的产品操作结束,而不是无边界的对话。 |
应将这些视作核心交互设计,而不是可选的细节打磨。数字人是企业产品中的呈现层;用户的工作始终更重要。
常见问题
AI 数字人应该出现在 SaaS 产品的每个页面吗?
通常不应该。先从一个具体任务开始:在这个任务中,可见的口头说明或练习互动,比标准 UI 更有用。全局常驻界面必须有清晰、可重复的用户价值作为依据。
AI 数字人与产品中的 AI 智能体是一回事吗?
不是。你的应用可以使用智能体、知识库、工具、权限、ASR、LLM 和 TTS 来决定应发生什么。根据其已文档化架构,Spatius 的作用是将数字人语音音频转换为动作数据,并通过 AvatarKit 在客户端渲染数字人。请阅读 文档地图。
数字人应该是全屏体验,还是侧边面板?
选择能让用户完成任务的最小呈现方式。全屏体验适合有意识的练习或引导式会话;当用户需要持续看到底层工作流时,面板或嵌入式步骤通常更合适。
如果用户不想使用数字人,应当怎么办?
用户应能够通过标准 UI 以及无障碍的文本或支持路径继续使用产品。数字人应是一个有意识的选项,而不是完成工作流的唯一途径。
如何选择集成方式?
先从体验和应用架构出发,再审查已文档化的 Direct Mode、LiveKit Agents、Agora Convo AI 和 Backend Mode 选项。团队应选择最适合自己现有系统的路径。
把数字人放在它有明确职责的地方
最强的 AI 数字人体验不会与产品界面竞争。它们在一个清楚的时刻出现,帮助用户取得进展,然后及时让出空间。从小范围开始:选择一个工作流、一种位置模式、一组控制方式,以及一个可衡量的下一步操作。
如果你正在评估实时数字人层如何进入产品体验,预约 Spatius 演示。