Avatar 被观看并不证明它带来了帮助。用户可能因为新鲜而打开它,在做别的事时让它继续播放,或因为没有清晰的继续路径而观看。以上结果都无法告诉产品团队,这个体验是否值得扩大。
真正有用的问题更具体:Avatar 是否帮助合适的用户,在某一个明确的产品工作流中完成、理解、决定或恢复?
这个问题也能让度量的所有权保持清晰。在 Spatius 实现中,你的应用拥有工作流、用户上下文、权限、Agent 逻辑、分析和产品事件。Spatius 会将 Avatar 语音音频转换为实时动作数据,并由 AvatarKit 在本地客户端渲染。它不会替代你的分析系统,也不会决定什么才算你的产品成功。请参阅Spatius 开发者文档地图,了解当前系统边界。
核心要点
- 在定义仪表盘之前,先定义一个产品时刻和一个用户决策。
- 跟踪完整路径:资格、开始、控件、下一步操作、恢复和反馈,而不只是观看时长。
- 将打断、退出和切换到文本视为有用信号;它们并不自动意味着失败。
- 做同类比较。用户角色、任务复杂度和进入点比一个混合平均值更重要。
- 用度量来决定是优化、收窄、扩大还是移除 Avatar 体验。在自有产品数据支持前,不要承诺 ROI。
从需要做出的产品决策开始
“衡量参与度”过于模糊,无法指导产品团队。在添加事件之前,先写清楚证据要支持什么决策。
例如:
- 是否应让可选的 Avatar 引导式设置说明继续留在新手引导流程中?
- 角色扮演体验是否为销售人员提供了练习某一特定场景的有效方式?
- 复杂的支持指引路径应提供 Avatar、文本说明,还是直接人工交接?
每个问题都意味着不同的成功条件。当用户以更少的绕路进入下一个设置步骤时,产品引导可能是有用的。当参与者完成指定场景并认为反馈易于理解时,练习工作流可能是有用的。当用户完成一个安全的下一步操作,或抵达清晰标记的升级路径时,支持流程可能是有用的。
在埋点之前,用平实的语言写下初始假设。例如:
“对于新受邀的工作区管理员,在权限步骤提供可选的 Avatar 说明,可能帮助他们理解该选择并进入下一个设置操作。我们将它与现有帮助路径进行比较,并审阅控件、完成、恢复和反馈。”
这并不是声称 Avatar 会改善某项指标,而是一条具有明确受众、位置和替代方案、可供检验的产品陈述。
使用跟随用户旅程的度量模型
单个数字很少能解释一段体验。更有用的框架,是从用户是否符合资格一直跟到下一项产品操作。
| 度量层 | 要问什么 | 示例信号 | 它能告诉你什么 |
|---|---|---|---|
| 机会 | 合适的用户是否遇到了该选项? | 符合资格的用户、展示的进入点、功能可用性 | 体验是否出现在预期时刻。 |
| 选择 | 用户是否主动启动它? | 已打开、已开始、已选择 Avatar 路径 | 进入点和预期是否足够清晰,值得用户尝试。 |
| 控制 | 用户能否引导或离开它? | 暂停、打断、跳过、切换到文本、关闭 | 控件是否易被发现,并且适配工作流。 |
| 任务进展 | 用户是否采取了预期的下一步操作? | 完成设置步骤、启动场景、记录交接 | 该体验是否适配产品中的真实工作。 |
| 恢复 | 路径无法继续时发生了什么? | 显示错误、选择回退、请求交接 | 产品在哪些地方需要更清楚的状态或另一条路径。 |
| 反馈 | 用户是否理解价值与边界? | 可选的有帮助度反馈、带标签的支持主题 | 为什么数字会呈现当前的样子。 |
不要假设更长的互动就更好。一段简短说明后采取正确的产品操作,可能比冗长的 Avatar 对话更有用。同样,一次打断可能意味着用户迅速理解了答案,而不是体验失败。
对团队能够采取行动的产品事件做埋点
产品分析应描述用户体验,而不是不加区分地收集每一句话的日志。先从与工作流关联的一组事件开始,只保留团队作出产品决策所需的属性。
一套实用的起步事件分类
以下事件只是示例,不是 Spatius 的强制 schema。请按现有分析命名规范为它们命名。
| 事件 | 何时记录 | 有用属性 | 不要把它当作 |
|---|---|---|---|
avatar_eligible | 用户到达可提供该体验的产品时刻。 | 体验 ID、进入界面、非敏感用户分群 | 用户兴趣的替代指标。 |
avatar_opened | 用户选择打开体验。 | 进入点、工作流阶段 | 说明已经带来帮助的证明。 |
avatar_started | 定义好的 Avatar 回复或场景开始。 | 场景 ID、回复类型 | 任务完成的衡量方式。 |
avatar_interrupted | 用户有意停止、打断或重定向当前回复。 | 控件类型、工作流阶段 | 默认的失败。 |
avatar_mode_switched | 用户切换至文本、音频或其他已批准的呈现路径。 | 原模式、目标模式、原因(仅在用户明确提供时) | 默认的负面结果。 |
workflow_next_action | 用户完成预定义的下一项产品操作。 | 操作 ID、体验 ID、工作流阶段 | 跨不相关流程的通用转化指标。 |
avatar_recovery_selected | 用户选择回退或人工交接选项。 | 恢复类型、可见错误状态 | 对服务商可靠性的声明。 |
avatar_feedback_submitted | 用户自愿提交反馈。 | 仅在产品使用时记录的结构化评分、可选主题 | 每位用户的代表性样本。 |
将事实来源保留在拥有用户旅程的应用中。Avatar 动作层不是你的分析数据仓库。只有在团队有意识地设计并审阅这种关联的前提下,实现才可以将产品事件与 Avatar 会话相关联。
捕捉状态变化,而不只是媒体行为
对用户重要的变化才需要埋点:Avatar 出现、用户决定开始、回复被打断、用户采取下一步操作,或需要回退。这些信号将呈现层与产品工作流连接起来。
例如,当前 Direct Mode 文档描述了客户端 AvatarKit 将 Avatar 语音音频发送给 Motion Server、接收动作数据并在本地渲染。你的产品仍然负责判断回复是否相关、用户是否完成了工作流,以及支持交接是否适当。
做同类比较
进入 Avatar 体验的用户可能有非常不同的需求。一位用户可能正在进行首次设置任务;另一位可能已经熟悉工作流,只想更快完成。把这些用户混成一个平均值,可能得出误导性的结论。
请按照会塑造体验的条件对分析进行分群:
- **工作流阶段:**首次设置、重复任务、故障排查或练习。
- **用户角色:**管理员、操作员、经理或最终用户可能有不同的目标和权限。
- **进入点:**主动建议、帮助面板、明确的“练习”操作或支持路径。
- **体验版本:**脚本、控件设计、知识范围和回退行为。
- **任务复杂度:**简单步骤、多步骤配置,或需要工具或人工决策的工作流。
如果将 Avatar 队列与基线进行比较,尽量保证比较公平。尽可能使用相同的工作流、时间段和用户资格。当你的产品、流量和治理实践支持时,受控实验会有帮助。否则,应将证据描述为方向性证据,而非因果关系。
正确解读打断与恢复信号
一些产品团队将打断视为负面指标。这可能把设计推向错误方向:用户可能为了看起来“有参与感”而感到被迫听完。
相反,应结合上下文解读控件:
| 信号 | 可能意味着 | 下一步应检查什么 |
|---|---|---|
| 频繁的早期停止 | 开场太长、用户已知道答案,或控件只是很容易使用。 | 第一句话、进入点预期,以及停止后的下一步操作。 |
| 切换至文本 | 用户偏好浏览、需要可复制的答案,或处于嘈杂环境。 | 文本是否同样有用且易于到达。 |
| 反复重启 | 用户可能在寻求澄清,或回复路径缺少有用的后续操作。 | 提示范围、可用选项和错误状态。 |
| 请求人工交接 | 工作流可能需要专家、授权或因个案而异的决定。 | 交接时机、路由,以及原因是否可见。 |
| 回复结束后没有操作 | 说明可能没有指向清晰的下一步。 | CTA 文案、UI 焦点,以及任务是否确实可操作。 |
目标不是让打断消失,而是给用户一种优雅表达意图的方式,并帮助产品做出适当回应。
将量化信号与定性证据结合
数字告诉你去哪里看;定性证据通常能解释为什么。在试点期间,审阅一小组经过批准、且你自己的产品可以使用的材料,例如可选反馈、支持主题、可用性测试或观察到的任务演练。
提出聚焦问题:
- 用户在启动前是否理解 Avatar 能提供什么帮助?
- 他们是否知道如何停止、跳过或选择文本?
- 回复是否帮助他们决定下一步做什么?
- 是否有某个时刻,他们期待人工、操作或来源,但体验没有提供?
- Avatar 是否匹配工作流的语调和严肃程度?
不要把一条热情评论或一条投诉当成完整事实。请将其与用户实际在工作流中走过的路径结合起来。
建立审阅循环,而不是虚荣仪表盘
只有当度量促成产品决策时,它才有价值。与产品、工程、设计、面向客户的团队及相关治理职能一起建立审阅节奏,并明确负责人。
每次审阅时,回答以下问题:
- 目标用户是否理解为何向他们提供该体验?
- 他们是否保有控制权,并进入了合适的下一步操作或恢复路径?
- 保留当前设计的最有力证据是什么?
- 哪些证据支持收窄、修改或移除它?
- 下一版本应该测试哪一项改变?
这能防止团队仅因一个功能在技术上能运行或视觉上令人印象深刻,就将其扩大。最好的下一步可能是修改进入点、缩短脚本、让控件更可见、改善交接路径、缩小受众——或干脆不在该工作流中使用 Avatar。
常见问题
最重要的 AI Avatar 指标是什么?
没有通用指标。请从你正在测试的特定产品时刻的结果开始:清晰的下一步操作、完成的练习场景、合适的恢复,或更好理解的决定。将结果与控件和反馈结合,以判断用户是否仍保有控制权。
观看时长是衡量 Avatar 成功的好指标吗?
单独看不是。观看更久可能代表兴趣、困惑、缺少控件,或回复不必要地太长。只能将它与工作流进展、打断行为和定性反馈一起使用。
谁应负责 Avatar 分析?
拥有用户工作流的应用团队应拥有分析计划和产品事件。在文档所述的 Spatius 架构中,Spatius 提供动作层;你的应用拥有对话逻辑、工作流和产品度量。
打断应算作失败吗?
不应。它是用户意图的信号。审阅它发生的时间、用户下一步做了什么,以及界面是否给了他们合适的前进方式。
小规模试点后可以宣称 ROI 吗?
不能。试点可以为产品决策提供证据,但不会自动建立一项普遍的 ROI 声明。在对外传达任何业务结果之前,请使用自有、已批准的方法论和证据。
衡量下一个决策,而非新鲜感
只有当 AI Avatar 在明确时刻帮助明确用户、并且团队能解释原因时,它才会成为产品功能。衡量用户在那个时刻做出的选择,而不只是屏幕上是否有一张会动的脸。
如果你正在规划实时 Avatar 试点,并希望为产品评估合适的集成边界,可申请 Spatius 演示。