Retell AI 网页语音智能体可以与实时 AI 数字人出现在同一界面中,但目前公开的 Web SDK 并没有文档化一条可用于动作生成的、生产级连续助手 PCM 音频流。 因此,在称其为集成之前,Spatius 方案必须先获得受支持的助手音频交接,或使用应用合法拥有的最终 TTS 音频。
独立指南: Retell AI 与 Spatius 是独立产品。Spatius 与 Retell AI 不存在隶属、背书或官方集成合作关系,本文也不声称已经提供原生连接器。
最后核验:2026 年 9 月 24 日。
Retell 负责语音智能体,Spatius 负责视觉层
Retell 的网页部署文档介绍了基于 WebRTC 的浏览器语音通话,同时支持文字聊天和电话回拨。Retell 负责对话、语音流水线、工具、通话状态和音频播放。只有当应用能够提供用户实际听到的助手语音时,Spatius 才能增加本地渲染的数字人。
这个边界非常重要。纯电话智能体没有视觉界面,通常无需数字人。嵌入产品、自助终端、培训界面或引导式工作流中的 Retell 智能体可能适合可见角色,但“正在说话”的布尔状态不足以生成语音驱动的细致面部动作。
| 问题 | 当前公开证据 | 生产影响 |
|---|---|---|
| Retell 能否运行网页语音通话? | 可以 | 存在可见网页体验 |
| SDK 是否暴露 talking 状态? | 是 | 可用于 UI 状态,不足以生成细致动作 |
| 是否可输出音频 analyser 样本? | 可选开启 | 适合音量表和响应式可视化 |
| 这些样本是否为连续 PCM 帧? | 不是;SDK 源码明确称其为快照 | 不能把它们当成完整助手语句 |
| 是否有已文档化的 Spatius 原生连接器? | 没有 | 在确认音频路径前只能视为条件性架构 |
Retell Web SDK 实际暴露什么
Retell 的音频基础文档说明,前端 Web SDK 封装了浏览器音频处理。开源的 RetellWebClient可以启用 emitRawAudioSamples,为远端智能体音轨创建 analyser,并在动画帧期间发出 Float32Array 快照。源码明确指出这些数据不是连续 PCM 帧。
因此,这个事件适合制作波形、音量响应光效或“智能体正在说话”的指示器,但不足以证明可以生成准确的语音驱动动作。Analyser 窗口可能重叠、跳过时间,或者只是播放音频的抽样可视化,而不是用户听到的完整有序语音。
Spatius 需要按顺序接收经过批准的助手语音。音频指南将单声道、16 位有符号小端 PCM 作为标准音频表示,并明确区分正常 end-of-input 与打断。
Spatius 应该接在哪里
如果存在受支持的助手音频边界,系统可以保持模块化:
用户麦克风
↓
Retell 网页语音会话
├─ 对话、工具、通话状态和打断
└─ 受支持的最终助手音频交接
↓
应用协调器
├─ 权威播放路径
└─ 有序数字人音频路径
↓
Spatius Motion Server
↓ 动作数据
AvatarKit 客户端渲染
Retell 继续负责语音智能体,Spatius 只接收生成动作所需的助手语音并在本地渲染角色。仅为了驱动数字人,不需要向 Spatius 发送提示词、用户音频、私密转写、工具参数或内部通话状态。
三种可能的架构路径
1. 受支持的连续助手音频接口
这是首选路径。Retell 或其他获批准的接口在播放前或播放过程中提供真实、有序的助手音频。应用只转换一次音频,保留一个权威播放路径,并把同一轮语音发送给 Spatius Motion Server。
实施前,应请 Retell 确认受支持的接口、编码、采样率、声道数、帧顺序、响应边界、打断语义,以及是否允许将音频交给独立渲染器。
2. 应用拥有最终 TTS 音频
如果应用在播放前合法拥有最终语音字节,就可能把同一份语音同时交给用户和 Spatius。这取决于真实 Retell 架构与商业条款,不能仅根据标准 Web SDK 推断,也不应通过抓取私有 SDK 内部状态实现。
3. 基于 analyser 的响应式动画
公开的 analyser 快照可以驱动缩放、光效、空闲/说话状态或波形。这些视觉反馈可能有产品价值,但应明确标注为响应式可视化,而不是准确的语音驱动面部动作。
| 路径 | 动作保真度 | 集成可信度 | 建议 |
|---|---|---|---|
| 受支持的连续助手音频 | 可支持语音驱动动作 | 完成格式与生命周期验证后较高 | 首选 |
| 应用拥有最终 TTS 音频 | 可支持语音驱动动作 | 取决于实际架构与许可 | 谨慎评估 |
| SDK analyser 快照 | 只能实现粗粒度响应状态 | 已文档化用于可视化 | 不要称为完整口型同步 |
安全的概念验证步骤
- 先完成 Retell 网页通话,验证正常播放、结束和打断。
- 获得对连续助手音频来源的明确支持确认。
- 把 Retell 与 Spatius 的长期凭证保留在服务端,客户端只获得短期凭证。
- 给 Retell 响应、播放队列和 Spatius 输入分配同一个 turn ID。
- 只转换一次受支持的语音,并保持分片顺序与响应边界。
- 打断时同时停止播放并清空对应的 Spatius 轮次。
- 记录首段音频、首帧动作、丢失或迟到分片、重连和清理结果。
不要从把动作生成绑定到 analyser 事件开始。首先要证明应用能获得完整语音源,并且有权将其用于这个用途。
解决音频边界后,Spatius 提供什么
当应用能提供经过批准的助手语音后,Spatius Motion Server可以返回动作数据,AvatarKit 则在本地渲染数字人。这与通过 Retell 通话再发送一条云端渲染视频流不同。
本地渲染让产品控制数字人的位置、镜头、字幕、无障碍控制、工具结果 UI、加载状态和纯音频降级,也让不同层的指标保持可见:
| 指标 | Retell/应用层 | Spatius/数字人层 |
|---|---|---|
| 通话建立与首段助手音频 | 在此测量 | 不包含 |
| 智能体推理、工具与语音播放 | 在此测量 | 不包含 |
| 音频交接完整性 | 应用边界 | 必须验证的输入 |
| 音频到动作的传输 | 不包含 | 在此测量 |
| 客户端渲染稳定性 | 产品客户端 | 在目标设备测 AvatarKit |
| 打断正确性 | 共享产品事件 | 必须与播放同时停止 |
选择传输与恢复模型前,可以先阅读实时 AI 数字人集成模式。
什么时候适合组合 Retell 与 Spatius
同时满足以下条件时,再考虑这套组合:
- 体验有屏幕,而且可见角色能改善任务流程;
- Retell 仍是团队希望保留的语音智能体平台;
- 已经存在受支持的完整助手音频路径;
- 产品希望本地渲染数字人,而不是接收成品远端视频流;
- 团队能够协调两个服务的打断与恢复。
如果体验主要是电话、唯一可用信号只是 analyser 快照,或团队希望一家供应商承担完整的智能体与数字人栈,就应继续保持纯语音或选择其他架构。
成本与采购判断
Retell 的语音智能体用量和组件费用应以其官方定价页为准。Spatius 和应用基础设施属于独立成本层,应使用 Spatius 定价分别比较。在没有列出 Retell 组件、数字人用量、并发和基础设施假设前,不应发布一个混合费率。
如果需要参考一个明确文档化输出音频事件的平台,可以对比 OpenAI Realtime API 数字人教程。
Retell AI 数字人常见问题
Retell AI 与 Spatius 有官方集成吗?
本文不声称有官方集成,只说明第三方数字人音频交接所需的条件,以及为什么必须获得受支持的完整助手音频流。
Retell 的 audio 事件可以直接发送给 Spatius 吗?
不能把它作为生产假设。公开 SDK 源码描述的是 analyser 快照,而不是覆盖完整助手语句的连续 PCM 帧。
Talking 状态可以驱动口型同步吗?
它可以切换空闲和说话状态,但不包含准确语音驱动面部动作所需的信息。
Spatius 会替代 Retell AI 吗?
不会。Retell 继续负责语音智能体,Spatius 只使用经过批准的助手语音生成动作并在本地渲染数字人。
开发前应该向 Retell 确认什么?
确认受支持的助手音频接口、格式与顺序保证、响应与打断语义,以及是否允许把音频交给独立渲染器。
承诺数字人之前,先验证音频边界
准确的结论是有条件可行:Retell 可以继续承担智能体,Spatius 可以成为视觉层,但应用必须先拥有受支持的完整助手音频路径。证明这个边界之前,不应把体验描述成已经完成集成。
带上你的 Retell 网页架构和当前可用音频接口。我们可以协助判断能否在不依赖未文档化 SDK 内部状态的前提下生成同步的 Spatius 动作。 预约演示, or ,或查看 Spatius 定价.。