实时 AI 数字人没有一个适用于所有产品的“最低带宽”数字。需求取决于架构:是否传输成品视频、音频与动作数据,资源是否预加载,渲染发生在云端还是本地,以及应用本身还在传输什么。
核心结论
- 先确认架构和数据类型,再讨论 Mbps。
- 将持续会话流量与首次资源下载分开计算。
- 同时测试吞吐、延迟、抖动、丢包和网络切换。
- 带宽充足不等于体验稳定,恢复策略同样重要。
从架构开始
云端视频流通常会持续传输压缩视频与音频;本地渲染路径可能主要传输音频、动作数据和控制消息,并在开始时加载模型或角色资源。两种路径的峰值、持续流量与设备负载不同,不能直接套用同一数字。
建立简单的带宽预算
把流量拆成四类:
- 首次加载的应用与数字人资源;
- 上行用户音频或控制消息;
- 下行数字人语音、动作或视频;
- 应用自身的检索、工具、分析与其他资源。
分别记录平均速率、峰值、会话时长和是否可缓存。不要只看浏览器总流量,否则无法判断优化哪一层。
测量而不是复制供应商数字
使用目标设备和真实网络条件运行固定脚本。Chrome DevTools 的网络限速适合初步复现,但还要在真实移动网络、企业 VPN 和 Wi-Fi 切换中验证。
对 RTC 链路使用 getStats记录丢包、抖动和可用码率;对 WebSocket 链路则记录消息速率、缓冲量、重连与事件延迟。
带宽不等于韧性
即使平均吞吐充足,短暂抖动、丢包、后台标签页或网络切换仍可能破坏体验。产品需要决定可以缓冲多久、何时降级为纯音频或文本,以及重连后是否继续、重播还是请求用户确认。
谨慎估算月度传输量
月度流量约等于单会话平均传输量乘以会话数量,并增加首次资源下载、缓存未命中、重试与监控余量。区域出口费用和 CDN 规则也可能影响实际成本。不要把实验室中的单次会话直接线性外推为最终账单。
测量 Spatius 流量
Spatius 的 Motion Server 接收数字人语音音频并返回动作数据,AvatarKit 在客户端本地渲染;它不是向客户端发送成品视频。Direct Mode 文档说明了该路径。应用仍需把自身的 ASR、Agent、TTS、工具和资源流量纳入预算。
不同架构的差异可继续参考本地渲染与云端数字人架构。
常见问题
可以公开一个统一的最低带宽吗?
只有在明确集成路径、资源状态、设备、网络假设和可接受降级行为后才有意义。
数字人资源应该计入吗?
应该,但要与持续会话流量分开,并考虑 CDN、缓存、版本更新和首次访问。