跳至正文

入门级芯片上的 AI 数字人:端侧渲染如何在低成本硬件上运行

入门级硬件是大多数 AI 数字人部署最容易被低估的限制。很多平台默认你有稳定高速网络、可靠云端 GPU,以及足够的预算去承受持续的视频推流成本。理论上很干净:服务器渲染数字人,设备接收视频流,用户看到画面。但一旦离开理想环境,这个假设就会变得脆弱。

问题通常出现在真实部署现场:零售门店的共享 WiFi、仓库里的蜂窝网络、批量采购成本只有几十美元的 kiosk 设备。传统云端渲染数字人每路会话需要持续 1–2 MB/s 的视频带宽。在受限网络和预算硬件上,这就是体验崩坏的起点。

Spatius 采用了不同方法。它不是在云端渲染视频再推流,而是由 Motion Server 生成 Motion data(驱动参数)。Motion data 以 10–15 KB/s 传给客户端,客户端设备再用自身 GPU 在本地渲染 3DGS 数字人。没有视频流,也没有重型解码链路。

从“传视频”切换到“传 Motion data(驱动参数)”,正是 Spatius 能在入门级芯片上稳定运行的关键。


Why Entry-Level Hardware Can Handle This

Spatius 中实时 AI 数字人的 GPU 工作负载,和很多人想象的并不一样。设备端没有运行重型机器学习推理。Spatius Motion Server 在云端生成 Motion data(驱动参数)。客户端 SDK AvatarKit 接收 Motion data,并把它应用到设备上的 3DGS(3D Gaussian Splatting)数字人模型上。

设备端负责 3DGS 数字人的渲染。资源大小、帧率和所需 GPU 能力取决于生成的 Avatar 与目标设备;请对代表性硬件进行基准测试,不要假设统一的性能档位。

Spatius 可以在不配备独立 GPU 的入门级芯片上进行评估,但当前开发者文档没有定义统一的帧率保证或固定芯片矩阵。请使用 G88、S565、8189、RK3576 或其他目标硬件,结合计划采用的数字人与图形路径进行基准测试。


What “Entry-Level” Means in This Context

Spatius 面向的参考硬件包括:

嵌入式 / kiosk SoC — RK3576 这类芯片常见于商业 Android kiosk 硬件,可以作为测试目标。请在持续会话下验证 AvatarKit 的渲染管线、帧率、内存和热表现。

预算 Android 与 IoT 设备 — G88、S565 这类芯片代表全球 100–200 美元 Android 设备中的常见硬件等级。AvatarKit 可跨 Web、iOS、Android SDK 在这类设备上运行。

老旧硬件上的 Web 部署 — Web SDK 使用 WebGL / WebGPU,现代浏览器基本都支持。因此,即使是运行 Chrome 或 Safari 的旧桌面、旧笔记本,也能在没有独立 GPU 的情况下本地渲染数字人。

这些场景共同的关键点是:设备端零推理。AvatarKit 只做渲染和音频对齐。Spatius 云端生成的是小体积 Motion data(驱动参数),而不是视频。


The Bandwidth Equation

传统云端渲染数字人传输的是视频。标准质量下,每路会话需要持续 1–2 MB/s。20 台 kiosk 同时运行时,仅数字人视频就需要 20–40 MB/s 的稳定带宽。

Spatius 传输的是表情驱动数据:每路会话 10–15 KB/s。20 台 kiosk 合计只需要约 200–400 KB/s。这个量级对任何商业网络都很小,在 4G 蜂窝网络上也稳定,即使网络条件下降也仍然可用。

这不是配置层面的取舍,而是架构属性。压缩比来自“传紧凑 Motion data(驱动参数)”,而不是“传编码后的视频帧”。


How the Architecture Fits Together

Spatius 使用三层分离:

  1. AI Agent(客户自建) — 你构建并拥有完整语音 AI 栈:ASR(语音转文本)、LLM(语言模型)和 TTS(文本转语音)。Spatius 不提供这些组件。

  2. Avatar(Spatius) — 可由照片生成 3DGS 数字人;生成时间和资源大小取决于数字人与具体工作流。

  3. AvatarKit SDK(Spatius 核心产品) — 位于客户端设备上的渲染引擎,接收 Spatius Motion Server 输出的 Motion data(驱动参数),并让数字人与音频同步渲染。

数据流如下:

[你的 TTS 音频] → Spatius Motion Server → Motion data(驱动参数,10–15 KB/s)

                                                 AvatarKit(客户端 SDK)
                                                 本地渲染 3DGS 数字人

这个管线里的云端服务生成轻量 Motion data(驱动参数),而不是视频编码。与完整云端渲染相比,渲染成本大幅降低,虽然并非完全消失。视觉渲染由客户端完成,设备端没有推理成本。


SDK Integration

AvatarKit 支持三个平台:

PlatformDistributionRendering Engine
Webnpm: @spatius/avatarkitWebGL / WebGPU
iOSAvatarKit.xcframeworkMetal
AndroidGradle: ai.spatius:avatarkitVulkan

根据延迟和基础设施要求,有三种集成模式:

  • Direct Mode — 开发成本最低,适用于 Web/iOS/Android,中等延迟
  • LiveKit Plugin — 超低延迟,仅 Web,适合已使用 LiveKit Agents 的团队
  • Backend Mode — 超低延迟,完整传输控制,适用于 Web/iOS/Android

注意:iOS 测试需要实体设备,iOS 模拟器不支持 Metal 渲染。

Web、iOS、Android 和 Flutter 的完整代码示例可在 Voice Agent Demo repository 中查看。


Fallback Behavior

如果到 Spatius Motion Server 的 WebSocket 连接在 15 秒内失败,AvatarKit 会自动切换到 audio-only fallback mode。TTS 音频会继续播放,只有数字人动画暂停。这让弱网环境下的体验可以优雅降级,而不是完全中断。


Getting Started

Spatius playground 会在浏览器中运行 AvatarKit。数字人渲染发生在你的设备上,使用 WebGL/WebGPU,没有视频流。你可以在浏览器 Network 面板中验证:看到的是 Motion data(驱动参数),而不是 1–2 MB/s 的视频流。

如果需要具体设备测试,demo repositories 提供 iOS、Android 和 Flutter 客户端,可直接在实体硬件上运行。


来自 Spatius 团队:
“用轻量数据流替代沉重云端渲染,并在边缘设备上完成渲染”


延伸阅读

深入架构 → 端侧 AI 数字人与云端推流:2026 年架构、带宽与成本对比

真实部署场景 → 边缘部署中的 AI 数字人:在 Kiosk、零售设备和低带宽环境中运行实时数字人

提交平台前先测试 → 数字人 SDK Demo:选定平台前,如何测试实时 AI 数字人

完整平台格局 → Interactive Avatar:2026 年实时 AI 数字人完整指南

让你的智能体拥有一张会回应的脸。

开始构建