**Beyond Presence 更适合需要云端生成 Avatar 视频,或希望购买更完整托管式对话智能体的产品。Spatius 则更适合已经拥有智能体、希望直接在 Web 或原生客户端渲染 Avatar 的团队。**因此采购决策不只是比较 Avatar 外观,而是决定视觉层应该交付完整视频,还是紧凑的动作数据。
最后核验:2026 年 9 月 21 日。价格、Credits、套餐限制、产品名称和部署选项可能变化,采购前请重新确认。
快速结论:Beyond Presence 还是 Spatius?
Beyond Presence 把产品定位为实时对话式 Avatar,而不是预录的讲解视频。Speech-to-Video API 把现有智能体的音频转成同步 Avatar 媒体,Managed Agents 则接管更多对话系统。Spatius 的边界更窄:Motion Server 把 Avatar 语音转成动作数据,AvatarKit 在客户端本地渲染。
| 决策项 | Beyond Presence Speech-to-Video | Beyond Presence Managed Agents | Spatius |
|---|---|---|---|
| 产品边界 | 云端 Speech-to-Video 层 | 托管式对话视频系统 | 客户端渲染 Avatar 层 |
| 现有语音智能体 | 保留 | 可以替代更多组件 | 保留 |
| STT、LLM、TTS、工具 | 由你的技术栈负责 | 更多组件可由供应商托管 | 由你的技术栈负责 |
| 视觉交付方式 | 同步媒体轨道 | 托管式 Avatar 视频体验 | 动作数据;AvatarKit 本地渲染 |
| 已公开集成面 | LiveKit Python/Node.js 插件与 Pipecat 路线 | 托管链接、iframe、API 或 Embed | Web、iOS、Android 和 Flutter AvatarKit 客户端 |
| 已公开网络数据 | 本文核验页面未公布可直接比较的数据 | 本文核验页面未公布可直接比较的数据 | 约 10–15 KB/s 动作数据 |
| 最适合 | 需要云端 Avatar 视频的现有智能体 | 希望购买更大托管系统的团队 | 需要原生、可替换视觉层的现有智能体 |
第一层比较是 Speech-to-Video 与 Managed Agents;对产品团队更重要的第二层比较,则是云端视频渲染与客户端动作渲染。这个选择会改变网络流量、客户端责任、部署范围、可观测性、单位经济,以及生产事故最终由谁负责。
路线 A:给现有智能体加入 Speech-to-Video
如果产品已经有可用的语音识别、推理、工具、语音合成、权限和分析系统,应优先评估 Speech-to-Video。Beyond Presence 接收最终生成的音频,并发布同步 Avatar 输出。
官方 LiveKit Beyond Presence 插件支持 Python 和 Node.js。开发者创建普通的 LiveKit AgentSession,把 Beyond Presence Avatar ID 传给 AvatarSession,在房间中启动 Avatar,然后再启动智能体 Session。LiveKit 会把智能体音频路由给 Avatar Worker;Worker 作为独立参与者加入并发布同步媒体轨道。
更底层的 Session API接受 Avatar ID、LiveKit URL 和 Token;Beyond Presence 文档建议优先使用 LiveKit 插件,而不是直接调用该 Endpoint。对于偏好 Frame 管线的团队,Pipecat 是对应路线。
你的模型、工具、审核、RAG 和分析系统不需要迁移,但团队仍需负责打断、重试、Token 过期、参与者映射和 Session 清理。
路线 B:购买完整对话视频智能体
Managed Agents 面向不希望自行组装每个对话组件的团队。Beyond Presence 文档列出了可配置指令、知识、品牌、自定义 LLM、声音克隆、Transcript、Vision and Perception,以及网站内嵌。具体功能权限取决于套餐。供应商的 AI Agent 技术栈指南说明了它如何区分托管路线与可组合路线。
这条路线可以减少组装工作,但应确认托管产品能否复现你已有的模型路由、工具策略、数据控制、分析和人工升级逻辑。测试必须覆盖带真实工具与故障状态的完整业务流程,而不只是托管演示。
Beyond Presence 与 Spatius 的架构有何不同
两种产品都可以接收同一段上游 TTS 音频,但最终交付完全不同的输出。
**Beyond Presence Speech-to-Video 路径:**你的智能体生成语音 → LiveKit 把音频路由给 Beyond Presence Avatar Worker → Worker 作为独立参与者加入房间 → 向用户发布同步 Avatar 媒体轨道。LiveKit 官方插件文档展示的正是这种独立 AvatarSession 与参与者模型。
**Spatius 路径:**你的智能体生成 Avatar 语音 → Spatius Motion Server 返回口型动作数据 → AvatarKit 播放同步音频,并在应用中渲染 Avatar。Spatius 架构文档公开的动作数据流量约为 10–15 KB/s,并明确说明无需流式传输已经完成渲染的 Avatar 视频。
这不是一个小的实现细节。Beyond Presence 把音频转换成供应商渲染的媒体流;Spatius 把云端动作推理与最终像素分离,由终端设备完成渲染。
Spatius 的技术优势在哪里
1. 更低的已公开网络负载
Spatius 公开的动作数据流量约为 10–15 KB/s,因为它不传输完整视频帧。本文核验的 Beyond Presence 产品页和集成页没有公布可直接比较的码率,因此不能虚构视频流量数字。采购团队应在同一分辨率、帧率、Codec、Region 和网络下实测两种产品。
对于移动应用、Kiosk、共享 Wi-Fi 或持续 Avatar 视频会明显占用带宽预算的环境,这种架构优势最清晰。
2. 覆盖更多原生客户端类型
AvatarKit 支持 Web、iOS、Android 和 Flutter,最终 Avatar 直接在客户端内部渲染。产品团队因此可以构建原生移动端或嵌入式体验,而不是把 Avatar 当作远程视频窗口。
这也有真实代价:客户端需要下载 Avatar 资产,并具备足够的 GPU、内存和散热能力。Spatius POC 必须测试最低配置目标设备,而不是只在开发者电脑上测试。
3. 更窄、可独立替换的产品边界
Spatius 不替代 ASR、LLM、TTS、工具、RAG、权限或对话策略,因此视觉层可以独立评估和替换。Beyond Presence Speech-to-Video 同样提供可组合路线,而 Managed Agents 则有意接管更多组件。
当现有智能体已经是核心基础设施,而团队只需要 Avatar 渲染、并不想再引入一套 Agent Control Plane 时,Spatius 的优势最明确。
4. 不持续依赖云端生成最终像素
本地渲染把 Avatar 最终画面生成与持续云端视频渲染分离,有利于交付成本和客户端呈现控制,但这不代表 Spatius 在所有场景都更好。如果需求明确是供应商渲染的视频、Beyond Presence 提供的 Avatar 形式,或完整托管式智能体,Beyond Presence 更合适。
Beyond Presence 定价:同一套餐包含两套分钟数
当前定价页列出 Free、Starter、Growth、Scale 和 Enterprise,月费分别显示为 $0、$49、$149、$349 与定制报价。页面中的超额用量价格使用欧元显示,因此采购时不能把全部数字默认为同一币种。
| 套餐 | Speech-to-Video 包含量 | Managed Agent 包含量 | S2V 超额 | Managed 超额 | 并发 |
|---|---|---|---|---|---|
| Free | 40 分钟 | 20 分钟 | — | — | 1 |
| Starter | 280 分钟 | 140 分钟 | €0.175/分钟 | €0.35/分钟 | 10 |
| Growth | 1,490 分钟 | 745 分钟 | €0.10/分钟 | €0.20/分钟 | 25 |
| Scale | 4,000 分钟 | 2,000 分钟 | €0.0875/分钟 | €0.175/分钟 | 50 |
| Enterprise | 定制 | 定制 | 定制 | 定制 | 定制 |
这个比例反映了所有权差异:Speech-to-Video 每分钟消耗 50 credits,完整对话视频智能体每分钟消耗 100。Free 当前把单次 Session 限制为 3 分钟,付费套餐显示为不限时长。Enterprise 则加入合同层面的部署与治理选项,包括隔离或本地部署、SLA、零数据保留和集成支持。
选择 Speech-to-Video 时,应把外部语音智能体服务单独计费;选择 Managed Agents 时,则要确认 LLM、语音、RAG、存储和超额成本具体包含哪些内容。Avatar API 定价指南提供了中立的成本核算方法。
用同一套 POC 比较两种架构
使用相同 TTS 音频、智能体逻辑、Region、对话脚本和网络条件。记录 Avatar 启动时间、首次可见口型、Lip-sync 漂移、打断行为、弱网降级、重连、客户端 CPU/GPU、整段 Session 流量、最长 Session、峰值并发,以及最终会上线的 Stock 或 Custom Avatar。
这次比较还必须回答五个所有权问题:轮次检测、模型选择、工具执行、对话记录和用户可见故障恢复分别由谁负责?成本也要统一口径。Beyond Presence Speech-to-Video 仍需要外部语音智能体;Spatius 同样把 Avatar 层与 ASR、LLM、TTS 分开计费。Spatius LiveKit 集成指南展示了如何在现有智能体架构中保持这种客户端渲染边界。
Beyond Presence AI 常见问题
Beyond Presence Speech-to-Video 是什么?
它是面向现有语音智能体的 audio-to-avatar 层。你的技术栈生成语音,Beyond Presence 把音频转成同步 Avatar 视频。
Managed Agents 额外提供什么?
Managed Agents 加入更多对话管线和部署体验,包括可配置智能体行为,以及内嵌或托管式交互路径。具体能力需要确认套餐权限。
Beyond Presence 支持 LiveKit 吗?
支持。LiveKit 提供官方 Python 与 Node.js 插件路径,Beyond Presence 也为 LiveKit 传输暴露了底层 Session API。
Beyond Presence 哪种产品更便宜?
Speech-to-Video 消耗的 Beyond Presence credits 是托管产品的一半,但你的独立 STT、LLM、TTS、传输和工程成本仍然存在。应比较总成本,而不是只比较供应商分钟价。
Spatius 与 Beyond Presence 有什么不同?
Beyond Presence 交付供应商渲染的 Avatar 媒体,并提供托管式对话智能体;Spatius 返回紧凑的动作数据,由 AvatarKit 在 Web、iOS、Android 或 Flutter 客户端本地渲染,同时客户保留周边 AI 技术栈。
选择产品应该拥有的输出
如果云端生成 Avatar 视频以及 LiveKit 或 Pipecat 集成符合客户端体验,应选择 Beyond Presence Speech-to-Video;如果减少组装工作的价值高于转移更多对话系统所有权,应选择 Managed Agents;如果现有智能体必须保持不变,并且产品需要紧凑动作数据、本地渲染以及 Web、iOS、Android 或 Flutter 客户端,应评估 Spatius。
带上你的现有智能体、目标设备和并发需求,我们可以帮助你把客户端渲染架构与云端视频路线放进同一个 POC。 预约演示, or ,或查看 Spatius 定价.。