聊天机器人通常处理文本请求和文本回应;视频智能体还要处理语音、轮次判断、媒体传输、视觉呈现和重连。
核心判断
聊天机器人通常处理文本请求和文本回应;视频智能体还要处理语音、轮次判断、媒体传输、视觉呈现和重连。
架构与体验边界
将智能体、工具、TTS、传输和数字人渲染拆开看,才能判断供应商的产品边界是否适合现有 SaaS 架构。 Spatius 的 Docs Map 说明:Motion Server 接收数字人语音音频并返回动作数据,AvatarKit 在客户端渲染。应用继续负责 ASR、LLM、TTS、检索、工具、权限与会话策略。
试点与衡量
不要只测首句回应。打断、慢工具调用、断网和人工接管会决定真实体验。 试点必须保留可用的文本路径、清晰的等待状态和人工接管方式。对于实时媒体场景,可参考 LiveKit Agents 的参与者和会话生命周期模型。