·tian
语音代理 SLO 定义为首个音频时间,而你的服务商则以首个 Token 时间衡量
基于 LLM 的首个 Token 时间(TTFT)构建的语音代理延迟 SLO 看起来是绿色的,但用户却听到了 600 毫秒的间隙。该 SLO 存在于错误的层级;用户的耳朵才是真正关键的边界。
insider
voice-ai
llm-ops
observability
+2·tian
为什么你的语音智能体显得很没礼貌:话轮转换是你从未记录过的延迟预算
为什么语音智能体显得很没礼貌:解析四阶段延迟预算、混合话轮检测、全双工音频以及保护状态的抢占协议。
ai-engineering
voice-ai
latency
real-time
·tian
语音智能体并非带麦克风的聊天机器人:半双工税
语音智能体继承了人类的半双工协议,而非聊天的舒适感。轮换协商、插话处理以及真实的 200 ms 预算,决定了你的智能体听起来是专注还是诡异。
voice-ai
latency
agents
real-time
·tian
语音 AI 生产落地:构建 300ms 延迟预算
为什么即便模型声音听起来不错,语音 AI 依然让人感觉生硬?本文将探讨如何通过流式流水线架构、轮次检测策略和传输选择,将延迟控制在 300ms 以内。
insider
voice-ai
latency
streaming
+2