跳转到主要内容

48 含有标签「latency」

Posts tagged "latency" on TianPan.co.

查看所有标签

·tian

现在,推理速度已经快过你的数据库了

模型在请求延迟中所占的份额已经大幅下降。你自己的特征存储、身份验证和 Postgres 调用现在成了性能的长尾——而大多数 AI 架构甚至还没察觉到这一点。

insider
ai-infrastructure
performance
observability
+2
·tian

你的 LLM Span 在撒谎:APM 工具没告诉你的推理延迟真相

标准的 APM 工具将 LLM 调用视为一个不透明的 span —— 但 prefill、decode、缓存未命中和批处理位置都隐藏在这个耗时段中。本文将揭示你真正需要的追踪层面。

insider
llm
observability
opentelemetry
+2
·tian

首字延迟 (TTFT) 是你尚未监测的延迟 SLO

p50 和 p99 的总延迟忽略了一个决定你 AI 产品体验的关键指标:首字延迟 (TTFT)。本文将探讨为什么推理模型会让情况变得更糟、需要衡量哪些指标,以及如何通过路由策略来优化它。

llm-ops
observability
latency
streaming
+1
·tian

语音智能体并非带麦克风的聊天机器人:半双工税

语音智能体继承了人类的半双工协议,而非聊天的舒适感。轮换协商、插话处理以及真实的 200 ms 预算,决定了你的智能体听起来是专注还是诡异。

voice-ai
latency
agents
real-time
·tian

串行工具调用瀑布:Agent循环中隐藏的延迟税

Agent框架默认串行执行工具调用,即使这些调用在逻辑上相互独立,造成与N+1查询问题如出一辙的延迟级联。本文介绍如何识别并修复这一问题。

insider
ai-agents
performance
tool-use
+2
·tian

Agent 链中的截止时间传播:第三跳时你的 p95 SLO 发生了什么

用户可见的延迟约束在穿越多步 agent 管道时悄然消失。本文剖析这一结构性问题,分析主流框架的处理方式(并不理想),以及能真正解决问题的截止时间传播模式。

insider
agents
latency
slo
+2
·tian

智能体加载状态难题:为 45 秒的 UX 深渊进行设计

用户在 10 秒后就会放弃沉默的 UI,但现代智能体运行时间通常在 30 到 120 秒之间。这个差距是一个设计空间,目前大多数团队仍在使用加载动画来填充 —— 本文将介绍你应该构建的替代方案。

ai-agents
ux
product-design
latency
·tian

热路径与冷路径 AI:决定你 p99 延迟的架构决策

一个决策框架,用于确定哪些 AI 工作属于请求路径,哪些属于队列,以及在流量形态变化时如何跨越边界进行迁移。

ai-architecture
latency
async
llm
+1
·tian

没人调校的 max_tokens 旋钮:将输出截断作为成本杠杆

大多数团队为了避免生成中途截断而过度填充 max_tokens,并为此持续支付冗余的费用。根据真实的输出分布进行基于路由的校准,可以在不损失质量的情况下将输出 token 支出降低 20–40%。

insider
llm
cost-optimization
latency
+1
·tian

设计不拖垮延迟的 AI 安全层

串行安全检查会在响应到达用户之前叠加出数百毫秒的开销。本文介绍如何设计既能维持安全态势、又不破坏用户体验的护栏架构。

insider
guardrails
llm
production
+2
·tian

语音 AI 生产落地:构建 300ms 延迟预算

为什么即便模型声音听起来不错,语音 AI 依然让人感觉生硬?本文将探讨如何通过流式流水线架构、轮次检测策略和传输选择,将延迟控制在 300ms 以内。

insider
voice-ai
latency
streaming
+2
·tian

AI 流水线中的投机执行:通过押注未来降低延迟

大多数 LLM 流水线之所以是顺序执行纯属偶然。投机执行 —— 通过并行运行假设、预取工具调用以及同步生成候选输出 —— 可以将体感延迟降低 2–4 倍,但前提是你需要理解协调开销何时会抵消这些收益。

llm-inference
ai-agents
latency
performance
+1
显示第 37–48 篇,共 48 篇
上一页4 / 4