跳转到主要内容

48 含有标签「latency」

Posts tagged "latency" on TianPan.co.

查看所有标签

·tian

生产级智能体的 90 秒冷启动:当 LLM 不再是瓶颈时

生产级智能体在模型运行之前,通常需要 60 到 120 秒进行冷启动。解决方案不在于更快的 TTFT — 而在于将冷启动延迟视为一级 SLO,并通过预热池、快照/恢复、工具延迟加载以及 CI 门禁来进行优化。

insider
ai-agents
latency
infrastructure
+2
·tian

智能体管道中的并行陷阱:扇出为何让延迟更糟

拆分出并行子智能体看起来是显而易见的提速方案,但隐藏的协调开销——上下文合并、去重、错误聚合——会让 p99 延迟变得更糟,即便 p50 有所改善。

ai-engineering
agents
performance
latency
·tian

你的 LLM 网关缺少的长尾容错重试策略

将微服务默认的重试机制应用于 8 秒的 LLM 调用,会显著拉高 P99 延迟,在供应商故障期间白白消耗 Token,并掩盖一个用户可见的延迟悬崖,而网关仪表盘对此却毫无察觉。

llm
latency
gateway
reliability
·tian

多步 Agent 的延迟预算:为什么 P50 会说谎,而 P99 才是用户的真实感受

多步 Agent 在中位数延迟上看起来很快,但在尾部延迟上却让人感觉很慢。本文将探讨为什么系统组合会惩罚 P50 仪表板,以及如何设计符合用户实际体验的延迟预算。

insider
agents
latency
observability
+1
·tian

拒绝延迟税:为什么分层护栏会侵蚀你的 p95 延迟预算

分层安全流水线在长尾效应下会悄然使 p95 延迟和成本增加三倍。应将护栏视为一种受预算限制的资源,通过分层分类器、并行检查和诚实的延迟契约来进行管理。

llm-safety
guardrails
latency
observability
+1
·tian

下午 3 点和凌晨 3 点的同一个 Prompt 并不是同一个 Prompt:LLM 评估中的昼夜漂移

LLM 调用的行为取决于挂钟时间 —— 批次大小、缓存状态和路由层级会随着供应商负载而变化。凌晨 2 点运行的评估是在生产环境永远不会遇到的条件下进行校准的。这里有五个实践,可以缩小非高峰期评估与高峰期现实之间的差距。

insider
ai-engineering
llm-evals
llm-ops
+2
·tian

30 秒都去哪了:APM 无法察觉的 Agent 步骤内部延迟归因

传统的 APM 将 Agent 的一个步骤视为单一的粗粒度 Span,导致值班工程师只能靠猜。通过将其分解为七个阶段,区分首字延迟 (Prefill) 与解码 (Decode),并追踪关键路径而非总 Span 时间。

insider
observability
llm
agents
+2
·tian

评测环境的延迟谎言:为什么你的 p95 在生产环境中翻倍

评测套件测量的是在一台安静机器上针对热缓存进行的串行调用;生产环境则是另一回事。将延迟视为部署的属性,而非模型的属性,否则你的 p95 数据将会具有误导性。

llm-ops
evaluation
latency
observability
+1
·tian

Token 间抖动:你的 p95 仪表盘看不见的流式传输 UX 失败

首个 Token 响应时间 (TTFT) 和总生成时间都符合 SLO,但用户却抱怨 AI 在响应过程中『卡住了』。你的仪表盘所隐藏的指标是相邻 Token 之间的间隔 —— 而平滑这一间隔是一个 UX 问题,而非吞吐量问题。

ai-engineering
streaming
latency
observability
+1
·tian

为什么你的语音智能体显得很没礼貌:话轮转换是你从未记录过的延迟预算

为什么语音智能体显得很没礼貌:解析四阶段延迟预算、混合话轮检测、全双工音频以及保护状态的抢占协议。

ai-engineering
voice-ai
latency
real-time
·tian

GPU 饥饿:某个租户的推理提示词如何导致你的共享推理端点停滞

一个推理提示词就能拖慢共享推理端点上所有其他请求的 p99 延迟。本文将探讨为什么连续批处理和 KV 缓存钉选会导致队头阻塞,分析鲜有人关注的诊断信号,并介绍四种缓解方案 —— 分块预填充、优先级调度、每租户 Token 上限以及请求类别隔离 —— 按其侵入性由低到高排序。

insider
llm-inference
gpu
multi-tenant
+2
·tian

你的 P99 正在受陌生人流量的影响:托管 LLM 推理中的“吵闹邻居税”

托管 LLM API 在你从未见过的租户之间共享 GPU、批处理和 KV 缓存预算,因此你的尾部延迟会随陌生人的流量而波动。本文将介绍如何证明这一点、如何缓解,以及何时决定转向专用算力。

llm
infrastructure
observability
latency
+1
显示第 25–36 篇,共 48 篇