跳转到主要内容

48 含有标签「latency」

Posts tagged "latency" on TianPan.co.

查看所有标签

·tian

你的 Agent 链路中无人分配的延迟预算

Agent 的 SLO 通常设置在边界处,而内部却缺乏预算分配,导致没人能归因是哪一跳搞砸了 P99。你需要分配逐跳预算,在 Span 级别进行追踪,并约束那个呈乘性而非加性增长的尾部延迟。

ai-agents
observability
latency
distributed-systems
+1
·tian

P99 是产品决策,而非基建决策

你的尾部延迟目标并不是基建团队单纯优化出的一个数字 —— 这个数字本身就是一个产品选择。本文探讨了 UX 交互设计与延迟预算如何相互权衡,以及为什么 P99 应该出现在设计评审中。

insider
latency
ux
llm-inference
+2
·tian

护栏税:当安全分类器让你的延迟和账单翻倍时

外挂式安全分类器堆叠在关键路径中,使延迟增加三倍并推高了你的推理账单。本文介绍如何根据爆炸半径调整护栏规模,并采用并发而非串行的方式运行它们。

llm
ai-safety
guardrails
latency
+1
·tian

思维的 p99:当模型决定你的请求耗时多久

推理模型使响应时间成为问题难度的函数,导致 p99 延迟激增至 p50 的 3-5 倍,超时调整也演变为成本问题。通过针对更小模型的对冲请求、按路由设置的推理开销上限以及感知难度的 SLO,可以将尾部延迟控制在合理范围内。

insider
llm
inference
sre
+2
·tian

当往返时延成为 Bug :你一直在忽略的端侧推理必要性

延迟、成本和隐私的考量正在悄然转向,反对云端往返 —— 以及决定每个查询实际运行位置的单次请求路由模式。

edge-inference
on-device-ai
latency
ai-engineering
+1
·tian

GPU 调度是一个排队问题,而不是资源配置问题

LLM 终端响应慢通常是排队失败,而非硬件短缺。了解连续批处理、KV 缓存限制以及 Prefill/Decode 调度如何决定你的尾部延迟 —— 以及为什么增加 GPU 无法解决此问题。

insider
llm-inference
gpu
scheduling
+2
·tian

你的 AI 功能无法使用 CDN 边缘缓存,因为响应因用户而异

个性化 AI 功能继承了与缓存网页不同的物理特性。你的团队从 CDN 支持的界面借鉴的延迟 SLO,对于按用户生成的响应来说,在结构上是无法实现的 —— 以及你应该如何应对。

ai-engineering
latency
caching
slo
+1
·tian

微调冷启动:云供应商如何将延迟计入你的闲置成本

托管微调模型与基础模型共享 API 接口,但其成本延迟曲线却大不相同。本文将揭示冷启动税如何隐藏在你的 p99 延迟中,且从未出现在账单上。

llm-infra
fine-tuning
latency
cost
·tian

你增加的 Reranker:对召回率的拖累超过了对精准度的提升

离线 nDCG 显示你的交叉编码器 Reranker 提升了四个点。但生产环境的 p99 指标显示这是一次倒退。评估标准从未对截止时间、批处理窗口或超时引起的回退路径进行建模 —— 而这个差距正是精准度提升消失的地方。

insider
rag
retrieval
evaluation
+2
·tian

语音代理 SLO 定义为首个音频时间,而你的服务商则以首个 Token 时间衡量

基于 LLM 的首个 Token 时间(TTFT)构建的语音代理延迟 SLO 看起来是绿色的,但用户却听到了 600 毫秒的间隙。该 SLO 存在于错误的层级;用户的耳朵才是真正关键的边界。

insider
voice-ai
llm-ops
observability
+2
·tian

你定义‘首个 Token’的位置决定了你的延迟 SLO 是否真实

p99 首个 Token 延迟低于 800 毫秒看起来像是一个承诺——直到推理层的切换悄然重新定义了‘首个 Token’的含义。SLO 衡量的是供应商边界;而用户的感受则完全不同。

insider
llm-ops
observability
latency
+2
·tian

Agent 循环从搜索框偷走的延迟预算

将 200 毫秒的搜索调用换成 4 秒的 Agent 循环,延迟预算并没有消失 —— 它从基础设施迁移到了 UX。如果团队没有捕捉到这种交接,就会在交付一个指标更好但实际体验更差的产品。

insider
ai-agents
latency
ux
+2
显示第 1–12 篇,共 48 篇
1 / 4下一页