跳转到主要内容

24 含有标签「slo」

Posts tagged "slo" on TianPan.co.

查看所有标签

·tian

P99 是产品决策,而非基建决策

你的尾部延迟目标并不是基建团队单纯优化出的一个数字 —— 这个数字本身就是一个产品选择。本文探讨了 UX 交互设计与延迟预算如何相互权衡,以及为什么 P99 应该出现在设计评审中。

insider
latency
ux
llm-inference
+2
·tian

供应商移除的 Logprobs 字段如何静默地破坏了你的置信度路由

一个不再升级低置信度回答的置信度路由,导致该问题的供应商静默层级变更,以及响应结构契约、群体级告警和针对错误故障模式编写的回退机制是如何共同掩盖问题的。

insider
llm
observability
api-contracts
+2
·tian

你的延迟 SLO 取决于其他团队的 Prompt 大小

共享的每分钟 Token 数(TPM)限制使得你的延迟 SLO 与你自己的服务脱钩。解决方法是以提供商进行限流的单位来衡量内部容量,而不是以请求数或美元。

insider
llm
slo
rate-limiting
+2
·tian

你的 AI 功能无法使用 CDN 边缘缓存,因为响应因用户而异

个性化 AI 功能继承了与缓存网页不同的物理特性。你的团队从 CDN 支持的界面借鉴的延迟 SLO,对于按用户生成的响应来说,在结构上是无法实现的 —— 以及你应该如何应对。

ai-engineering
latency
caching
slo
+1
·tian

披着“延迟预算路由器”外衣的“质量损失路由器”

一个延迟预算路由器完全按照其损失函数的要求运行,却在无形中降低了符合推理要求的样本群体的质量。本文探讨了为什么聚合评估会掩盖这种性能回退,以及应该如何配置监控手段。

insider
llm-routing
slo
evaluation
+1
·tian

你的编排器在规划步骤上消耗的延迟预算

智能体的大部分延迟都消耗在了决定下一步该做什么,而不是执行上。将规划器的开销视为一等公民的 SLO 指标,优化方向就会变得显而易见。

agents
llm
observability
performance
+1
·tian

你的供应商通过更小的分块达成的 Tokens-Per-Second SLO

你的供应商通过缩小分块达到了每秒 Token 数的 SLA,但你的渲染器却为此付出了代价。为什么流式吞吐量是一个需要协同设计的属性 —— 以及如何编写一个由消费者主导的感官 SLO。

insider
llm-streaming
slo
observability
+2
·tian

语音代理 SLO 定义为首个音频时间,而你的服务商则以首个 Token 时间衡量

基于 LLM 的首个 Token 时间(TTFT)构建的语音代理延迟 SLO 看起来是绿色的,但用户却听到了 600 毫秒的间隙。该 SLO 存在于错误的层级;用户的耳朵才是真正关键的边界。

insider
voice-ai
llm-ops
observability
+2
·tian

你定义‘首个 Token’的位置决定了你的延迟 SLO 是否真实

p99 首个 Token 延迟低于 800 毫秒看起来像是一个承诺——直到推理层的切换悄然重新定义了‘首个 Token’的含义。SLO 衡量的是供应商边界;而用户的感受则完全不同。

insider
llm-ops
observability
latency
+2
·tian

第四方风险:当供应商的供应商掌控了你客户的故障

你的合同签署了一家供应商,但你的故障报告却指向了其背后的一层。本文教你如何梳理第四方风险、衡量真实冗余,以及如何撰写一份你无法完全掌控的故障复盘报告。

reliability
vendor-risk
llm-ops
slo
+1
·tian

变成关键路径的审批队列

当你在 Agent 和不可逆的操作之间加入人工环节时,你增加的并不是一个安全原语。你增加的是一个具有吞吐量限制、可用性配置以及质量与负载曲线的队列。本文将探讨它是如何演变成一个无人预定义的 P0 级问题的。

ai-agents
human-in-the-loop
system-design
slo
·tian

向量索引存在一个没人定义的陈旧度 SLO

每晚进行的重新索引任务是一个没人写下来的新鲜度承诺。本文介绍如何将向量索引延迟转化为可衡量的 SLO,向智能体和用户展示数据账龄,并根据衰减率而非习惯进行重新索引。

insider
rag
ai-agents
reliability
+2
显示第 1–12 篇,共 24 篇
1 / 2下一页