跳转到主要内容

348 含有标签「observability」

Posts tagged "observability" on TianPan.co.

查看所有标签

·tian

双跳工具链:为什么 95% 的工具组合会变成 80% 的流水线

虽然单个工具的仪表板保持绿色,但端到端的 Agent 可靠性却在崩溃。故障发生在工具之间的衔接处,契约漂移、分页处理和单位不匹配将 95% 的原始组件变成了 80% 的流水线。

insider
agents
tool-use
reliability
+1
·tian

供应商 SLA 差距:为什么你的 LLM 提供商的运行时间忽略了导致产品崩溃的故障模式

你的 LLM 供应商 99.95% 的运行时间指标并不能覆盖拒绝率飙升、静默模型更新或配额驱动的降级。以下是能够涵盖这些情况的功能可用性检测方法。

insider
llm-ops
reliability
observability
+1
·tian

升级率:离线测试遗漏的评估信号

升级率是衡量智能体能力的少数真实信号之一,但在大多数公司中,它存在于运营团队的人员配置仪表板上,而不是 AI 团队的评估审查中。以下是缩小这一差距的方法。

agents
evaluation
observability
slo
·tian

评估天花板:当你的黄金测试用例失去区分度时

一旦每个候选模型在相同的测试用例上都获得了 95+ 的分数,你的评估套件就不再具备任何衡量价值 —— 是尺子不再适用,而不是被测平台的问题。

insider
ai-engineering
evaluation
llm
+2
·tian

评估选择偏差:为什么你的测试集会对那些导致用户流失的失败视而不见

从生产链路中更新的评估集继承了幸存者偏差:遭遇最严重失败的用户已经离开,并停止生成链路。分数在攀升,而留存率在下降。以下是如何打破这一循环的方法。

insider
evals
llm
agents
+2
·tian

备用方案变成了默认方案:为什么你的分层配比需要 SLO

你的备用路径本应只处理 0.5% 的请求。现在它却承载了 38% 的流量。修复方案是将分层配比视为一等 SLO。

llm-ops
observability
slo
reliability
+1
·tian

LLM 提示词中 “现在” 的五种定义

每个 LLM 提示词中隐藏的五层隐性时间 —— 以及为什么当请求被重放、批处理或针对固定快照进行评估时,这些层级会产生无声的冲突。

llm
prompt-engineering
rag
observability
·tian

流式推理中的海勒姆定律:节奏、停顿和中间 Token 是未成文的契约

当更换模型虽然保留了结构化输出 schema,但改变了 Token 节奏、停顿模式和中间表述时,你实际上发布了一个破坏性变更,违反了一个你从未正式定义的契约。

insider
ai-engineering
llm
streaming
+2
·tian

多维 Agent 二分查找:当回归出现在交互中时

当 Agent 的回归源于新模型与新工具描述之间的交互时,单轴回滚会产生明显的假阴性。解决方案是对模型、Prompt、工具目录、检索索引和采样配置的笛卡尔积进行二分查找——并以命名的版本信封作为回滚的最小单元。

agents
debugging
evals
observability
+1
·tian

工具行为漂移:Schema 没变,语义却变了

当 Schema 保持不变但工具的行为发生偏移时,你的 Agent 就会悄然退化。这是一份关于如何检测和遏制工具行为漂移的实战指南。

ai-agents
observability
reliability
contract-testing
+1
·tian

工具延迟尾部:为什么 p99 重塑了智能体架构而 p50 掩盖了问题

基于单个工具中位数构建的智能体延迟预算在生产环境中会悄无声息地失效:经过 7 个步骤后,尾部延迟开始占据主导地位,导致尽管单个工具的仪表盘显示为绿色,用户却仍在等待。本文将深入探讨为什么 p99 会重塑智能体架构,相关的工程规范是什么样的,以及哪些具有 40 年历史的分布式系统技术可以直接应用。

insider
ai-agents
latency
distributed-systems
+2
·tian

当工具撒谎时:智能体默认信任的“伪成功”失败模式

工具调用返回成功,但底层操作从未实际执行——这是导致“模型对用户撒谎”事件背后的结构性失败模式,也是高风险智能体所需的校验层。

insider
agents
tool-calling
reliability
+2
显示第 133–144 篇,共 348 篇