跳转到主要内容

348 含有标签「observability」

Posts tagged "observability" on TianPan.co.

查看所有标签

·tian

端到端延迟并非你的 LLM 调用 P99:代理系统中无人衡量的隐藏乘数

为什么你的 LLM API 调用的 P99 延迟几乎无法反映用户在多步代理工作流中的真实体验 —— 以及填补这一差距的隐藏乘数。

ai-engineering
llm
performance
observability
+1
·tian

隐形的交接:为什么生产环境中的 AI 故障集中在组件边界上

大多数生产环境中的 AI 故障并不是发生在模型内部,而是发生在不可见的缝隙中 —— 即一个组件的输出变成另一个组件输入的交界处。本文将探讨如何发现并强化这些边界。

insider
ai-engineering
reliability
observability
+1
·tian

发布顺序问题:为什么同时部署模型与基础设施变更会破坏可观测性

在同一次发布中同时扩大上下文窗口、升级模型版本和更改批处理大小,会将调试问题变成无法解决的调试难题。以下是保持 AI 系统可读性的顺序化纪律。

insider
ai-engineering
llm
deployment
+1
·tian

智能体可识别性:当 Trace 无法分辨哪个智能体执行了哪些操作时

当出现故障时,多智能体 Trace 会立即坍缩成一团混乱的、完全相同的 agent.run span。本文介绍了修复这一问题的五字段身份模型 —— 稳定角色、父智能体、实例 ID、模型和提示词版本、结果 —— 以及为什么你的 APM 默认不会显示这些信息。

ai-engineering
observability
opentelemetry
multi-agent
+1
·tian

你的 AI 功能可靠性受限于无人负责的上游 ETL 流水线

大多数 AI 质量退化实际上是伪装成 AI 问题的上游数据问题。数据契约、血缘关系和结对轮值机制能将隐形的 ETL 接缝转化为一等公民工件。

insider
data-engineering
etl
ai-reliability
+2
·tian

AI 功能观察期:为什么两周的灰度发布会错过真正关键的问题

两周的灰度发布能捕捉到系统崩溃,但 AI 功能的失败通常表现为趋势性变化。本文深入探讨了观察期、慢性失败指标以及保持足够长有效期的回滚路径的实际案例。

ai-engineering
llmops
deployment
observability
·tian

闭环升级漏洞:当你的专精型智能体陷入循环路由

两个专精型智能体之间来回传递同一个对话,可能会在任何人察觉之前悄无声息地烧掉五万美元的推理成本。请将移交(handoffs)视为一种路由协议,而非领域抽象。

insider
ai-engineering
multi-agent
agents
+2
·tian

生产级智能体的 90 秒冷启动:当 LLM 不再是瓶颈时

生产级智能体在模型运行之前,通常需要 60 到 120 秒进行冷启动。解决方案不在于更快的 TTFT — 而在于将冷启动延迟视为一级 SLO,并通过预热池、快照/恢复、工具延迟加载以及 CI 门禁来进行优化。

insider
ai-agents
latency
infrastructure
+2
·tian

评估自动化陷阱:当你的流水线偏离用户真实需求时

自动化评估流水线在显示准确率持续提升的同时,用户满意度却在悄然下滑。本文将揭示漂移的发生机制,以及如何在问题扩散到生产环境之前及时发现它。

insider
ai-engineering
evaluation
llm
+1
·tian

上线 AI 功能后的头 100 个工单

每个 AI 功能上线都会产生的为期八周的运维工单序列——成本激增、评估偏移、长尾延迟、供应商静默更新——以及预置了应对方案的上线指南。

insider
ai-engineering
llm-ops
incident-response
+2
·tian

你遗漏订阅的模型提供商 Webhook 通知

主要的 LLM 提供商通过 Webhook 和电子邮件广播故障、模型弃用和账户警告,而大多数团队都关闭了这些渠道。本文将介绍一个小巧的集成方案,帮助你把“从客户那里发现问题”转变为“在自有监控系统报警前就通过提供商获知信息”。

ai-engineering
llm-ops
observability
incident-response
+1
·tian

当你的智能体具有自愈能力时,MTBF 已死

自愈智能体运行时已经吞噬了 MTBF 最初旨在统计的故障信号。以下是取代它的指标集:恢复后成功率、单次成功恢复成本以及单次追踪的恢复尝试分布。

insider
agent-reliability
observability
llm-ops
+2
显示第 169–180 篇,共 348 篇