跳转到主要内容

348 含有标签「observability」

Posts tagged "observability" on TianPan.co.

查看所有标签

·tian

追踪规划层:为什么你的智能体追踪只记录了一半的故事

智能体可观测性工具能为你提供完整的工具调用日志和耗时,但驱动这些决策的规划与推理过程往往是不可见的。本文将探讨什么是规划层追踪,为什么它能捕捉到完全不同的失败类型,以及如何在今天就开始实施。

ai-agents
observability
debugging
llm
·tian

AI基础设施碳核算:你的团队尚未衡量的可持续发展成本

AI推理现在占全球排放量的2.5–3.7%,且每年增长15%。本文介绍如何衡量你的团队的贡献,以及为何这将成为合规问题,无论你是否提前规划。

ai-engineering
sustainability
infrastructure
observability
·tian

AI 轮值:当你的系统在“思考”时,该针对什么发告警

如何为非确定性 AI 系统设计告警,AI 事件与传统故障的区别,以及在凌晨 2 点能真正帮到轮值工程师的 Runbook 结构。

insider
ai-engineering
observability
incident-response
+1
·tian

AI 产品指标陷阱:当参与度看起来像价值却并非如此

团队如何在追踪会话数量和完成率的同时,错过了真正能预测价值的指标——以及为何 AI 功能上线后头 30 天的数据几乎总是具有误导性。

ai-engineering
product-metrics
llm
observability
·tian

SRE 日志分析中的 AI:真正行之有效的分层架构

对流式日志进行实时前沿模型分析在成本和延迟上都是不可行的。本文介绍了一种在生产环境中真正有效的分层方法——通过快速异常检测来触发有选择性的 LLM 调用。

observability
SRE
LLM
monitoring
+1
·tian

对齐税:衡量交付安全 AI 的真实成本

你在生产级 AI 系统中添加的每一层安全措施,都会在延迟、Token 和用户摩擦方面产生可衡量的成本。本文将介绍如何量化这些成本并做出有原则的权衡。

ai-safety
llm
production-ai
observability
+1
·tian

AI 驱动型 API 的行为 SLA:为非确定性输出编写协议

当你的 API 封装了 LLM 时,传统的 SLA 就会失效。学习如何定义行为协议 —— 包括格式保证、拒绝率、延迟 p95、幻觉预算 —— 以及如何在不破坏用户体验的情况下,对行为变更进行版本管理和沟通。

ai-engineering
api-design
llm
reliability
+1
·tian

Agent 流水线的分布式追踪:为什么你的 APM 工具形同虚设

标准 APM 工具在多步骤 Agent 流水线上会失效。以下是 AI Agent 专用可观测性的真正需求——以及三个能在用户察觉之前预判 Agent 劣化的关键指标。

insider
ai-engineering
observability
agents
+1
·tian

AI 智能体的集群健康监控:单智能体可观测性在规模化场景下的盲区

从单个智能体扩展到上千个,会暴露出单智能体可观测性工具完全忽视的集群级故障模式:版本异构性、关联服务商级联故障,以及在几分钟内耗尽月度预算的 Token 消耗螺旋。

ai-engineering
observability
agents
mlops
·tian

知识切断是一个隐形的生产环境 Bug

模型的训练知识切断点不仅仅是文档中的一个脚注 —— 它是一种传统监控无法察觉的延时生产故障。本文将介绍如何检测、遏制并围绕它进行设计。

llm
production
rag
reliability
+1
·tian

多轮对话会话状态坍缩问题

为什么单轮 LLM 故障很容易被发现,而多轮会话状态在 10 轮以上后会悄悄损坏 —— 以及防止 “AI 忘了我是谁” 这种失效模式的检查点、压缩和监控模式。

insider
ai-engineering
llm
session-management
+1
·tian

AI 系统值班:当 Bug 是模型时的事故响应手册

当故障源于非确定性的模型行为时,标准的值班手册就会失效。本文提供了一个实用的框架,用于检测、分类和遏制 AI 事故 —— 从护栏绕过到成本爆炸 —— 这些手册专为工程师而非 ML 研究人员打造。

llmops
incident-response
ai-engineering
observability
显示第 289–300 篇,共 348 篇