跳转到主要内容

348 含有标签「observability」

Posts tagged "observability" on TianPan.co.

查看所有标签

·tian

长程智能体的航位推算:无需中断即可掌握智能体运行状态

当一个智能体运行数小时之久,了解它的实时状态——以及它是否仍在正轨上——就成为了一个核心工程问题。本文将介绍解决这一问题的各种模式。

insider
ai-agents
observability
production
+1
·tian

智能体系统中的决策溯源:真正有效的审计追踪

当自主智能体执行具有重大影响的行动时,拥有日志并不等同于拥有问责机制。本文是一份为生产环境智能体系统设计决策溯源的实践指南,涵盖事件模式、所有权移交、幻觉归因,以及使其不可或缺的合规要求。

insider
agentic-ai
observability
ai-governance
+1
·tian

跨 Agent 服务边界的分布式追踪:上下文传播的断裂

当 Agent 跨微服务边界调用 Agent 时,W3C TraceContext 会发生断裂,追踪信息碎片化为不相关的 Span。本文介绍故障的技术形态以及修复方法。

insider
observability
agents
opentelemetry
+1
·tian

幻觉并非根本原因:生产环境 AI 的调试方法论

不再仅仅归咎于“模型产生了幻觉”,而是转向系统的根本原因分析:检索失败、上下文冲突、提示词歧义和违反知识边界,每种情况都需要不同的修复方案。

insider
llm
production-ai
debugging
+2
·tian

为什么幻觉率不是衡量生产级 LLM 系统的核心指标

幻觉率虽易于衡量,但与用户结果的关联性较弱。本文提供了一个选择行为指标的框架,能真实反映你的 AI 功能是否奏效。

evaluation
observability
production-ai
metrics
·tian

隐形模型漂移:供应商静默更新如何破坏生产 AI

LLM 供应商在不发布变更日志的情况下更新模型。你的提示词回归是真实存在的,它们是静默的,且需要你自己去发现。以下是具体方法。

insider
llm
production
observability
+1
·tian

随机系统的值班响应:为何你的 AI 运行手册需要重写

传统故障响应假设故障是可复现的,但 LLM 驱动的系统并非如此。以下是如何针对非确定性 AI 重写告警方案、分类决策树和事后分析模板。

insider
ai-engineering
sre
incident-response
+2
·tian

非确定性 AI 功能的 SLO:当“错误”具有概率性时,如何设置错误预算

标准的可用性和错误率 SLO 无法捕捉 LLM 功能中的行为质量下降。本文将介绍如何定义行为质量 SLO,设置有意义的错误预算,并在正确性具有概率性时将其接入事件响应流程。

ai-engineering
sre
observability
llm
+1
·tian

AI Agent 的 SRE:凌晨 3 点到底什么会出故障

传统的 SRE 运行手册无法涵盖 AI Agent 的失效模式。本文将探讨在生产环境中实际会发生的故障——死循环、上下文溢出、幻觉导致的 API 调用——以及如何通过监控、报警和成本控制来帮助值班工程师有效应对。

insider
ai-engineering
llmops
reliability
+1
·tian

AI 事故复盘中的“责任消失”难题

当 AI 系统性能下降时,责任往往会同时散布在模型、Prompt、检索、评估和基础设施等多个环节。本文提供了一套归因框架,帮助你在复盘演变成简单的“模型变了”这种借口之前,将事故精准锁定到具体层级。

ai-engineering
observability
incident-response
llm
+1
·tian

AI 值班手册:当 Bug 是一次错误预测时的故障响应

传统运行手册在症状是'输出感觉不对'时会失效。这是一套专为生产环境中 AI 系统设计的实用分诊决策树、升级标准和复盘格式。

insider
mlops
incident-response
llm
+2
·tian

没人会提前搭建的AI运维仪表盘

延迟和错误率覆盖的LLM功能故障空间不足20%。以下是你的APM仪表盘默默忽略的五种生产故障模式,以及真正能发现问题的信号层级体系。

insider
ai-engineering
observability
monitoring
+2
显示第 277–288 篇,共 348 篇