跳转到主要内容

348 含有标签「observability」

Posts tagged "observability" on TianPan.co.

查看所有标签

·tian

AI 事故响应手册:为什么你的值班 Runbook 对 LLM 不管用

传统值班 Runbook 在 AI 系统中会失效,因为故障是非确定性的、质量下降没有错误码,根本原因排查需要一套完全不同的框架。本文介绍真正有效的做法。

insider
ai
llm
observability
+2
·tian

AI 事故复盘:当「模型导致的」成为根本原因

当故障具有随机性时,经典的五问分析法就会失效。本文介绍如何为 AI 事故撰写有价值的事后分析报告、在推理阶段应捕获哪些遥测数据,以及如何构建不止于「加强监控」的运行手册。

insider
ai-engineering
observability
incident-response
+2
·tian

真正衡量AI产品用户满意度的行为信号

点赞/点踩率只是噪声。本文介绍隐式行为信号的埋点方案——重试率、无编辑复制事件、下游操作完成情况——这些才是真正预测用户是否认可AI产品价值的指标。

ai-engineering
product-metrics
observability
llm
·tian

AI 系统的数据血缘:从数据源到响应的全链路追踪

没有归因元数据的 RAG 流水线,一旦出错就会让你束手无策。这里介绍几种轻量级 span 标注模式,能捕获检索溯源信息,让幻觉调试变得系统化。

rag
observability
data-lineage
production
+1
·tian

为什么你的 LLM 告警总是迟到两周

当你的基础设施指标显示正常时,LLM 的质量可能正在悄然下降。了解具体的信号——语义漂移评分、输出 Schema 符合度、用户修复率——以及能够在用户开始提交工单前 11 天捕捉到模型退化的异常检测模式。

observability
monitoring
production-ai
llm-ops
·tian

复合 AI 系统中的流水线归因:在薄弱环节找到你之前先找到它

当检索、重排、生成和验证组合成一条 AI 流水线时,输出质量下降几乎不可能归咎于任何单个组件。以下是真正有效的归因方法论。

ai-engineering
compound-ai
rag
debugging
+1
·tian

提示缓存命中率:你的成本仪表盘缺失的生产指标

缓存命中率是大多数团队从未监控的最具影响力的LLM成本杠杆。本文揭示了哪些因素会悄悄破坏它,以及如何在生产环境中加以防御。

llm
prompt-caching
cost-optimization
observability
·tian

你的 Prompt 是一笔没有类型系统的负债

你发布的每一个 prompt 都是可变的全局状态。Prompt 回归对 CI 不可见,变更无法原子性回滚,而漂移的速度比文档更新更快。本文介绍将 prompt 视为一等可部署制品的版本管理与治理架构。

prompt-engineering
production-ai
llmops
observability
·tian

当你的 AI 功能过时:生产环境中的知识切断与时间溯源

基于具有固定训练切断点模型构建的产品,会随着世界与训练数据的偏离而失效。本文将介绍如何检测由知识切断引起的故障、管理 RAG 的新鲜度,并在时间漂移演变为隐蔽的生产回归之前进行针对性设计。

insider
ai-engineering
production-ai
rag
+2
·tian

AI功能维护悬崖:为何你的AI功能老化速度超乎想象

AI功能不只是退化——它们是无声地退化。提示词漂移、模型更新和分布偏移共同侵蚀生产环境中的AI质量,而监控面板全程保持绿色。

llm
production
observability
mlops
·tian

你从未闭合的反馈回路:将用户行为转化为 AI 真值

显式的点赞评分可能是表象。编辑率、重试模式和会话中断能更真实地反映 AI 的质量 —— 而且你可以在没有标注预算的情况下,将它们转化为评估数据集。

insider
ai-engineering
evaluation
observability
+1
·tian

为何"修改提示词"是根因谬误:为 AI 系统打造无责事后复盘

「修提示词」的反射动作正在取代 AI 事件复盘中真正的根因分析。本文解释为何如此,以及如何将无责 SRE 文化应用于非确定性系统。

ai-engineering
sre
observability
postmortem
显示第 265–276 篇,共 348 篇