跳转到主要内容

348 含有标签「observability」

Posts tagged "observability" on TianPan.co.

查看所有标签

·tian

分词器漂移:你的本地计数在撒谎,账单才说真话

本地分词器与供应商计费计数在 CI 从未测试的长尾内容上存在 5%–15% 的差异。这一差距正在吞噬你用户实际使用场景下的安全边界。

llm
tokenization
infrastructure
observability
+1
·tian

工具重入:你的函数调用层尚未察觉的 Bug 类别

函数调用层默认采用“即发即弃”模式,既没有调用栈也没有环路检测器——其代价体现在随着工具库的增长,单个请求的 Token 消耗量会不断攀升。

insider
agents
tooling
observability
+2
·tian

Agent 飞行记录仪:在第一次事故发生前必须捕获的字段

当 Agent 脱轨时,大多数团队拥有的取证记录都是徒劳的。这里列出了飞行记录仪在第一次事故发生前必须捕获的字段,以及与之配套的存储、采样和隐私规范。

insider
ai-engineering
agents
observability
+2
·tian

无真值情况下的智能体 SLO:为无法实时评分的输出建立错误预算

传统的 SRE 实践为你提供了与用户满意度直接挂钩的可用性和延迟目标。但智能体(Agentic)特性打破了这种映射。本文将介绍当“成功”在请求发出数小时后才出现时,该如何编写错误预算——以及为什么照搬延迟 SLO 手册的团队虽然能完成每个季度的目标,却眼睁睁看着用户流失。

insider
ai-engineering
sre
observability
+2
·tian

30 秒都去哪了:APM 无法察觉的 Agent 步骤内部延迟归因

传统的 APM 将 Agent 的一个步骤视为单一的粗粒度 Span,导致值班工程师只能靠猜。通过将其分解为七个阶段,区分首字延迟 (Prefill) 与解码 (Decode),并追踪关键路径而非总 Span 时间。

insider
observability
llm
agents
+2
·tian

智能体流量不等同于人类流量:为两类调用者设计 API

生产环境的 API 现在正在服务两类调用者——人类和智能体。它们具有不同的流量特征、故障模式和安全风险。在 2026 年,将它们混为一谈是所有关于端点不稳定问题调查的根源。

api-design
ai-agents
observability
rate-limiting
+1
·tian

Agent 工作流的碳计算:Token 预算现已成为 ESG 披露

Agent 工作流消耗的能量可能是单次对话补全的 50–200 倍,采购团队已经开始关注这一指标。本文是一份关于逐任务碳归因、碳预算强制要求的路由决策,以及为什么率先进行观测的团队能掌控话语权的务实指南。

insider
ai-agents
sustainability
observability
+2
·tian

取消安全的智能体:你的“停止”按钮背后已经产生的副作用

“停止”只是一种 UI 手段,而非系统保证。这是一份针对取消安全智能体的从业者指南:持久化副作用账本、作用域授权、补偿操作,以及取消 UI 究竟应该显示什么。

insider
agents
reliability
distributed-systems
+2
·tian

复合型 AI 系统中的内部结算账本

复合型 AI 系统成本分摊指南 —— 涵盖 per-span 账本、on-behalf-of 标头、结算货币不匹配,以及决定谁为工具调用买单的治理策略。

finops
ai-agents
observability
cost-attribution
·tian

LLM 工具表面的契约测试:当供应商更改字段而你的智能体静默适应时

当供应商重命名工具响应字段时,你的智能体不会崩溃 —— 它会自行适应并交付一个质量下降的答案。为什么微服务契约测试必须迁移到智能体技术栈,以及如何进行配置。

contract-testing
llm-agents
tool-calling
observability
+1
·tian

反事实日志:通过今天的充足记录,在明年的模型上重放昨天的流量

生产环境中的 LLM 日志能很好地回答“模型说了什么”,却难以回答“模型看到了什么” —— 正是这种差距导致了数月后的模型迁移评估宣告失败。本文介绍了一种用于可重放追踪的实用模式。

insider
ai-engineering
observability
llm-evaluation
+1
·tian

评测环境的延迟谎言:为什么你的 p95 在生产环境中翻倍

评测套件测量的是在一台安静机器上针对热缓存进行的串行调用;生产环境则是另一回事。将延迟视为部署的属性,而非模型的属性,否则你的 p95 数据将会具有误导性。

llm-ops
evaluation
latency
observability
+1
显示第 205–216 篇,共 348 篇