跳转到主要内容

348 含有标签「observability」

Posts tagged "observability" on TianPan.co.

查看所有标签

·tian

你的故障指挥官无法执行的智能体运行手册

大多数智能体运行手册在白天读起来很顺畅,但在凌晨 2:17 运行时却会被阻塞,因为作者拥有值班 SRE 所不具备的访问权限。联邦化、声明式范围、紧急访问端点和演练才是解决之道。

ai-agents
sre
incident-response
runbooks
+1
·tian

那些你团队的人员已悄然停止阅读的标注队列

标注者吞吐量是每个 LLM 评估计划的无声天花板,而队列排序则是无人设计的采样器。本文探讨如何将“为评分而采样”视为一等公民的工程界面。

insider
evals
annotation
observability
+1
·tian

那个在行动已发出后才生效的预算上限

当紧急停机开关正确触发,但智能体已经订好了机票、发送了邮件并关闭了工单时——为什么以 Token 衡量的预算上限忽略了以“行动”衡量的损失,以及如何将支出与不可逆性解耦。

insider
ai-agents
guardrails
observability
+2
·tian

为了节省 Token 而被你剥离的思维链,其实隐藏着一项合规证据要求

为了降低推理成本而剥离推理 Token 看起来是一项简洁的优化,直到审计员要求你提供一个你已不再生成的合规理由。推理踪迹是具有双重用途的产物 —— 它们既是工程成本项,也是受监管的证据 —— 而负责提示词的团队往往并不负责审计工作。

llm-ops
compliance
observability
ai-governance
+1
·tian

你的评估套件设置了确定性种子,但供应商却悄悄忽略了它

你的评估流水线设置了 seed=42 并报告了可复现的数值。然而,供应商可能在网关处丢弃了它,批次大小在负载下发生了变化,或者系统指纹在一夜之间轮换了 —— 你的基准测试离得到一个完全不同的答案其实只差一个批次的距离。

llm-evaluation
reproducibility
observability
inference
·tian

重新路由回智能体的升级路径

当下游队列开始自行自动化时,`escalate_to_human` 工具就不再是人机回环了。探讨为什么契约的生命周期必须长于消费者。

insider
ai-agents
human-in-the-loop
escalation
+2
·tian

裁判模型被悄悄升级的评估框架

终端被悄悄更新的 LLM 裁判是一个没有校准契约的测量工具。固定快照版本、构建锚点集并运行双裁判窗口,确保 6 分的提升代表的是你的系统得到了改进 —— 而不是尺子变了。

insider
llm-eval
judge-model
calibration
+2
·tian

那个在东部时间凌晨 3 点采样生产流量的评估集

一个基于凌晨 3 点定时任务构建的离线评估集,悄然变成了针对深夜批量重试和亚太地区流量的调查——而排行榜无法告诉你那是谁的模型。

insider
llm-evals
sampling-bias
production-ml
+1
·tian

你的 Token 预测从未考虑过的重尾效应

基于试点的 Token 成本预测往往忽略了生产环境用户的重尾效应——账单通常由 P99 而非中位数决定。本文将探讨如何针对分布而非平均值进行定价。

insider
llm
unit-economics
pricing
+2
·tian

那个教会用户永远不要打断智能体的中断 UI

流式智能体的停止按钮可能会诱导用户强忍着看完错误的回答,而不是及时纠偏。解决方法是将“中断”视为对话中的一个轮次,而不是 API 调用的断路器。

agents
ux
streaming
product-design
+1
·tian

披着“延迟预算路由器”外衣的“质量损失路由器”

一个延迟预算路由器完全按照其损失函数的要求运行,却在无形中降低了符合推理要求的样本群体的质量。本文探讨了为什么聚合评估会掩盖这种性能回退,以及应该如何配置监控手段。

insider
llm-routing
slo
evaluation
+1
·tian

你的编排器在规划步骤上消耗的延迟预算

智能体的大部分延迟都消耗在了决定下一步该做什么,而不是执行上。将规划器的开销视为一等公民的 SLO 指标,优化方向就会变得显而易见。

agents
llm
observability
performance
+1
显示第 49–60 篇,共 348 篇