跳转到主要内容

278 含有标签「reliability」

Posts tagged "reliability" on TianPan.co.

查看所有标签

·tian

智能体学会针对重试预算进行规划

为了可靠性而增加重试机制,但智能体的规划器最终会学会将其视为免费的探索 —— 将安全网变成模型悄悄消耗的配额。本文将探讨这种偏差是如何发生的,以及如何约束它的模式。

insider
agents
reliability
retries
+2
·tian

流式中止后遗留的计费副作用

点击停止只会关闭连接,并不会撤回 Agent 已经发出的邮件。本文将探讨“部分提交”问题以及用于弥补这一鸿沟的“账本模式”。

streaming
agents
tool-use
reliability
+1
·tian

两个模型对同一结构化输出 Schema 的不同理解

两个大模型供应商可能都遵循同一个 JSON Schema,但生成的输出却无法互换 —— 这种差异通常在你第一次触发备选路由时显现。

insider
llm
structured-output
reliability
+1
·tian

第四方风险:当供应商的供应商掌控了你客户的故障

你的合同签署了一家供应商,但你的故障报告却指向了其背后的一层。本文教你如何梳理第四方风险、衡量真实冗余,以及如何撰写一份你无法完全掌控的故障复盘报告。

reliability
vendor-risk
llm-ops
slo
+1
·tian

你的代码从未检查过的 Finish Reason

每个推理 API 在返回文本的同时都会返回一个停止信号。忽略它与忽略 HTTP 状态码的错误本质相同 —— 而且你的仪表盘无法察觉它所导致的失败。

llm
observability
api-design
reliability
·tian

你用智能体替换的内部搜索框刚刚成为了你的 SLO

停用一个确定性功能而转用智能体,会悄无声息地将前任的 SLO 移交给一个无法满足它的系统 —— 而这种差距会在你的推理提供商进行限流的那个早晨显现出来。

ai-agents
sre
reliability
enterprise-search
+1
·tian

那个假设人类会阅读页面的 On-Call 运维手册

当智能体在故障频道发布了一份客气的摘要,而指挥官将其理解为已接手时,升级链条中悄然出现了一个无人定义的转换点。本文将探讨弥补这一差距的模式。

insider
on-call
incident-response
ai-agents
+2
·tian

没有模型推理项的故障复盘模板

大多数事件模板都没有留出记录 AI Agent 推理内容的栏位——导致行动项在试图为概率性失效寻找确定性的解决方案,从而使得同一类故障不断重复发生。

postmortem
sre
ai-agents
incident-response
+1
·tian

那个让你的故障面成倍增加的供应商故障转移方案

增加备用 LLM 供应商并不能让你的系统实现冗余。它会让维护成本翻倍 —— 如果你跳过了后续的提示词工程工作,系统还会变得更加脆弱。

llm-ops
reliability
prompt-engineering
evals
·tian

你的定时 Agent 有四个时钟,而你信任的是错误的那一个

通过 cron 触发的 AI Agent 继承了四个时钟 —— 调度器、工作节点、模型和工具 —— 而大多数生产系统都在默默地信任错误的那一个。本文将带你了解这些失败模式以及防止这些问题的‘时间交接合约’。

insider
ai-agents
scheduling
reliability
+2
·tian

你的 LLM 抄不准的那个账号

LLM 是 token 预测器,不是字符串复印机。当两个相似的账号出现在同一段上下文里,智能体会换错数字、把退款打给错的客户,留下一条干净得看不出问题的 trace。修复方式是把『标识符保真』从模型的工作描述里剔除出去。

insider
llm-agents
tool-use
reliability
+1
·tian

把自己调度进维护窗口的 Agent

Agent 会一头扎进部署冻结期、活跃事故和飘红的状态页执行多步计划——因为它读不到人类天然吸收的那些侧信道。这篇文章讲怎么补上这个洞。

ai-agents
sre
observability
governance
+1
显示第 49–60 篇,共 278 篇