跳转到主要内容

278 含有标签「reliability」

Posts tagged "reliability" on TianPan.co.

查看所有标签

·tian

你的重试逻辑正在给 Agent 传达错误的教训

为不稳定的网络设计的重试策略假设调用者是正确的。但 Agent 让调用者变成了不可靠的部分,盲目的重试会悄悄地将真实的 Bug 洗白成绿色的勾。

ai-agents
reliability
retries
observability
+1
·tian

记住你 Bug 的智能体:为什么修复 Bug 是一次内存失效事件

当你修复一个 Bug 时,记住该临时解决方案的智能体会继续在一个已不存在的环境中应用它。为什么修复 Bug 是一次非预期的内存失效事件,以及如何像对待缓存一样对待智能体记忆。

ai-agents
memory
software-engineering
reliability
·tian

无人清理的审批队列

风险分层门控将危险的智能体操作路由到人工队列 —— 但一个没有负责人、没有 SLO 且没有超时策略的队列,只是另一种更慢的失败方式。本文探讨如何像管理真实的基础设施一样运营人工闸口。

insider
ai-agents
human-in-the-loop
observability
+1
·tian

智能体从未接收到的服务降级信号

调用下游 API 的智能体只能看到其最后一次请求的响应——没有状态页面、没有变更日志、没有警告横幅。本文探讨了为什么智能体会直接陷入服务部分故障(brownouts)和速率限制,以及如何构建侧信道,以传递那些智能体从未被赋予收听方式的运维信号。

llm-agents
api-design
observability
reliability
+1
·tian

演示到生产的悬崖:为什么准确率 90% 的智能体发布率为 0%

每步成功率为 90% 的智能体是一个完美的演示,但却是一个无法发布的产品。这种差距不是打磨问题,而是高昂失败成本的长尾效应,而解决方案是降低这些失败的成本。

ai-agents
reliability
llmops
production-engineering
·tian

Eval 测试集是滞后指标:你的绿色仪表盘只反映上季度的失败

仅基于故障复盘(Postmortems)建立的评估套件只能验证你的 AI 系统在过去是安全的。本文将探讨为什么全绿的通过率会在模型迁移当天“撒谎”,以及如何构建探索性评估的覆盖范围。

llm
evaluation
testing
ai-engineering
+1
·tian

那个你从未进行过负载测试的备用模型

配置好的备用模型只能证明你的路由机制有效 —— 却无法证明你的应用是否能在次要模型的输出下生存。本文探讨了为什么名义上的备用方案在真实流量下会失败,以及如何在供应商出故障前先行测试你的故障转移机制。

insider
llm
reliability
failover
+2
·tian

你的备用路径是生产环境中唯一未经测试的代码

你为应对故障而构建的降级路径几乎从不运行,因此它在寂静中腐烂,并在其本应应对的事故发生时才首次亮相。

insider
reliability
llm
sre
+2
·tian

Happy Path 是你的 Agent 评估测试过的唯一路径

94% 的通过率衡量的是你想象成功的能力,而非 Agent 是否真的有效。本文探讨黄金路径偏见如何渗入 Agent 评估套件,以及如何通过故障模式覆盖、生产案例收集和故障注入来解决这一问题。

insider
ai-agents
evaluation
llm
+2
·tian

你的智能体从未发送的幂等键

当智能体的工具调用超时并重试时,如果没有幂等键,重试可能会导致再次扣费。了解如何让智能体重试变得安全无害,而非充满风险。

ai-agents
idempotency
distributed-systems
reliability
+1
·tian

Prompt Caching 的隐形代价:当缓存命中提供错误的用户上下文时

Prompt 缓存键是一个正确性边界,而非一个计费开关。如果你只为了提高命中率而设计它,就会引发跨租户上下文泄露和过时的个性化。

ai-agents
prompt-caching
llm
architecture
+1
·tian

演变成产品决策的速率限制

供应商配额不再仅仅局限于后端。当智能体在任务执行过程中达到每分钟 Token 数上限时,失败会直接反馈给用户 —— 因此,速率限制现在成了产品设计必须考虑的一部分。

llm
rate-limiting
product-design
agents
+1
显示第 73–84 篇,共 278 篇