跳转到主要内容

278 含有标签「reliability」

Posts tagged "reliability" on TianPan.co.

查看所有标签

·tian

跨团队 Agent SLA 无法简单叠加:你的组织遗漏预算的 99% 数学陷阱

当 Agent 跨越团队边界互相调用时,单个 SLO 将不再能预测端到端的行为。在组合数学耗尽你的可靠性预算之前,必须落地的四个关键要素。

insider
multi-agent
reliability
slo
+1
·tian

人类注意力预算是你的 HITL 系统在默默透支的约束条件

HITL 系统通常将审核员的时间视为无限,但警觉度下降和自动化偏差正悄悄地将安全网变成“橡皮图章”。请针对真实的人类极限进行设计。

hitl
ai-agents
reliability
ai-engineering
+1
·tian

70% 可靠性恐怖谷:AI 功能丧失用户信任的深渊

一个成功率为 70% 的 AI 功能可能比一个失败率为 70% 的功能更糟糕 —— 集中且不可预测的失败比持续的不稳健更快地摧毁用户信任。本文探讨了为什么综合准确率会误导人、为什么用户无法自我校准,以及如何针对“恐怖谷”地带进行设计。

ai-product
trust-calibration
llm-eval
ux-design
+1
·tian

智能体记忆漂移:为什么一致性对齐是你缺失的关键环

长期运行的智能体在停止观察的那一刻起就与世界脱节。应将记忆视为数据库副本:使用水位线 (watermarks)、变更摘要 (change feeds) 和惰性重校验。

insider
ai-agents
memory
reliability
+1
·tian

无真值情况下的智能体 SLO:为无法实时评分的输出建立错误预算

传统的 SRE 实践为你提供了与用户满意度直接挂钩的可用性和延迟目标。但智能体(Agentic)特性打破了这种映射。本文将介绍当“成功”在请求发出数小时后才出现时,该如何编写错误预算——以及为什么照搬延迟 SLO 手册的团队虽然能完成每个季度的目标,却眼睁睁看着用户流失。

insider
ai-engineering
sre
observability
+2
·tian

取消安全的智能体:你的“停止”按钮背后已经产生的副作用

“停止”只是一种 UI 手段,而非系统保证。这是一份针对取消安全智能体的从业者指南:持久化副作用账本、作用域授权、补偿操作,以及取消 UI 究竟应该显示什么。

insider
agents
reliability
distributed-systems
+2
·tian

当需求是悬崖而非曲线时,如何进行 GPU 产能规划

Agent 工作负载打破了平滑曲线的产能规划。请以 Token 为单位进行规划,将扇出视为一级指标,并针对预见性的“悬崖式”需求预留产能。

insider
gpu-capacity
llm-inference
agent-infrastructure
+2
·tian

JSON 模式是一种方言,而非标准:你备选路径中的隐形崩溃

每个主流 LLM 供应商都以相同的名称提供 JSON 模式,但其背后的约定却各不相同。当你启用备选路由的那一天,你才会发现解析器无法处理哪些细微差异。

llm
structured-outputs
reliability
ai-platform
+1
·tian

负载降级是为人类设计的,而 Agent 会放大你正在抵御的风暴

Agent 会围绕 503 错误重新规划并以远超人类的速度重试,将上游的小幅波动演变成关联性停机。本文从实践者视角出发,探讨平台下一步需要的负载降级原语,以及 Agent 为了避免成为“风暴”而必须遵循的纪律。

insider
agents
reliability
sre
+2
·tian

重新规划而非重试:为什么大多数智能体错误并非瞬时性的

大多数智能体框架在工具错误时默认使用指数退避重试 —— 这种模式借用自无状态的 HTTP,但在有状态的规划循环中是完全错误的。正确的默认做法应该是重新规划。

agents
llm
error-handling
reliability
+1
·tian

并行工具扇出的结构化并发:谁来负责部分失败?

大多数智能体框架将并行工具调用作为分离的 goroutine 运行,然后重新发现了结构化并发在二十年前就已经解决的失败模式 —— 部分失败、响应取消以及成本失控。

insider
agents
concurrency
llm
+2
·tian

供应商 99.9% 的 SLA 对你的 Agent 来说衡量边界错了

供应商 99.9% 的可用性是按单次调用衡量的;而你的 Agent 每个任务需要进行 12 次调用。本文将探讨其中的算术逻辑、缺失的合同条款,以及如何在用户察觉之前捕获故障的发散告警。

insider
sla
agents
reliability
+2
显示第 145–156 篇,共 278 篇