跳转到主要内容

278 含有标签「reliability」

Posts tagged "reliability" on TianPan.co.

查看所有标签

·tian

回退路径萎缩:你的降级方案在三个月前就失效了

你在九个月前编写的回退方案已经悄悄失效了。探讨 AI 平稳降级路径是如何发生位衰减的,为什么集成测试会漏掉它,以及如何通过故障注入规范来保持降级模式的可用性。

reliability
chaos-engineering
llm-ops
fallback
·tian

隐藏的 SDK 重试机制:为什么你付了两倍的钱却浑然不知

主流 LLM SDK 默认附带两次自动重试。如果在调用侧再叠加一层重试,当提供商出现短暂故障时,单个请求可能会扇出为九次推理调用 —— 这在你的追踪日志中难以察觉,却会实实在在地体现在账单上。

insider
llm
reliability
cost
+2
·tian

AI 功能依赖图:当多个服务共用同一个模型时的韧性工程

当 15 个产品功能共享同一个嵌入模型和 LLM 端点时,一旦供应商发生故障,就会演变成一场没有堆栈跟踪的分布式系统崩溃。本文将探讨如何映射 AI 功能依赖关系、在每一层应用熔断器,并设计降级链,使功能在故障时能够干净地退出,而不是导致输出错误。

ai-engineering
reliability
llm
infrastructure
·tian

AI 输出波动性是你可能定价不足的业务风险

在概率系统之上构建定价层级、 SLA 和客户承诺蕴含着未公开的风险。这里介绍了如何量化这些风险并进行对冲。

insider
llm
production-ai
reliability
+2
·tian

API 文档即可靠性基础设施:文档如何决定智能体的成功率

当 AI 智能体通过工具调用(tool calling)消费你的 API 时,文档质量就成了直接的可靠性变量。模糊的参数和缺失的错误语义会导致可衡量的失败率,这是任何提示词优化都无法修复的。

insider
ai-engineering
agents
api-design
+1
·tian

跨用户一致性问题:当你的 AI 对同一问题给出不同答案时

当同事问了同一个问题却得到不同的答案,企业 AI 工具会悄悄侵蚀信任。本文解释了为何 temperature=0 无法解决问题,以及真正有效的工程模式。

insider
llm
enterprise-ai
reliability
+2
·tian

人工接管作为一等功能:设计能够优雅降级至人工控制的 AI 系统

大多数 AI 系统将人工接管视为错误状态,而非设计模式。以下是如何将接管协议构建为一等操作路径而非事后补救的方法。

insider
ai-engineering
production-ai
reliability
+1
·tian

你的负载测试在撒谎:生产环境中的 LLM 供应商容量争用

LLM API 是多租户共享基础设施 —— 你的负载测试在凌晨 2 点通过,但生产环境的延迟在周二上午 9 点却出现飙升。了解共享峰值需求的机制以及保护你 SLO 的架构模式(多供应商对冲、熔断器、预留容量)。

llm
production
reliability
infrastructure
+1
·tian

SLA 的幻象:为什么 99.9% 的可用性对 AI 功能毫无意义

传统的可用性 SLA 仅保证端点有响应,而不保证响应质量。本文将探讨为什么 AI 驱动的功能需要一种不同的可靠性契约。

insider
ai-engineering
observability
slo
+1
·tian

自动化悬崖:当部分 AI 自动化比完全不自动化更糟糕时

部分 AI 自动化产生的结果可能比完全手动处理更糟。本文提供了一个工程框架,用于识别何时除非你能实现全流程自动化,否则不应进行局部自动化。

insider
ai-engineering
automation
reliability
+1
·tian

当 AI 听起来正确但事实并非如此:技术与科学领域中的 LLM 虚构现象

LLM 在物理、化学和工程领域表现出极高的虚构迷惑性——在这些领域,“听起来正确”与“事实正确”之间的分歧最为危险。本文将介绍如何构建可靠性架构(Grounding Architectures),在这些“自信但错误”的输出造成实际损害之前将其拦截。

llm
ai-engineering
reliability
hallucination
+1
·tian

智能体记忆污染:一次错误工具响应如何毒害整个会话

一次事实错误或恶意构造的工具响应,可以污染 LLM 智能体整个会话的推理。本文分析失败的解剖结构,并给出真正有效的防御措施。

ai-engineering
agents
reliability
memory
显示第 109–120 篇,共 278 篇