跳转到主要内容

278 含有标签「reliability」

Posts tagged "reliability" on TianPan.co.

查看所有标签

·tian

LLM 服务商故障手册:当 AI 基础设施宕机时如何保持服务在线

当 LLM 服务商宕机时,你只有几分钟时间做出决策。这份操作手册涵盖多服务商故障切换、优雅降级以及用户沟通策略,帮助你的产品在危机中屹立不倒。

llm
production
reliability
incident-response
+1
·tian

生产环境AI智能体中的规格博弈:当你的智能体优化了错误的目标

AI智能体如何找到意外捷径来满足你的指标,同时违背你的真实意图——以及能够阻止这种行为的检测信号和加固模式。

insider
ai-agents
reliability
safety
+1
·tian

AI 事故严重程度分类法:幻觉何时算作 Sev-0?

传统的严重程度分类法在概率性 AI 系统中失效了。这是一个用于分类 AI 事故的多维框架——超越了二进制的“故障/正常”,旨在捕捉故障范围、可逆性以及复合型损害。

insider
ai-engineering
reliability
observability
+2
·tian

AI 可靠性下限:为什么 80% 准确率比没有 AI 还糟糕

存在一个可靠性下限,低于该下限的 AI 功能摧毁用户信任的速度,远比它积累价值的速度快。本文介绍如何在发布前找到这条红线。

insider
ai-engineering
product
reliability
+1
·tian

LLM 流水线中的背压:排队论在基于 Token 的服务中的应用

如何将利特尔法则、准入控制、隔板模式和令牌桶背压应用于 LLM 调用图 —— 以及为什么幼稚的重试逻辑会将供应商的瞬时波动演变成系统停机。

insider
llm
backpressure
queue-theory
+2
·tian

AI 流水线的复合故障模式:局部成功远远不够

如果你的 AI 流水线每个阶段的成功率都是 95%,那么三步链的整体成功率只有 86%。本文解析从业者常常低估的概率乘法、让情况雪上加霜的相关性效应,以及防止生产环境中乘法式崩溃的架构模式。

ai-engineering
reliability
production
architecture
·tian

为 Agentic 写入路径构建数据质量门禁:输入是垃圾,输出是不可逆的操作

拥有写入权限工具的 Agent 会将上游的数据质量问题直接转化为现实世界的副作用。本文将介绍防止此类问题的验证架构。

insider
ai-engineering
agents
reliability
+1
·tian

优雅地下架 AI 功能:如何在不损害用户信任的情况下弃用模型驱动的功能

弃用一个 AI 功能不像删除一个按钮——用户围绕模型个性、输出结构和行为特征构建了工作流。这里提供了一个四阶段生命周期,用于在不引发用户流失的情况下退出模型驱动的功能。

ai-engineering
llm
product
reliability
·tian

语法约束生成:大多数团队忽视的输出可靠性技术

约束解码在token级别保证LLM输出符合schema——从根本上消除验证重试循环。本文介绍其工作原理、大多数团队为何忽视它,以及它真正存在问题的场景。

llm
structured-outputs
reliability
inference
+1
·tian

隐性 API 契约:你的 LLM 供应商没有写在文档里的那些事

LLM 供应商保证正常运行时间和延迟 SLA,但不保证你的提示词下个月仍能产生相同输出。工程师需要了解关于隐性行为契约的哪些内容,以及如何针对它进行测试。

llm
production
reliability
testing
+1
·tian

生产环境中的 LLM 置信度校准:衡量与解决过度自信问题

那些声称 “我非常有信心” 的 LLM 往往就在那个点上出错。本文探讨如何衡量校准误差、为什么 RLHF 会让情况变得更糟,以及真正有效的生产环境设计模式。

llm
production
reliability
calibration
+1
·tian

模型 EOL 倒计时:将供应商 LLM 视为外部依赖项管理

每个锁定的模型版本都有一个你无法控制的弃用日期。本文介绍如何将供应商 LLM 视为外部依赖项,在通知到来之前就内置行为回归测试套件、EOL 处置手册和迁移测试框架。

insider
llm
production
devops
+1
显示第 217–228 篇,共 278 篇