跳转到主要内容

278 含有标签「reliability」

Posts tagged "reliability" on TianPan.co.

查看所有标签

·tian

禁用开关才是真正的产品:设计非 AI 回退路径

大多数 AI 功能自带的禁用开关只会返回错误。请将“关闭状态”视为一个真正的产品,配备功能级标志、确定性回退机制,并采用与“开启状态”相同的评估准则。

ai-engineering
reliability
product-design
feature-flags
+1
·tian

Eval-as-Code:当你的发布门禁只是某人笔记本电脑上的一个 Notebook

决定你的模型是否发布的数字竟然存在于某人笔记本电脑上的一个 Notebook 中。你应该像对待生产系统一样对待评测套件 —— 对其进行版本化、设置准入规则并提供 SLO。

evals
llmops
ci-cd
ai-engineering
+1
·tian

回退级联:为什么你的 AI 功能需要五种故障模式,而非一种

将模型故障视为二元成功/失败事件的 AI 功能距离灾难仅一步之遥。从前沿模型到人工介入的五级回退级联(Fallback Cascade),能确保在单个层级发生故障时,你的功能依然可用。

insider
ai-engineering
reliability
production
+1
·tian

当你的智能体意见相左:并行AI系统的冲突解决模式

并行智能体产生相互冲突的输出不是边缘情况——在规模化场景中这是必然发生的。以下是防止静默分歧产生错误决策的模式。

multi-agent
reliability
agent-design
production-ai
·tian

长时 Agent 会话中的人格漂移:为什么你的 Agent 会忘记自己是谁

经过 8–12 轮对话后,Agent 人格自一致性下降超过 30%。以下是 Transformer 注意力机制导致 Agent 偏离系统提示词的原因,以及三种真正有效的生产级解决模式。

agents
reliability
context-engineering
llm
+1
·tian

你的 LLM 网关缺少的长尾容错重试策略

将微服务默认的重试机制应用于 8 秒的 LLM 调用,会显著拉高 P99 延迟,在供应商故障期间白白消耗 Token,并掩盖一个用户可见的延迟悬崖,而网关仪表盘对此却毫无察觉。

llm
latency
gateway
reliability
·tian

Brownout 模式:当你的 LLM 供应商响应迟缓而非宕机时

供应商的可用性是连续的,而非二元的。你的回退链条能处理显而易见的宕机,却往往忽略了那些在数小时内悄悄消磨用户信任的 Brownout 现象(响应迟缓)。

reliability
llm-ops
agents
observability
·tian

工具调用顺序是偏序,而非集合

大多数生产环境中的 Agent 将其工具集视为一个无序的能力包。实际上,它是一个偏序关系,而 Bug 就隐藏在那些无人声明的依赖边界中。

insider
agents
llm
evals
+1
·tian

作为 Cron 任务的智能体:当定时触发优于对话循环时

大多数生产环境中的智能体其实是伪装成聊天界面的后台任务。本文将探讨为什么定时触发、状态检查点和有界信封在成本、可靠性以及可操作性方面优于对话循环。

ai-agents
architecture
reliability
llm-ops
+1
·tian

Agent 降级模式规范是你没有撰写的文档

大多数生产环境中的 Agent 都有降级模式规范——它只是散布在零散的 catch 代码块中,从未经过测试,而客户会在下一个糟糕的日子里为你写下它的公开版本。

agents
reliability
slo
eval
·tian

智能体灾难恢复:当工作记忆随区域一同失效时

智能体运行时将状态隐藏在你的灾难恢复(DR)手册从未提及的地方。解决方案是:明确状态范围、在任务作用域内生成幂等键、在每次工具调用前设置检查点,并优先选择安全中止(fail-safe abort)而非向前重放(fail-forward replay)。

insider
ai-engineering
reliability
disaster-recovery
+1
·tian

Demo 只是一个随机种子:为什么你的 AI 发布面临的是方差问题,而非润色问题

那个令人惊叹的 Demo 只是模型针对同一输入生成的数千种可能性中的一次实现。产品发布之所以受挫,并非因为缺乏“润色”,而是因为没人测量过方差。本文将介绍如何通过 n-of-k 采样、最坏情况输入库和分布偏移检查清单来弥补这一差距。

insider
ai-engineering
evaluation
reliability
+1
显示第 133–144 篇,共 278 篇