跳转到主要内容

278 含有标签「reliability」

Posts tagged "reliability" on TianPan.co.

查看所有标签

·tian

智能体系统就是分布式系统:在遭遇惨痛教训前应用微服务经验

当今困扰多智能体 AI 系统的失败模式,其实是伪装成新问题的 2015 年分布式系统老问题。那些在构建智能体之前就内化了微服务经验的团队,正在交付更可靠的系统。

ai-engineering
agents
distributed-systems
reliability
·tian

AI 模型 API 是你看不见、固定不了、也追踪不到的软件依赖

基础模型 API 在没有语义化版本控制的情况下改变行为,从不出现在你的锁文件中,也不被 SBOM 工具追踪——以下是防止由此导致生产故障的规范实践。

ai-engineering
llmops
dependency-management
reliability
·tian

构建信任修复流程:当你的 AI 犯下显而易见的错误后该怎么办

一份关于在 AI 系统出现显性错误时设计信任修复流程的实践指南 —— 涵盖软失败与硬失败、优雅降级、撤销流程,以及真正衡量信任是否恢复的指标。

insider
ai
trust
reliability
+2
·tian

复合幻觉问题:多阶段 AI 流水线如何放大错误

在多阶段 AI 流水线中,幻觉不仅会持续存在,还会成倍增加。每个阶段都会将前一阶段的输出视为事实,从而将一个简单的错误事实演变成一个看似确凿却完全错误的最终答案。本文将探讨这一系统层面的问题及其解决方案。

insider
ai-engineering
llm
hallucination
+2
·tian

智能体的死信:当没有智能体能完成任务时该怎么办

消息队列通过死信队列解决了消息卡顿的问题。智能体系统也面临同样的问题,但其失败模式更加丰富 —— 本文将介绍如何适配这一模式。

insider
ai-agents
reliability
production-ai
+1
·tian

智能体链中的认知信任:不确定性如何在多步委托中累积

当编排器将任务委托给子智能体并接受其答案时,它同时继承了该智能体的错误。本文探讨认知信任与授权信任的区别、置信度为何会在智能体切换中危险地叠加,以及真正能解决这一问题的设计模式。

insider
ai-agents
multi-agent-systems
reliability
+1
·tian

AI 系统中的功能交互故障:当两个正常运行的组件结合时发生崩溃

通过了每一项单独测试的 AI 功能,在组合使用时可能会悄无声息地失效。本文将介绍如何在用户发现之前审计这些接缝处的风险。

insider
ai-engineering
testing
reliability
+1
·tian

幽灵上下文:矛盾信念如何破坏长期运行智能体的记忆

持久化智能体记忆库会随时间积累相互矛盾的事实——而大多数系统会在不加警告的情况下同时检索它们。以下是该故障在生产环境中的表现及预防模式。

insider
ai-agents
memory
production-ai
+1
·tian

多模型共识:当单个 LLM 不足以进行最终签核时

大多数 AI 系统信任单个模型,且永远无法察觉系统性故障。多模型共识将输出路由至多个供应商系列的模型中,将分歧作为一种信号暴露出来,从而降低高风险决策中的尾部风险。

llm
ai-architecture
reliability
ensemble
·tian

超时感知的智能体设计:如何返回部分结果而非静默失败

大多数 AI 智能体在触达截止时间时会完全失败。本文介绍如何设计能够返回当前最优结果而非什么都不返回的智能体。

insider
agents
reliability
production
+1
·tian

AI 降级设计是架构问题,不是事后补丁

大多数 AI 功能只为顺利路径而设计。降级方案往往在第一次生产事故后才被临时拼凑——如果有的话。以下是如何在写第一个 prompt 之前就把这个问题解决掉。

ai-engineering
system-design
reliability
production
·tian

隐形的交接:为什么生产环境中的 AI 故障集中在组件边界上

大多数生产环境中的 AI 故障并不是发生在模型内部,而是发生在不可见的缝隙中 —— 即一个组件的输出变成另一个组件输入的交界处。本文将探讨如何发现并强化这些边界。

insider
ai-engineering
reliability
observability
+1
显示第 121–132 篇,共 278 篇