跳转到主要内容

65 含有标签「distributed-systems」

Posts tagged "distributed-systems" on TianPan.co.

查看所有标签

·tian

Agent 撤销按钮是 Saga,而非栈

多工具 Agent 撤销本质上是一个伪装的 Saga 模式问题。预计算逆操作、残留 UX 和级联限制决定了撤销是会成功,还是会在 40% 的情况下静默失败。

insider
ai-agents
saga-pattern
distributed-systems
+2
·tian

取消安全的智能体:你的“停止”按钮背后已经产生的副作用

“停止”只是一种 UI 手段,而非系统保证。这是一份针对取消安全智能体的从业者指南:持久化副作用账本、作用域授权、补偿操作,以及取消 UI 究竟应该显示什么。

insider
agents
reliability
distributed-systems
+2
·tian

重试放大:2% 的工具错误率如何演变成 20% 的智能体故障

智能体循环通过在多个步骤和 SDK 层级间叠加重试,将 2% 的工具错误率放大为 20% 的用户端故障。本文将解析其背后的数学原理、自我 DoS 模式,以及能够遏制这种现象的重试预算规范。

insider
agents
reliability
retry
+2
·tian

智能体集群并发:在没有死锁或惊群效应的情况下协调数十个智能体

LLM 智能体集群是一个小型分布式系统,而不是单个智能体的三十个副本。准入控制、AIMD 背压、熔断器和外部状态协调是防止并发集群自我崩溃的关键。

insider
ai-agents
distributed-systems
reliability
+2
·tian

数据回滚难题:如何撤销AI智能体写入生产环境的数据

当AI智能体以机器速度在分布式系统中写入生产数据时,传统数据库回滚机制就会失效。本文介绍使智能体写入状态可恢复所需的架构转变。

ai-agents
distributed-systems
data-reliability
production-engineering
·tian

AI智能体的CAP定理:当LLM成为瓶颈时,选择一致性还是可用性

当AI智能体的工具调用失败或LLM超时,你面临的权衡与分布式系统工程师从CAP定理中熟悉的如出一辙。大多数智能体框架默默选择了可用性——并在生产中为此付出代价。

ai-engineering
agents
distributed-systems
reliability
·tian

LLM 流水线中,幂等性是必选项

当输出具有随机性时,传统的幂等性机制将失效。本文介绍了在生产级 LLM 系统中防止重复执行、成本爆炸和状态机损坏的架构重构思路。

llm
production
reliability
distributed-systems
·tian

并行智能体系统中的隐性数据损坏问题

当并行智能体写入共享状态时,竞态条件会产生看起来完全像模型错误的隐性数据损坏。本文介绍如何诊断并使用借鉴自分布式数据库的模式来修复它。

insider
multi-agent
distributed-systems
memory
+1
·tian

无共享智能体:为水平可扩展性设计 AI 智能体

大多数 AI 智能体无法水平扩展,因为它们积累了将其绑定到单一机器的隐式状态。本文介绍解决这一问题的架构规范。

insider
agent-architecture
distributed-systems
scalability
+1
·tian

级联问题:为什么 Agent 副作用在大规模运行时会呈爆炸式增长

独立通过每一项单元测试的 Agent 在大规模部署时会导致级联副作用。本文将介绍其工程分类以及真正能防止这种情况的模式。

insider
ai-engineering
agents
production
+2
·tian

跨 Agent 服务边界的分布式追踪:上下文传播的断裂

当 Agent 跨微服务边界调用 Agent 时,W3C TraceContext 会发生断裂,追踪信息碎片化为不相关的 Span。本文介绍故障的技术形态以及修复方法。

insider
observability
agents
opentelemetry
+1
·tian

智能体工具调用中的幂等性问题

为什么智能体重试逻辑会导致重复扣款、重复发送邮件和状态不一致——以及如何通过Saga模式、幂等键和结构化错误信号从架构层面解决这一问题。

insider
ai-engineering
agents
distributed-systems
+1
显示第 25–36 篇,共 65 篇