跳转到主要内容

65 含有标签「distributed-systems」

Posts tagged "distributed-systems" on TianPan.co.

查看所有标签

·tian

幂等性危机:LLM 智能体作为事件流消费者

至少一次投递假设重新处理同一事件会产生相同结果,但 LLM 不会。本文是关于幂等性键、去重窗口以及 AI 驱动的 Kafka 消费者补偿读模型的实践指南。

insider
ai-engineering
kafka
event-driven
+2
·tian

Agent 链中的截止时间传播:第三跳时你的 p95 SLO 发生了什么

用户可见的延迟约束在穿越多步 agent 管道时悄然消失。本文剖析这一结构性问题,分析主流框架的处理方式(并不理想),以及能真正解决问题的截止时间传播模式。

insider
agents
latency
slo
+2
·tian

LLM 速率限制是一个分布式系统问题

LLM API 速率限制的行为类似于分布式锁 —— 批处理作业通过饥饿、队头阻塞和优先级反转,静默地使面向用户的流程陷入饥饿,而此时你的错误仪表盘依然显示正常。

llm
distributed-systems
rate-limiting
infrastructure
+1
·tian

多区域 LLM 服务:没人警告过你的缓存局部性问题

在不同区域部署 LLM 推理会产生无状态 HTTP 服务所没有的一致性和延迟问题。本文将介绍一种既能解决这些问题,又不会让你的运维负担增加三倍的路由架构。

insider
llm
infrastructure
mlops
+2
·tian

多用户共享 AI 会话:尚无人解决的并发难题

当多个用户同时共享单个 AI 上下文时,标准的分布式系统假设就会失效。本文将探讨为什么多用户 AI 会话在架构上难以实现,以及生产团队为了解决这一问题所构建的方案。

ai-engineering
distributed-systems
collaboration
llm-infrastructure
·tian

当你的 AI Agent 从 Kafka 消费数据时:那些失效的设计假设

在消息队列上运行 AI Agent 会打破队列语义中固有的假设。本文将探讨当消费者具有随机性时,幂等性、顺序性和背压机制如何发生变化。

insider
ai-agents
event-driven
kafka
+1
·tian

多用户共享智能体状态:你真正需要的并发原语

大多数智能体设计假设每个会话只有一个用户。共享工作区需要分布式系统原语,以防止并发用户发出相互矛盾的指令时发生无声数据损坏。

ai-engineering
agents
distributed-systems
concurrency
·tian

主动型 Agent:后台 AI 的事件驱动与定时自动化

绝大多数 Agent 设计文章都假设由人类触发执行。而生产环境中的 AI 越来越多地在后台运行——基于定时调度、变更事件和系统状态转换。这在架构层面改变了什么?

insider
ai-engineering
agents
event-driven
+1
·tian

智能体系统中的写放大:为什么一次工具调用会命中六个数据库

智能体的一次记忆操作会同时触发对六个存储系统的写入。当第五个写入失败时会发生什么——以及来自数据库内部的预防模式。

insider
agent-architecture
infrastructure
distributed-systems
+1
·tian

异步 Agent 的静默失败:为何你的 AI 任务悄然终止却无人察觉

异步 AI 任务会静默而自信地失败——HTTP 200,仪表盘一片绿,客户最终投诉才发现。本文介绍死信队列、幂等键和 Saga 日志如何从传统分布式系统迁移到 AI Agent 场景以解决这一问题。

insider
ai-agents
observability
distributed-systems
+1
·tian

零停机 AI 部署:这是一个分布式系统问题

大多数团队将 Prompt 更新视为配置更改。事实并非如此 —— 它们是具有四个独立迁移面的生产部署。这里有一个分布式系统框架,可以在模型升级、Prompt 迭代和工具 Schema 更改期间保持 AI 系统的可靠性。

deployment
ai-engineering
llmops
distributed-systems
·tian

AI Agent 的 CAP 定理:为何你的 Agent 在本该优雅降级时却彻底崩溃

大多数 AI Agent 在单个工具宕机时会彻底崩溃——这与分布式数据库几十年前已解决的一致性与可用性权衡如出一辙。本文探讨如何设计部分可用路径。

ai-agents
distributed-systems
reliability
system-design
显示第 37–48 篇,共 65 篇