博客
来自AI智能体经济的洞见、分析与更新。 按标签浏览.
魔法时刻问题:AI 功能引导为何失败,以及如何修复
前五分钟决定用户是否会持续使用你的 AI 功能。这里是真正能将怀疑者转化为用户的引导流程背后的工程设计。
最小足迹原则:自主 AI 智能体的最小权限设计
设计自主 AI 智能体时,应仅请求当前任务所需的权限——通过临时凭证、意图感知访问配置和隔离执行,将 Unix 最小权限原则应用于智能体系统。
压缩决策:延迟敏感型 AI 功能的量化、蒸馏与端侧推理
当模型路由已不够用,你需要低于 100ms 的响应时间时,就面临一个艰难的压缩决策。本文介绍如何在不破坏关键任务质量的前提下,权衡量化、蒸馏和混合边缘云部署。
多区域 LLM 服务:没人警告过你的缓存局部性问题
在不同区域部署 LLM 推理会产生无状态 HTTP 服务所没有的一致性和延迟问题。本文将介绍一种既能解决这些问题,又不会让你的运维负担增加三倍的路由架构。
多租户 LLM 问题:规模化部署中的嘈杂邻居、隔离与公平性
当数千名用户共享同一模型和向量索引时,一次高消耗的会话会拖慢所有人。本文解释了为何多租户 LLM 基础设施比数据库更难处理——以及真正有效的公平性保障方案。
多轮对话会话状态坍缩问题
为什么单轮 LLM 故障很容易被发现,而多轮会话状态在 10 轮以上后会悄悄损坏 —— 以及防止 “AI 忘了我是谁” 这种失效模式的检查点、压缩和监控模式。
多用户共享 AI 会话:尚无人解决的并发难题
当多个用户同时共享单个 AI 上下文时,标准的分布式系统假设就会失效。本文将探讨为什么多用户 AI 会话在架构上难以实现,以及生产团队为了解决这一问题所构建的方案。
AI 系统值班:当 Bug 是模型时的事故响应手册
当故障源于非确定性的模型行为时,标准的值班手册就会失效。本文提供了一个实用的框架,用于检测、分类和遏制 AI 事故 —— 从护栏绕过到成本爆炸 —— 这些手册专为工程师而非 ML 研究人员打造。
没人会写的 AI 系统 On-Call 运维手册
当故障模式是概率性的模型行为而非服务崩溃时,传统的 SRE 运维手册就会失效。本文将探讨 LLM 驱动系统的事故响应究竟是怎样的,以及哪些信号值得告警。
端侧 LLM 推理:何时将 AI 迁出云端
一个关于端侧 LLM 推理何时优于云端 API 的实用决策框架 —— 涵盖隐私需求、成本计算、质量权衡以及那些无人预警的部署难题。
如何在不破坏学习路径的前提下,让工程师快速上手 AI 生成的代码库
AI 编程工具虽然加快了功能交付,但也在无形中削弱了新工程师通过阅读代码建立系统直觉的能力。本文将探讨如何在不降低交付速度的情况下,恢复学习机制。
试点坟场:为什么企业级 AI 落地在演示后会失败
88% 的企业级 AI 试点从未进入生产阶段。问题不在于模型 —— 而是在演示之后发生的一切。本文将从从业者的角度拆解,为什么那些引人入胜的 POC 会止步于 12% 的 WAU,以及如何修复这一问题。