博客
来自AI智能体经济的洞见、分析与更新。 按标签浏览.
值班负担的转移:AI 功能如何打破你的事故响应手册
AI 功能引入了传统监控无法检测的故障模式——静默退化、服务商侧变更、提示词注入。本文是针对非确定性系统重建值班实践的实用指南。
LLM 流水线中的 PII:那些你不知道直到为时已晚的数据泄漏
个人数据是如何悄无声息地通过提示模板、上下文窗口、可观测性工具和 RAG 流水线泄漏的——以及真正能阻止这种泄漏的工程模式。
合理补全陷阱:为什么代码智能体会生成看似正确实则错误的代码
代码智能体生成的代码能够编译、通过Lint检查、看起来正确,但却在悄无声息地做着错误的事。这里揭示了训练目标为何从根本上导致这一问题,数据说明了什么,以及如何构建真正能发现问题的验证循环。
提示注入攻击面映射:在攻击者之前找到每一个攻击向量
一份实践者方法论:枚举每一个到达 LLM 提示的外部数据源,对每个注入面进行风险评分,并在不破坏模型推理能力的前提下应用正确的净化模式。
LLM 系统的基于属性的测试:即便输出多变也需遵循的不变量
评估数据集告诉你你的 LLM 是否通过了一组固定的示例。而基于属性的测试则告诉你它是否在整个输入空间内都遵守契约。本文将介绍如何将其应用于非确定性系统。
供应商锁定深度分析:导致更换 LLM 供应商变成 6 个月工程项目的七个耦合点
从提示词语法、工具调用 Schema 到嵌入空间和计费模型,这七个隐藏的耦合点解释了为什么更换 LLM 供应商需要数月而非数天。本文提供了一个实用的审计框架,帮助你主动管理锁定风险。
并发智能体系统中的竞态条件:那些看起来像幻觉的 Bug
并行子智能体会以一种看起来完全像模型幻觉的方式静默地损坏共享状态。以下是生产环境智能体系统中读-改-写竞态的工作原理、哪些分布式系统原语能解决它们,以及区分并发 bug 与真正模型故障的检测手段。
合并再调用:无需降低用户体验即可削减成本的 LLM 请求批处理模式
请求合并是一种分层架构——飞行中去重、精确缓存和语义批处理——可在不降低用户体验的情况下将 LLM 推理成本降低 40–60%。本文介绍如何实现以及在哪些地方会遇到问题。
Schema 驱动的 Prompt 设计:让你的数据模型主导 Prompt 结构
你的实体 Schema 形态直接决定了 LLM 输出的可靠性。了解规范化、嵌套深度、字段排序和枚举约束如何影响幻觉率 —— 以及掌握让 Prompt 到输出的映射更具可预测性的重构模式。
智能体测试的模拟环境:构建代价为零的沙箱
“看起来像生产环境” 的预发布环境往往误导性大于指导意义。本文将介绍如何构建模拟环境,让智能体在伪造的基础设施上执行真实操作,并阐述为什么只模拟不可逆工具是投资回报率最高的方法。
非确定性系统的 SLO:当每次响应都不同时如何定义可靠性
传统 SLI(如延迟和错误率)无法捕捉 AI 系统的主要故障模式——执行正确但答案错误。本文提供了一套实用框架,涵盖语义 SLO、85% 基线下的错误预算,以及能区分真实退化和正常波动的告警架构。
投机解码实战:那顿并非免费的午餐
投机解码如何通过小模型起草 token 并行验证,将 LLM 推理延迟降低 2-3 倍——以及草稿模型选择的数学原理、批处理大小的权衡和生产环境中决定你是获得加速还是减速的那些陷阱。