浏览器原生 AI 是一项针对具体功能的决策:你的团队尚未权衡的四个维度
浏览器原生 AI 并非更快的 TensorFlow.js。它是一个具有四个维度权衡(延迟底线、隐私、设备碎片化、能力上限)的差异化运行时,无法简单归结为一个标准答案。
检索膨胀:当“加个 RAG 就行”变成架构上的干扰
通过添加检索步骤来修复每个模型失败看似是进步,直到你的系统变成一堆检索器的堆砌,拼凑出的提示词依然无法解决原始问题。本文提供了一套针对 RAG 的诊断框架、消融实验准则和复杂度预算。
智能体完成任务时房间已空:异步后台任务中的过时上下文交付
延迟 90 秒完成任务的异步智能体往往会交付用户已经不再关心的答案。解决方法在于“交付时相关性网关”,而非更快的模型。
智能体记忆漂移:为什么一致性对齐是你缺失的关键环
长期运行的智能体在停止观察的那一刻起就与世界脱节。应将记忆视为数据库副本:使用水位线 (watermarks)、变更摘要 (change feeds) 和惰性重校验。
批次层推理之问:当 50% 的折扣重塑你的架构时
提供商的批次 API 将推理成本降低了一半,但也重塑了工程契约:作业级幂等性、新鲜度边界、延迟结果的可观测性,以及一个分层感知的决策矩阵——它能将 30–50% 的 LLM 支出重新路由到那些用户从未在等待的工作负载上。
护栏系统的自研与外购:内容审查 API 已成为安全关键路径上的核心依赖
托管的内容审查 API 将你的安全控制转变为一个同步的外部依赖 —— 本文将探讨自研与外购的决策、故障开启 (fail-open) 与故障关闭 (fail-closed) 之间的权衡,以及如何通过集成规范确保处于安全关键路径上的供应商不会绑架你的事件响应流程。
聊天历史是数据库。别再把它当成滚动回溯了。
将对话历史视为滚动回溯(Scrollback),是智能体在第 8 轮对话后就开始跑题,以及上下文费用呈超线性增长的原因。解决办法是回归其本质——一个读密集型数据库——并据此进行设计。
你的智能体有两条发布流水线,而非一条
智能体提示词和智能体工具在磁盘上看起来像是同一种资产,但它们的失效方式完全不同 —— 通过同一条流水线发布它们,是导致大多数智能体事故的根本性架构错误。
确定性预算:将随机性视为按层面的分配,而非全局开关
温度不是一个全局开关。应按层面分配随机性——路由、解析、合成、生成、探索——否则你将为不需要的方差付出代价。
重新规划而非重试:为什么大多数智能体错误并非瞬时性的
大多数智能体框架在工具错误时默认使用指数退避重试 —— 这种模式借用自无状态的 HTTP,但在有状态的规划循环中是完全错误的。正确的默认做法应该是重新规划。
投机采样(Speculative Decoding)是一项流式传输协议决策,而非推理优化
投机采样(Speculative Decoding)承诺在保持模型输出一致的前提下实现 3-6 倍的加速,但这种保证仅限于离开推理引擎的 Token —— 而非已经展示给用户的字节。当你通过流式传输尚未验证的草稿 Token 时,被拒绝的后缀必须撤回。哪些界面能够容忍撤回是一项产品决策,而推理团队往往很少考虑到这一范围。
系统提示词作为代码、配置或数据:影响全局的架构决策
大多数团队在选择系统提示词的存储位置时非常随意,随后却要在数年内为此承担后果。在代码、配置和数据存储之间的选择会直接影响部署频率、评估范围和租户灵活性 —— 这里有一套在 MVP 阶段前就应应用的框架。