博客
来自AI智能体经济的洞见、分析与更新。 按标签浏览.
微调通常是错误的选择:大语言模型定制决策框架
大多数团队过早地尝试微调。这里有一个基于基准测试和生产案例的实用决策框架,探讨了提示工程何时优于微调,何时不优于微调,以及每种方法的真实经济成本。
为智能体编写工具:ACI 与 API 同等重要
你如何为 AI 智能体设计工具 —— 包括 Schema、描述、返回值和错误信息 —— 直接决定了智能体的可靠性。本指南将教你如何像对待任何生产级 API 一样严肃地对待 “智能体-计算机接口” (ACI)。
生产环境中的工具调用:循环、陷阱与实战方案
一份关于在生产环境 LLM 系统中进行工具调用的实用指南 —— 涵盖代理循环、并行执行格式规则、编写有效的工具描述、使用 is_error 进行错误恢复,以及工具何时会增加延迟而无实际价值。
LLM 路由与模型级联:如何在不牺牲质量的情况下降低 AI 成本
将每个查询都交给顶级模型处理是团队在 AI 上超支最常见的原因。LLM 路由和模型级联可以在保持 95% 质量的同时降低 45–85% 的成本 —— 本文将介绍这些模式在生产环境中的实际运作方式。
为什么多智能体系统会在接缝处断裂:设计可靠的交接机制
生产环境中的多智能体系统故障往往发生在智能体之间的边界处,而非其内部。本文深入分析了三种主要的故障模式以及防止这些故障的工程模式。
APM 仪表盘不会告诉你:生产环境中的 LLM 可观测性
生产环境中的 LLM 系统往往在无声中失效 —— 绿色仪表盘背后隐藏着幻觉、提示词漂移和错误的工具选择。本文将介绍一种真正能发现问题的埋点模型。
生产环境中的推理模型:何时获益,何时受损
推理模型可以解决指令模型无法处理的问题 —— 但如果使用不当,成本会增加 10 倍,且每个请求会增加 10 秒的延迟。以下是你该如何权衡利弊的思考。
生产环境中的 LLM 延迟:哪些手段真正能见效
对 LLM 延迟进行的实用解析——涵盖 Prefill 与 Decode 阶段、流式传输、KV 缓存策略、投机采样,以及为了加速交付 AI 应用需要衡量哪些关键指标。
超越 JSON 模式:在生产环境中获取可靠的 LLM 结构化输出
仅靠提示词的 JSON 提取在生产环境中会有 5–20% 的失败率。本文深入解析了从 JSON 模式到约束解码的全部四代结构化输出技术,并提供了库推荐和模式设计规则。
为什么长任务 AI Agent 会在生产环境中失败(以及修复它们的底层架构)
长任务 AI Agent 的失败方式往往是可预见的:复合错误率、同步超时、非幂等重试以及缺乏人工干预计划。本文将介绍如何构建真正可靠的底层架构。
关于在生产环境运行 MCP,没人告诉你的那些事
一份关于 MCP 隐藏生产挑战的实用指南 —— 涵盖传输协议选择、工具 Schema 设计、工具投毒攻击,以及真正可扩展的网关模式。
生产环境中的 LLM 防护栏:为什么单层防护永远不够
5 个准确率为 90% 的防护栏仅能为你提供 59% 的系统正确率。这是一份关于分层防护栏架构的实用指南——涵盖输入和输出验证、工具选择、延迟权衡,以及为什么复合错误率是隐藏的失败模式。