JSON 模式救不了你:生产环境 LLM 系统中的结构化输出故障
生产环境中的 LLM 结构化输出会以四种截然不同的方式失败,而 JSON 模式只能捕获其中一种。本文将详细解析语法、模式、语义和分布层面的故障,并介绍能够应对这四种故障的验证栈。
LLM 应用压力测试:为什么 k6 和 Locust 会误导你
传统的压力测试工具在测试 LLM API 时往往关注错误的指标。了解哪些指标才是真正重要的——TTFT、Token 间延迟、有效吞吐量(Goodput)——以及如何构建能够预测生产环境行为而非掩盖故障模式的测试。
评估与生产环境的差距:为什么测试套件的 92% 分数仅意味着 40% 的用户满意度
高评估分数与低用户满意度往往并存——本文将探讨为什么精心挑选的测试集会偏离真实流量,以及哪四个仪表化改进能真正弥补这一差距。
生产级 AI 系统中的时序推理失效
LLM 会自信地使用可能已经过时 12-30 个月的训练数据来回答有关“当前”事件的问题。本文将探讨陈旧性与幻觉的区别,为什么你无法通过提示工程来解决它,以及在生产环境中该如何应对。
LLM 应用的测试驱动开发:类比成立与失效之处
大多数团队在编写提示词之后才编写评估——这注定了评估的薄弱。本文将介绍评估优先开发的工作原理,以及 TDD 类比在 LLM 领域失效的四个地方。
Agent Harness 深度解析
深入剖析使 AI Agent 在生产环境中保持可靠的基础设施层 —— 包括执行循环、上下文管理、错误处理、安全护栏以及状态持久化,这些正是区分原型与上线系统的核心要素。
LLM 评估:什么才真正有效,什么是在浪费时间
一份面向从业者的 LLM 评估指南 —— 为什么错误分析先于基础设施、LLM-as-judge 何时有效、如何避免基准测试分数陷阱,以及为什么评估工作永无止境。
为什么你的 LLM 评估器失准了 —— 以及数据优先的修复方案
大多数团队在阅读数据之前就开始编写 LLM 评估标准 —— 这种本末倒置的做法正是评估器错过最关键失败案例的原因。数据优先的工作流、二元标签以及针对留出集的妥善验证可以从根本上解决这一问题。
生产级 LLM 系统的评估工程
如何构建真正能发现故障的 LLM 评估系统 —— 涵盖错误分析循环、评估成本层级、LLM-as-judge 方法论、CI/CD 集成以及 Agent 特有的陷阱。
从第一性原理设计智能体运行时
生产级智能体运行时并非简单的函数运行器 —— 它是一个执行基板。本文将从第一性原理出发,涵盖图执行模型、检查点、人机回环以及可观测性,教你如何正确设计一个智能体运行时。
为什么你的智能体应该编写代码,而不是 JSON
代码操作智能体 (Code-action agents) 让大语言模型 (LLM) 能够生成并运行 Python 而非 JSON —— 任务成功率提高 20%,LLM 往返次数减少 30%。本文将介绍它们的工作原理、局限性,以及如何在生产环境中安全地运行它们。
构建生成式 AI 平台:架构、权衡以及真正重要的核心组件
一份关于 LLM 周边基础设施层的实践指南,涵盖 RAG 流水线、模型网关、缓存策略、护栏和可观测性,以及何时应当真正引入这些组件。