·tian
LLM 系统的基于属性的测试:即便输出多变也需遵循的不变量
评估数据集告诉你你的 LLM 是否通过了一组固定的示例。而基于属性的测试则告诉你它是否在整个输入空间内都遵守契约。本文将介绍如何将其应用于非确定性系统。
llm
testing
engineering
ai
·tian
智能体测试的模拟环境:构建代价为零的沙箱
“看起来像生产环境” 的预发布环境往往误导性大于指导意义。本文将介绍如何构建模拟环境,让智能体在伪造的基础设施上执行真实操作,并阐述为什么只模拟不可逆工具是投资回报率最高的方法。
ai-agents
testing
infrastructure
devops
·tian
组合测试鸿沟:为什么你的智能体通过了每一项测试却在协作时失败
67% 的多智能体系统故障源于智能体之间的交互,而非单个智能体的缺陷。本文提供了针对组合式智能体流水线的实用指南,涵盖基于属性的不变量、轨迹回放、接缝注入和契约测试。
insider
multi-agent
testing
reliability
+1·tian
如何在 CI 中对 AI Agent 工作流进行集成测试,而无需完全 Mock 模型
一种针对 AI Agent 的三层 CI 测试架构,既能避免实时 API 调用产生的成本,也能避免完全 Mock 模型带来的空洞感 —— 通过使用 StubLLM 测试替身、VCR 录制回放以及工具契约测试,在编排 Bug 进入生产环境前将其捕获。
insider
ai-agents
testing
ci-cd
+1·tian
代理系统的非确定性 CI:为什么二进制的通过/失败模式会失效,以及取而代之的是什么
当每次测试运行都具有非确定性时,二进制的通过/失败 CI 就会失效。统计判定、分级阈值、轨迹指纹识别和序列分析可以在不让团队陷入虚假失败的情况下,捕捉真实的代理回归。
insider
ai-agents
ci-cd
testing
+2·tian
LLM 应用的测试驱动开发:类比成立与失效之处
大多数团队在编写提示词之后才编写评估——这注定了评估的薄弱。本文将介绍评估优先开发的工作原理,以及 TDD 类比在 LLM 领域失效的四个地方。
llm
evals
testing
ai-engineering
·tian
评估 AI Agent:为什么只看结果会误导你
一份关于 AI Agent 评估的实操指南,涵盖了结果评分与多步轨迹评分 —— 包含评分器类型、pass@k 与 pass^k 的对比、评估框架设计,以及导致评估计划失败的组织陷阱。
ai-agents
evaluation
llm
testing
+1·tian
你的 AI 产品需要评估系统
大多数 AI 产品失败并非因为模型本身,而是因为缺乏评估系统。本文提供一份实用指南,教你如何构建评估系统,从单元测试到人工评审再到 A/B 测试——以及为什么尽早开始会带来复合收益。
ai-engineering
evals
llm
testing
+1显示第 61–68 篇,共 68 篇
上一页6 / 6