跳转到主要内容

68 含有标签「testing」

Posts tagged "testing" on TianPan.co.

查看所有标签

·tian

测试不可测之物:LLM 驱动 API 的集成契约

确定性测试套件无法应对非确定性的 LLM 输出。学习基于属性的测试、行为不变量断言和语义快照策略,在不引入脆弱性的情况下获得回归覆盖。

insider
llm
testing
ai-engineering
+1
·tian

AI 的测试金字塔倒置:为什么单元测试是 LLM 功能的错误投资

经典测试金字塔在 LLM 功能上失效的原因、提示词级单元测试为何带来虚假信心,以及与 AI 故障实际分布相匹配的测试分配策略。

insider
ai-engineering
testing
llm
+2
·tian

Eval 异味目录:让你的 LLM 评估套件比没有评估还糟糕的反模式

一份关于毒害 LLM 评估套件的反模式实战指南 —— 包括数据污染、脆弱的断言、评估腐化、评委合谋、虚荣聚合指标 —— 以及在无需重写整个测试框架的情况下恢复有效信号的重构模式。

insider
ai-engineering
evaluation
llm
+2
·tian

隐性 API 契约:你的 LLM 供应商没有写在文档里的那些事

LLM 供应商保证正常运行时间和延迟 SLA,但不保证你的提示词下个月仍能产生相同输出。工程师需要了解关于隐性行为契约的哪些内容,以及如何针对它进行测试。

llm
production
reliability
testing
+1
·tian

让合成评估数据保持真实

用 LLM 生成自己的测试用例会制造一个令人满意却具有误导性的反馈循环。以下介绍对抗性注入、人工标注分流和多样性差距分析如何修复合成评估的结构性盲点。

ai-engineering
evaluation
llm
testing
·tian

多会话评估设计:捕捉随时间推移而恶化的 AI 功能

单轮评估往往会忽略那些只有在状态累积后才会出现的 AI 故障。本文将探讨如何设计多会话评估框架、衰减曲线和回归方法,在用户流失之前捕捉到质量腐烂。

ai-engineering
evaluation
llm-memory
observability
+1
·tian

Agent 测试金字塔:为什么 70/20/10 的分层对 Agentic AI 行不通

经典的单元/集成/端到端测试金字塔建立在廉价、快速、确定性单元的假设之上。而 LLM Agent 打破了所有这些假设。本文探讨真正可行的测试策略是什么样的。

insider
ai-agents
testing
llm
+1
·tian

为什么你的 AI 演示总是优于最终上线表现

AI 演示在精心挑选的输入下得分很高。而生产环境的流量更杂乱、更广泛,并且充满了团队从未预料到的边缘情况。本文将探讨这种差距产生的原因,并提供在发布前缩小差距的方法论。

llm
evaluation
production-ai
testing
·tian

行为契约:编写工程师真正能测试的 AI 需求

传统的验收标准在随机 AI 系统上会失效。四字段行为契约格式——输入类、期望行为、失败预算、测试预言机——为工程师提供了真正可衡量的依据。

ai-engineering
llm
testing
product-requirements
·tian

集成测试的幻象:为什么模拟工具输出会隐藏智能体的真实失败模式

基于模拟数据构建的智能体永远不会遇到在生产环境中棘手的失败:分页死循环、序列中途的频率限制、部分成功响应以及 Schema 歧义。以下是你可以采取的对策。

ai-engineering
testing
agents
reliability
·tian

你的 LLM 评估套件中的古德哈特定律:当优化分数破坏系统时

团队如何在无意中博弈自己的 LLM 评估,为什么基准分数与生产质量的偏差比你预期的更快,以及保持评估套件诚实的元评估实践。

evaluation
llm
ai-engineering
testing
·tian

AI Agent 的混沌工程:在生产环境之前注入你的 Agent 将真正面对的故障

LLM API 调用在生产环境中有 1-5% 的失败率。对于每个任务需要进行数十次工具调用的多步骤 Agent,未经测试的故障模式会变成面向客户的 bug。本文提供故障注入类别、框架设计和基准测试结果的实用指南,帮助构建弹性 AI Agent。

insider
chaos-engineering
ai-agents
reliability
+2
显示第 49–60 篇,共 68 篇