跳转到主要内容

68 含有标签「testing」

Posts tagged "testing" on TianPan.co.

查看所有标签

·tian

无需标注的评估:在拥有标准答案前衡量 LLM 质量

一份在第一周 —— 即在你拥有标注数据之前 —— 衡量 LLM 输出质量的实用指南。涵盖了自我一致性、约束满足、行为不变性以及 LLM 作为裁判(LLM-as-judge),并探讨了每种方法的失效模式。

llm-evaluation
ai-engineering
testing
llm-ops
·tian

AI 应用的开发与生产环境一致性:预发布环境欺骗你的七种方式

预发布环境系统性地歪曲了 LLM 应用在生产环境中的表现。本文介绍了从 Prompt 缓存预热到隐蔽的流量分配漂移等七种特定的失效模式,以及发现这些问题的预发布检查方法。

llmops
production
testing
infrastructure
+1
·tian

长尾覆盖问题:为什么你的AI系统在最关键的地方失败

准确率和F1等聚合指标看起来很好,但你的AI系统可能在最重要的少数输入上悄然失败。如何在用户发现之前检测、衡量并修复长尾覆盖盲区。

evaluation
testing
production-ai
machine-learning
·tian

AI 系统的影子流量:在上线前验证模型变更的最安全方式

如何使用生产流量回放在变更影响用户之前验证 LLM 模型和提示词变更——以 A/B 测试一小部分成本获得信心所需的基础设施、指标与采样策略。

insider
ai-engineering
llm
production
+2
·tian

LLM 本地开发循环:在不耗尽 API 预算的情况下实现快速迭代

如何使用录制回放模式、确定性 Fixtures 和分层测试策略,为 LLM 应用构建快速的内部循环 —— 且无需在每次代码变更时耗费大量 API 预算。

insider
llm
testing
developer-experience
+1
·tian

模型弃用就绪:在 90 天倒计时之前审计你的行为依赖

当一个模型被弃用时,最难的部分不是更新 API 调用,而是发现系统所假设的所有隐形行为契约。以下是在时间耗尽前审计这些契约的方法。

insider
llm
production
mlops
+2
·tian

真正能阻断 PR 合并的提示词回归测试

大多数团队声称在测试他们的提示词。但几乎没有团队建立了能让构建失败的 CI 门控。这里有一个轻量级框架,可以在不烧掉 API 预算的情况下改变这一局面。

insider
ai-engineering
testing
ci-cd
+2
·tian

CI 流水线中的 AI 智能体:如何为无法单元测试的部署设置质量关口

传统的 CI/CD 基础设施并非为非确定性软件而设计。本文介绍如何为 LLM 驱动的功能添加有意义的部署质量关口,同时避免将流水线变成烧钱的评估农场。

ai-engineering
ci-cd
llm
testing
+1
·tian

非确定性服务的 API 契约:随机输出下的版本管理

传统 API 契约在封装 LLM 的服务中会失效。本文介绍如何对概率性系统进行版本管理、测试并维护向后兼容性。

insider
llm
api
engineering
+2
·tian

演示到生产的失败模式:为什么AI原型在真实用户到来时会崩溃

演示使用精心挑选的输入、预热缓存和有耐心的评估者。生产环境面对的是对抗性查询、分布偏移的请求以及8秒内就会放弃的用户。以下是缩小差距的预发布方法论。

insider
ai-engineering
production
testing
+1
·tian

LLM 输出的基于属性的测试:发现你的评估集从未想过的 Bug

精心策划的评估集仅编码了你预想到的失败模式。基于属性的测试通过生成数千个对抗性输入变体,来发现测试套件在结构上无法触及的领域边界处的 Bug。

testing
llm
evaluation
ai-engineering
·tian

语义化版本控制对 AI 智能体意味着什么

当你的服务具有非确定性时,传统的语义化版本控制就会失效。本文介绍如何对 AI 智能体进行版本管理,以避免下游消费者遭受静默破坏。

ai-engineering
agents
api-design
testing
+1
显示第 37–48 篇,共 68 篇