跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

提示词-模型耦合陷阱:为何你的提示词只会说一种模型的「方言」

精心调优的提示词会悄然积累对特定模型行为的依赖——JSON格式化怪癖、指令层级、拒绝阈值——这些依赖在迁移日才会爆发。本文介绍如何构建可移植性测试框架并编写低耦合提示词。

prompt-engineering
llm
model-migration
ai-engineering
·tian

LLM 输出的基于属性的测试:发现你的评估集从未想过的 Bug

精心策划的评估集仅编码了你预想到的失败模式。基于属性的测试通过生成数千个对抗性输入变体,来发现测试套件在结构上无法触及的领域边界处的 Bug。

testing
llm
evaluation
ai-engineering
·tian

掩盖检索器 Bug 的 RAG 评估反模式

大多数团队采用端到端的方式评估 RAG 系统,这使得生成器掩盖了检索环节的失败。本文将介绍如何构建一个专门针对检索器的评估框架,在错误累积之前发现其中的 Bug。

insider
rag
evaluation
retrieval
+1
·tian

Schema 优先的 AI 开发:在编写提示词之前先定义输出契约

原始的 JSON 提示词在生产环境中往往有 15–20% 的失败率。Schema 优先的开发模式——即在编写提示词之前定义输出契约——能将这一比率降至接近于零。这种方法现在已成为每个自动化 LLM 流水线的正确默认选择。

insider
llm
structured-outputs
ai-engineering
+1
·tian

语义化版本控制对 AI 智能体意味着什么

当你的服务具有非确定性时,传统的语义化版本控制就会失效。本文介绍如何对 AI 智能体进行版本管理,以避免下游消费者遭受静默破坏。

ai-engineering
agents
api-design
testing
+1
·tian

你团队的基准测试正在互相欺骗:共享评估基础设施的污染问题

共享评估基础设施通过缓存补全、顺序运行污染和提示词状态渗漏悄无声息地破坏基准测试结果——而大多数团队从未察觉。本文介绍修复这一问题的技术和组织控制措施。

insider
ai-engineering
evaluation
infrastructure
+1
·tian

杀死你的 AI 系统的三种隐藏债务

提示词债务、评估债务和嵌入债务是每个 AI 系统中悄然积累的三大隐性负债。本文将探讨它们如何相互作用,以及如何在不进行全面重写的情况下解决每种债务。

ai-engineering
llmops
technical-debt
mlops
+1
·tian

测试不可测之物:LLM 驱动 API 的集成契约

确定性测试套件无法应对非确定性的 LLM 输出。学习基于属性的测试、行为不变量断言和语义快照策略,在不引入脆弱性的情况下获得回归覆盖。

insider
llm
testing
ai-engineering
+1
·tian

AI 的测试金字塔倒置:为什么单元测试是 LLM 功能的错误投资

经典测试金字塔在 LLM 功能上失效的原因、提示词级单元测试为何带来虚假信心,以及与 AI 故障实际分布相匹配的测试分配策略。

insider
ai-engineering
testing
llm
+2
·tian

Token 是有限资源:复杂 Agent 的上下文预算分配框架

如何将上下文窗口视为稀缺的计算预算,在系统提示、记忆注入、工具结果和暂存空间之间进行显式分配——以及在任务执行中途耗尽预算时对 agent 可靠性的影响。

insider
ai-engineering
llm
agents
+2
·tian

AI 辅助故障响应:LLM 如何在不取代 SRE 手册的情况下改变它

值班工作流中的 AI 副驾驶可以浮现关联信号、起草运行手册操作——但它们引入了传统 SRE 没有受过训练去识别的故障模式。这是一份将 LLM 整合进故障响应而不让故障更难处理的实践指南。

sre
incident-response
llm
observability
+1
·tian

AI 功能退役取证:被废弃的功能教给我们的经验,是成功功能无法企及的

你的公司悄悄关停的 AI 功能中,隐藏着你下一次发布时会遇到的失败模式。本文提供了一个取证模板、先行指标目录,以及如何解读被废弃功能留下的证据。

insider
ai-engineering
ai-product
post-mortem
+2
显示第 661–672 篇,共 834 篇