跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

“以后再加评估”的陷阱:测量债务如何产生复利效应

跳过评估能让你在一个季度内发布得更快,但接下来的四个季度会变慢。本文探讨了测量债务如何产生复利效应、早期的预警信号,以及防止这种偏移的组织级强制机制。

insider
evals
llm
ai-engineering
+2
·tian

人机回环 (HITL) 是一个队列,而队列具有动态特性

智能体工作流中的审批步骤表现得就像生产环境中的队列 —— 伴随着积压增长、陈旧性、疲劳感和优先级倒置。以下是如何设计能够承受规模化压力的 HITL 的方法。

insider
ai-engineering
hitl
agents
+2
·tian

“LLM 即编译器” 是一个你的代码库无法承受的隐喻

将 LLM 视为编译器正悄无声息地取消了那些让 AI 生成的代码库在渡过 “六个月之墙” 后仍能保持可维护性的纪律 —— 包括代码审查、重构和架构决策。

ai-engineering
ai-assisted-development
technical-debt
code-quality
+1
·tian

LLM-as-Judge 漂移:当你的评估器升级导致所有数据变动时

如果回归测试套件在没有任何提示词更改的情况下变红,通常问题出在裁判身上,而不是候选模型。本文探讨评估器漂移如何制造虚假的胜负,为什么固定裁判和校准频率至关重要,以及在评估元数据中应记录哪些内容以防止仪表盘数据误导。

llm-evaluation
llm-as-judge
ai-engineering
evals
+1
·tian

Markdown 优于 JSON:你正在支付却未察觉的输出格式税

严格的 JSON 模式在许多任务中悄悄削弱了推理准确率。本文将探讨解码时的机制,对比 Markdown、XML 和 JSON 之间的实测差距,并提供一个决策树,帮助你选择适合具体任务的格式。

insider
llm
prompt-engineering
structured-outputs
+1
·tian

飞行中转向:无需重启即可重定向长时运行的智能体

大多数智能体 UI 将每次航向修正都变成了完全重启。解决方案是架构层面的——检查点与注入、计划修订钩子以及软中断令牌——外加一套区分了修正、覆盖与取消的“三动词” UX 词汇表。

insider
agents
ai-engineering
ux
+1
·tian

评估通过,但工具全是 Mock 的:为什么你的 Agent 最棘手的生产故障从未进入测试框架

Mock 工具的评估让 CI 绿灯常亮,而生产环境却在一团糟。本文探讨了每个 Mock 默认做出的三个隐含假设,为什么评估通过率与事故率会发生背离,以及最终弥合这一差距的三级阶梯(Mock、录制回放、实时烟雾测试)。

ai-engineering
evaluation
agents
testing
+1
·tian

孤儿适配器难题:当你的微调模型寿命超过其基础模型时

绑定在已弃用基础模型上的微调适配器会变成生产环境中的“僵尸”——既承担核心负载又无法复现。一个持久的适配器生命周期需要与基础模型同步的重训频率、行为指纹测试,以及能够在团队更迭中存续的机构记忆。

insider
fine-tuning
lora
mlops
+2
·tian

模式匹配失败:当你的 LLM 流利地解决了错误的问题时

流利且扣题的 LLM 回答如果解决了错误的问题,是生产环境中最难处理的 Bug 类型。本文提供了一套实用的指南,用于检测表面特征过拟合,并设计能够揭示这些问题的提示词。

insider
llm
prompt-engineering
evaluation
+2
·tian

你的提示词正在与模型已有的认知竞争

基础模型在交付时已预装了对你所处领域的强烈观点。探测先验、反驳默认设置,停止发布那些与模型已有认知相竞争的提示词。

insider
ai-engineering
prompt-engineering
llm
+1
·tian

你的 RAG 分块器是一项无人 Review 代码的数据库 Schema

将你的 RAG 分块器视为预处理,每一次边界微调都会变成一次静默的 Schema 迁移。对其进行版本管理、灰度发布,并同步负责检索评估。

insider
rag
retrieval
vector-database
+2
·tian

为什么你的 RAG 引用在撒谎:源归因中的事后合理化

50% 到 90% 的大语言模型引用并不完全支持它们所对应的陈述。本文将探讨为什么事后归因会导致 RAG 系统在潜移默化中失去信任,如何利用 NLI 衡量引用忠实度,以及哪些架构修复方案真正有效。

insider
rag
llm
evaluation
+1
显示第 481–492 篇,共 834 篇