跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

撤回的代价:为什么撤回一项 AI 功能比上线它更难

一旦用户围绕某项 AI 功能构建了工作流,移除它的成本将超过上线它的成本。本文探讨了为什么紧急开关往往被闲置,以及如何在上线之初就设计可逆性。

ai-engineering
product
deprecation
release-engineering
·tian

以单次对话成本为产品契约:当定价驱动架构设计时

AI 功能的定价是架构设计的输入,而非财务后的补救。为了不让工程师在午夜修补单位经济效益的漏洞,PRD 中应该包含哪些内容。

ai-engineering
product
pricing
unit-economics
+1
·tian

你的评估套件就是你拒绝编写的产品需求文档

PRD 中模糊的形容词(如 “有帮助” 和 “简洁”)在模型面前很难生存 —— 评估套件才是这些决策真正落地的场所。请将评估视为产品规格,而非仅仅是测量工具。

insider
ai-engineering
evals
product-management
+2
·tian

强制一致性偏见:当模型将你的意图向分布众数取整时

经过对齐的大模型会悄悄地将不寻常的请求向训练分布的众数取整。本文将探讨为什么标准评估会忽略这一点,以及捕捉这一现象的离模态约束方法。

insider
llm-evaluation
rlhf
instruction-following
+1
·tian

冰封提示词:当你的团队不敢修改一个仍然奏效的系统提示词时

一个没人敢动的 4,000 token 系统提示词并非稳定,而是债务。本文探讨提示词如何演变为“冰封”状态、为何迭代会因此陷入僵局,以及如何通过考古与评估规范来解冻它们。

llm
prompt-engineering
technical-debt
ai-engineering
+1
·tian

内部工具代理:当你杠杆率最高的 AI 功能却零客户时

面向客户的 AI 功能占据了大部分预算,但你公司中杠杆率最高的 AI 投资却是那个无人运维的内部 Slack 机器人。这里有背后的数学逻辑、失败模式以及捕捉这些价值所需的纪律性。

insider
ai-engineering
internal-tools
productivity
+2
·tian

负面提示词是代码异味:为什么系统提示词中的每个 “不要” 都是技术债

生产环境系统提示词中的每一个 “不要” 子句,都是对行为不匹配的补丁。跟踪负面提示词的密度,将每个否定项重构为正面规范,并将残留的否定项作为一种信号,表明提示工程可能并不是解决该问题的正确工具。

insider
prompt-engineering
llm
ai-engineering
+1
·tian

幻影技能:当你的智能体展示出你从未测试过的能力

当用户基于未经测试验证的 AI 智能体行为构建工作流时,你发布的正是你无法维护的能力。在下一次模型升级悄然移除这些“幻影技能”之前,你需要一套发现它们的学科方法。

ai-engineering
evaluation
agents
production
+1
·tian

策略文件:为什么你不应该把拒绝规则写在系统提示词里

生产环境的系统提示词就像是披着一件风衣的三个配置文件——对话语气、输出格式和拒绝策略被塞进同一个工件中,共用同一个评审人和发布节奏。每一次策略修改都会导致无关任务的行为回归。这里有一种能显著获益的解耦方案。

insider
llm
ai-engineering
prompt-engineering
+2
·tian

RAG 中的新鲜度与相关度权衡:为什么你无法在查询时同时优化两者

纯语义检索会忽略时间,而基于新鲜度权重的检索则更看重活跃度而非正确性。本文将深入探讨针对每个查询的时间敏感度分类器、针对每个文档的波动性评分,以及如何通过双轴评分让 RAG 在处理稳定型和时变型问题时都能保持正确。

rag
retrieval
ai-engineering
llm
+1
·tian

拒绝审计:为什么单一拒绝率掩盖了一半的失败分布

拒绝率是一个双边分布,但大多数安全仪表盘只绘制了其中一侧。本文介绍了应如何部署监控、如何采样,以及谁应该负责校准。

llm-safety
evals
observability
ai-engineering
·tian

检索级联失效:文档删除如何毒害你的 RAG 流水线

当源文档消失时,它们的嵌入仍滞留在向量索引中,并持续返回貌似正确的错误答案。这是一份关于墓碑机制、级联失效以及检索时新鲜度检查的实战指南。

rag
vector-database
ai-engineering
llm
+1
显示第 229–240 篇,共 834 篇