跳转到主要内容

164 含有标签「prompt-engineering」

Posts tagged "prompt-engineering" on TianPan.co.

查看所有标签

·tian

无法回滚的功能开关:提示词

提示词的修改会瞬间改变所有用户的生产环境行为,既没有金丝雀发布,也没有有效的回滚机制。本文将探讨提示词和模型版本固定为何脱离了发布规范,以及将其重新纳入规范的五个原语。

insider
llmops
prompt-engineering
release-management
+2
·tian

语义差异:当行级对比毫无意义时,如何评审 Prompt 变更

仅仅三个词的 Prompt 修改就可能让你的幻觉率翻三倍,而行级对比(Line Diff)看起来却毫无破绽。为什么 Prompt 变更需要语义差异(Semantic Diff)—— 比较行为而非文本 —— 以及如何在 PR 中对此进行门控拦截。

prompt-engineering
llm
code-review
evaluation
+1
·tian

两个模型厂商,一个功能:用冗余换来的连贯性噩梦

增加一个备选 LLM 厂商听起来像是教科书级的弹性设计,但两个模型并非两个副本。这里有没人预料到的隐藏的一致性与维护成本。

llm
reliability
architecture
ai-engineering
+1
·tian

你的 Prompt 拥有外键

重命名一个列,编译器能捕捉到每一个调用方,唯独漏掉了你的系统 Prompt。嵌入在 Prompt 中的 Schema、工具签名和 Few-shot 示例都是未声明的依赖项 —— 本文将介绍如何为它们提供清单、实现部署时生成以及 CI 强制的引用完整性。

ai-engineering
prompt-engineering
llmops
reliability
·tian

你不是选择了一个模型,而是和它结婚了:无人预估的提示词级锁定

更换你的 LLM 端点只需要一行配置;但让你的提示词在新模型上生效则需要一个你未曾预料的季度。本文探讨提示词级锁定是如何累积的,以及在被迫支付代价之前,如何衡量真实的迁移成本。

insider
llm
vendor-lock-in
prompt-engineering
+2
·tian

Token 预算是变相的人员编制决策

关于 Prompt 消耗多少 Token 的每一个选择,本质上都是在工程师时间、支持压力和基础设施成本之间进行隐形博弈。本文提供了一个框架,旨在让这种权衡显性化,而非任其随时间累积。

llm
cost-optimization
engineering-management
ai-engineering
+1
·tian

团队上线了新提示词模板,评估框架却还在测昨天的旧版本

如果评估套件在给错误的提示词版本评分,即使发布版本已损坏,报告仍会显示通过。解决方案不在于更快的缓存失效,而在于使用基于内容的提示词哈希,从而从根本上杜绝评估与生产环境出现偏差的可能性。

llm-evals
prompt-engineering
observability
mlops
+1
·tian

那些被你的提示词工程师转变为生产环境 Few-Shot 示例的评估集

当提示词工程师将精心挑选的评估示例重新用作 Few-shot 演示时,一种团队级的数据泄漏正潜伏在指标不断攀升的评估仪表盘背后。本文将探讨为什么这种污染是隐形的,真正的独立性究竟需要什么,以及谁必须被赋予说“不”的权力。

insider
ai-engineering
evals
prompt-engineering
+1
·tian

系统提示词为他人调优的备选模型

当主模型宕机时,故障转移能保证你的 LLM 应用可用 —— 但备选模型读取的是为其他模型调优的系统提示词,而你的用户会察觉到这种差异。

llm-reliability
failover
prompt-engineering
multi-model
+1
·tian

被你的模型视为“约束性判例”的 Few-Shot 示例

Few-shot 示例并非中立的演示 —— 它们是“判例法”。模型会通过表面 Token 绑定到最接近的示例,并继承其约束,从而输出评估套件无法察觉的、充满自信的错误答案。

insider
llm
prompt-engineering
evals
+1
·tian

法律免责声明如何从答案泄露到工具调用参数中

添加到你的系统提示词中的安全免责声明并不仅仅停留在面向用户的回复中。它还会渗透进模型生成的每一个工具调用参数里 —— 并进入这些调用所触发的下游系统中。

llm-agents
prompt-engineering
compliance
tool-calling
+1
·tian

系统提示词提供的人格,模型每次都会以同样的方式选择

当你的系统提示词要求模型在不同人格之间做出选择时,模型的训练先验决定了结果——在实验平台察觉到之前,你的 A/B 测试分支就已经坍缩了。

insider
llm
ab-testing
experimentation
+2
显示第 1–12 篇,共 164 篇
1 / 14下一页