跳转到主要内容

164 含有标签「prompt-engineering」

Posts tagged "prompt-engineering" on TianPan.co.

查看所有标签

·tian

200 Token 的系统提示词如何击败你的 4000 Token 提示词

冗长的系统提示词因不断堆砌而增长,并通过注意力稀释、指令魔咒和逻辑矛盾悄然降低输出质量。本文介绍了如何通过压缩原则,让一个 200 Token 的提示词在评分上超越 4000 Token 的提示词。

prompt-engineering
llm
context-engineering
evals
+1
·tian

个性化设置应当属于 Dotfile,而非向量数据库

大多数 Agent 的个性化其实是语气、格式、默认工具和项目上下文 —— 这些声明式设置在数十年前就通过 Dotfile 模式解决了。只有在穷尽配置手段后,才应考虑微调和持久化记忆。

ai-agents
configuration
personalization
prompt-engineering
+1
·tian

评估迁移税:为什么 Prompt Schema 的一次变更会毁掉 800 个测试用例

AI Prompt 的 Schema 变更经常会破坏数百个与该变更无关的测试用例。大多数团队将评估套件视为静态固定装置,而不是版本化数据——并在每次发布时支付一笔隐形成本。

ai-engineering
evaluation
llm
testing
+1
·tian

将 Eval 作为 Pull Request 评论而非任务:在代码审查中嵌入 LLM 质量门禁

为什么只有当 LLM 评估(evals)存在于 diff 旁边的 PR 评论中时,才能有效捕捉回归。借鉴代码覆盖率如何从夜间任务迁移到内联审查界面的经验 —— 以及将“评估即任务”转变为“评估即合并门禁”的四个工程关键点。

insider
llm
evals
ci-cd
+2
·tian

为什么你的提示词库应该是 Monorepo,而不是 Cookbook

Cookbook 模式的提示词文件夹在规模化时会失效。应用 Monorepo 规范——语义化版本控制、依赖图、原子重构和评估门禁——以防止提示词漂移、幽灵依赖和迁移瘫痪影响生产环境。

insider
prompt-engineering
llm-ops
ai-engineering
+2
·tian

AI 功能之间隐藏的边:当一次提示词编辑导致其他三个团队的性能回退时

AI 功能通过无人记录的产物进行组合 —— 提示词片段、评估种子、裁判准则。当一个共享的编辑生效时,其他三个团队的性能发生了回退,却没人能追溯原因。本文将教你如何绘制这个图谱。

ai-engineering
platform-engineering
prompt-engineering
mlops
+1
·tian

你的 AI 功能说明文档是运行时依赖,而非营销文案

当 Prompt 发生变化而帮助中心文章没有更新时,你的 AI 功能信任契约就会悄然失效 —— 而 Prompt 仓库可以预测这种差距。

ai-engineering
documentation
governance
prompt-engineering
+1
·tian

“换个更大的模型试试”这种直觉反应是一种重构异味

当你团队中出现的每一次质量退化都习惯性地转向“让我们换个更大的模型试试”时,你实际上是在投入昂贵的算力资源来掩盖上游的 bug。这种打破直觉反应的纪律,以及为此设立的门控机制至关重要。

insider
llm
ai-engineering
prompt-engineering
+3
·tian

Eval 差异分析作为分支保护:交付分数变化,而非分数下限

分数下限 (Score Floors) 会让静默回归进入生产环境,同时又可能误报真实的改进。基于基线感知的切片级 Eval 差异分析能将 Eval 门禁转变为你的团队可以信赖的回归检测器。

evals
ci-cd
ai-engineering
prompt-engineering
·tian

模型偏好分叉:为什么你的提示词库有三个版本且没人追踪漂移

一个共享的提示词库会悄悄地积累起无人追踪的特定模型分叉,在每次模型升级时破坏你的评估套件与路由层之间的约定。

llm
prompt-engineering
ai-engineering
evaluation
+1
·tian

提示词弃用合约:为什么措辞清理是一项破坏性更新

对系统提示词进行四个字的修改,就可能破坏那些固定了旧措辞的解析器、裁判和链式代理。提示词是拥有沉默消费者的 API —— 保持其稳定性的纪律与 REST 端点弃用的流程非常相似。

insider
prompt-engineering
llmops
ai-engineering
+1
·tian

Prompt Linting 是 Eval 与生产环境之间缺失的一层

行为评估(Behavioral evals)捕捉模型说了什么,但无法捕捉你的 Prompt 本身是什么。一个快速、确定且结构化的 Prompt Linter,能够填补“评估通过但生产环境翻车”之间的鸿沟,避免在深夜 11 点触发生产事故。

prompt-engineering
llm-ops
ci-cd
evaluation
+1
显示第 73–84 篇,共 164 篇