·tian
你的模型已经学会通过可见输入预测的那个功能开关
当路由哈希与 Prompt 组装器共享输入时,LLM Prompt 实验就会发生策略泄漏 —— 本文将深入探讨这种虚假提升是如何产生的、仪表盘无法显示的症状,以及弥合这一差距的工程实践。
insider
experimentation
llm-engineering
ab-testing
+2·tian
你的 Agent 在无文档情况下悄然掌握的流程
当一个 Agent 的提示词成为业务流程的唯一权威描述时,你实际上在云端发布了一份无人能审计、无法版本控制也无法移交的运维手册。
insider
ai-engineering
agents
process
+2·tian
你的 Prompt 发布得像个牛仔:为什么代码审查的严谨性没能延伸到 AI 交付物
一个四行的 Bug 修复要经过三轮代码审查,而一个四十行的 System Prompt 修改却只要一个 LGTM 就能发布。这是一份在下一个回归问题出现前,弥合 AI 交付物规范差距的实战指南。
llm
code-review
evals
prompts
+1·tian
真正能阻断 PR 合并的提示词回归测试
大多数团队声称在测试他们的提示词。但几乎没有团队建立了能让构建失败的 CI 门控。这里有一个轻量级框架,可以在不烧掉 API 预算的情况下改变这一局面。
insider
ai-engineering
testing
ci-cd
+2