跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

提示词差异审查作为一种规范:审查者真正需要问的问题

传统代码审查的直觉无法直接应用于提示词编辑。这里是检查清单、工具链,以及将提示词PR转化为行为契约的审查者与作者对话指南。

prompt-engineering
llm
code-review
ai-engineering
·tian

提示熵预算:将输出方差作为生产环境的核心指标

大多数生产环境的 LLM 系统只追踪准确率,却忽视了方差。衡量相同输入的输出分布——即提示熵预算——是决定用户体验一致性的缺失指标。

llm
production
observability
evaluation
+1
·tian

推理模型的提示词用法大不同:为何你现有的模式在 o1、o3 和 Claude 扩展思考上会失效

o1、o3 和带扩展思考的 Claude 等推理模型处理提示词的方式,与指令跟随模型有着本质区别。那些在 GPT-4 上有效的模式,反而会主动损害思考模型的性能——本文提供一套适配框架。

prompt-engineering
reasoning-models
llm
ai-engineering
·tian

公开幻觉应对指南:当你的 AI 在公众场合说出蠢话时该怎么办

为面临公开 AI 幻觉事件的工程师和产品团队提供的实战指南——涵盖分类、根因分析、面向用户的沟通,以及真正能防止再次发生的事件后评估工作。

ai
llm
incident-response
hallucination
+1
·tian

RAG 特有的提示词注入:对抗性文档如何劫持你的检索管道

在数百万文档的语料库中,仅需五份精心构造的文档,就能在 90% 的情况下操控 RAG 系统的响应——而你的输入验证层对此毫无察觉。本文解析为何 RAG 的威胁模型从根本上有别于传统注入,以及真正有效的防御措施。

security
rag
prompt-injection
ai-engineering
+1
·tian

你的 RAG 系统缺少的查询改写层

大多数 RAG 调优工作集中在分块策略和嵌入模型上。而最高杠杆的干预点其实在流水线更前端:在查询命中向量索引之前对其进行变换。

rag
retrieval
llm
ai-engineering
·tian

检索空洞问题:为什么你的 RAG 拒绝说“我不知道”

向量搜索总是返回前 K 个结果,无论匹配质量如何,这会将缺失的信息转化为自信的虚构。修复这一问题不仅需要提高阈值——弃权机制必须成为一等输出。

insider
rag
retrieval
llm
+2
·tian

研究型 Agent 设计:为何科学工作流会打破编码 Agent 的底层假设

编码 Agent 收敛于唯一正确答案。研究型 Agent 必须探索开放式的假设空间,而成功标准在事先并不明确。本文探讨这一差异在架构层面的具体要求。

ai-agents
research
llm
architecture
·tian

LLM Agent 的重试预算:为什么 20% 的单步失败率会让你的 Token 账单翻倍

在链式 LLM Agent 中,20% 的单步重试率很少只增加 20% 的成本 —— 由于上下文回放,成本往往会攀升至 2 倍左右。本文将介绍如何通过预算限制重试、在 CI 中捕获成本爆炸,并停止为失败支付双倍费用。

insider
llm-agents
retry-budget
reliability
+2
·tian

设计不拖垮延迟的 AI 安全层

串行安全检查会在响应到达用户之前叠加出数百毫秒的开销。本文介绍如何设计既能维持安全态势、又不破坏用户体验的护栏架构。

insider
guardrails
llm
production
+2
·tian

SFT、RLHF 与 DPO:垂直领域应用中的模型对齐方法决策矩阵

一个实用的决策框架,用于在垂直领域应用中对 LLM 进行对齐时,在有监督微调 (SFT)、RLHF 和 DPO 之间进行选择——包括如何诊断你的对齐差距是数据问题、奖励问题还是能力缺失。

insider
fine-tuning
llm
alignment
+1
·tian

影子提示词库:治理一个无人拥有的资产类别

提示词驱动着生产环境中的 AI 功能,却往往缺乏代码审查、部署流水线或明确的所有者。在监管机构强制执行要求之前,你需一套实用的治理栈 —— 包含注册表、变更审查、模型兼容性和审计追踪。

prompt-engineering
ai-governance
compliance
llm-ops
显示第 1657–1668 篇,共 2312 篇