跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

过时的工具描述是 AI Agent 最大的隐形故障诱因

工具模式(Schemas)会随着时间的推移与其实现发生偏离,使过时的描述成为隐形故障的诱因。以下是防止这种情况的工程规范。

insider
agent-reliability
tool-use
llm-engineering
+1
·tian

摘要有效性问题:如何识破 AI 压缩掉的关键信息

看起来忠实原文的 AI 摘要可能会悄无声息地丢失下游任务所需的关键信息。本文将教你如何定义完整性契约、结合覆盖率指标,并构建回归测试,在有损压缩破坏你的流水线之前及时发现问题。

insider
llm
rag
evaluation
+1
·tian

零样本之墙:为什么上下文示例在生产规模下失效

少样本提示能让你以最小的投入达到 80% 的效果。除此之外,每提升一个百分点的准确率,成本都会剧增。本文将告诉你如何识别这些信号,并了解何时微调成为你唯一的杠杆。

insider
llm
fine-tuning
prompt-engineering
+2
·tian

多区域 AI 部署:数据驻留、模型一致性与被忽视的延迟成本

多区域 AI 部署上线后,三类隐性成本往往被严重低估:模型版本不一致导致的输出差异、GDPR 区域 KV 缓存隔离推高的单 token 成本,以及不了解数据驻留规则的重试逻辑引发的静默合规违规。

llm
deployment
data-residency
compliance
+1
·tian

200 Token 的系统提示词如何击败你的 4000 Token 提示词

冗长的系统提示词因不断堆砌而增长,并通过注意力稀释、指令魔咒和逻辑矛盾悄然降低输出质量。本文介绍了如何通过压缩原则,让一个 200 Token 的提示词在评分上超越 4000 Token 的提示词。

prompt-engineering
llm
context-engineering
evals
+1
·tian

增加模态是一次隐私分类事件,而非简单的功能开关

沿用为文本编写的同意流程来发布视觉输入功能,会悄无声息地成倍扩大你的 PII 暴露面 —— EXIF 元数据、相邻内容泄露以及合同范围漂移,每一项都需要独立的分类、保留策略和审计。

ai-privacy
multimodal
vision-models
compliance
+1
·tian

智能体问责栈:当子智能体造成伤害时,谁来承担责任

当子智能体发错邮件、删除记录或错误向客户收费时,责任是分散的。本文介绍如何设计审计追踪和授权检查点,在不扼杀自主性的前提下建立真正的问责机制。

insider
ai-agents
accountability
security
+2
·tian

智能体可识别性:当 Trace 无法分辨哪个智能体执行了哪些操作时

当出现故障时,多智能体 Trace 会立即坍缩成一团混乱的、完全相同的 agent.run span。本文介绍了修复这一问题的五字段身份模型 —— 稳定角色、父智能体、实例 ID、模型和提示词版本、结果 —— 以及为什么你的 APM 默认不会显示这些信息。

ai-engineering
observability
opentelemetry
multi-agent
+1
·tian

AI 调试器的陷阱:当 Agent 的补丁速度超过你的诊断速度

Agent 生成补丁的速度比工程师诊断 Bug 的速度还要快。代价是:这个代码库的故障模式最终只有 Agent 才能理解。

ai-engineering
debugging
engineering-leadership
agents
·tian

AI 软件物料清单 (AIBOM):当采购部门问起时,你的依赖树长什么样

大多数 AI 团队在面对“请展示你们的依赖树”时,只能给出一个 Slack 讨论串。AIBOM 将其转变为一个查询系统 —— 一个持续生成的模型、Prompt、工具和数据集清单,在监管机构和采购部门提问之前就满足他们的需求。

insider
aibom
ai-governance
compliance
+2
·tian

AI 旁观者效应:为什么五支团队协作发布却交付了无人问津的评估套件

AI 功能的失败与旁观者未能拨打 911 的原因如出一辙 —— 并不是因为没人注意到,而是因为每个人都认为别人会负责。为什么指定唯一的输出质量负责人 (DRI) 是唯一可扩展的解决方案。

ai-engineering
org-design
evals
llmops
+1
·tian

你的 AI 功能需要一个无需部署的紧急开关 (Kill Switch)

一次标准的部署回滚需要 30 分钟;而一个表现异常的 LLM 仅需几秒钟就能向客户发送错误的输出。这里是你的 AI 功能在发生首次故障前所需的关闭原语——四种标志系列、触发它们的检测信号,以及确保其有效的测试规范。

insider
ai-engineering
sre
incident-response
+2
显示第 901–912 篇,共 2312 篇