跳转到主要内容

384 含有标签「ai-agents」

Posts tagged "ai-agents" on TianPan.co.

查看所有标签

·tian

无人负责的对话:问责制如何在智能体移交链中消散

在多智能体系统中,每个智能体都可以通过各自的测试,但整个对话却可能失败。本文探讨了为什么移交流程会分散所有权,以及重新建立问责制的原始原语。

ai-agents
multi-agent
reliability
observability
+1
·tian

评分了每一轮对话却错过了整个交流:聊聊多轮评估的陷阱

95% 的单轮准确率并不意味着 95% 的会话都能成功。本文将探讨为什么平均单轮得分会掩盖复合失败,以及如何转而对整个对话进行评估。

insider
llm-evaluation
ai-agents
multi-turn
+2
·tian

你的智能体对话记录是可被取证的,且法务从未批准过

你的智能体会记录每一个推理步骤,因为可观测性对此有需求,且存储成本低廉。但帮助你调试的 Trace 追踪记录同样也是传票的磁铁。在数据落地前,保留行动账本,让思考过程过期,并脱敏个人隐私信息(PII)。

ai-agents
observability
compliance
data-retention
+1
·tian

对你的工具接收的内容保持严格:波斯塔尔法则在智能体系统中失效

宽容地处理格式错误的工具参数看似健壮,但会悄无声息地将 Schema 违规转化为评估无法发现的数据损坏。严格拒绝并提供模型可读的错误反馈,才是让智能体循环具备自纠错能力的关键。

ai-agents
tool-calling
reliability
api-design
·tian

舰队级 CODEOWNERS:当作者是 AI Agent 时的评审路由

基于路径的 CODEOWNERS 假设作者知道自己在谁的地盘上——而 AI Agent 并不知晓。本文探讨了为什么 Agent 的 diff 会导致评审队列僵局,以及如何通过基于担保人的路由、分目录的自主权预算以及“模式 + 抽样”的 Codemod 评审来解决这一问题。

ai-agents
code-review
devops
engineering-management
·tian

当你最大的客户端是 Prompt 时,如何弃用 API

AI 智能体不会阅读更新日志 —— 它们对你 API 的认知被冻结在 Prompt、工具 schema 和训练数据中。本文将探讨为什么关闭 v1 版本会导致重试风暴而非迁移,以及如何通过适配器、Sunset 响应头和智能体可读的错误信息来解决这一问题。

insider
api-design
ai-agents
versioning
+1
·tian

内部试用 (Dogfooding) 你的 Agent 并不等于 QA

内部用户会默默地修正 Agent 的错误、规避其弱点,并在 Slack 中分享绕过问题的方法 —— 这使得内部试用指标在真实客户流失前看起来异常完美。你应该转而监测修复事件、编辑距离和冷启动用户群组。

ai-agents
evals
observability
product
·tian

不稳定的测试毒化 Agent 循环的速度比伤害人类时快得多

人类对不稳定测试耸耸肩;Agent 却将报错视为绝对真理——回退正确的更改并在虚影上浪费 token。为什么测试确定性现在已成为一项 SLO,以及 Agent 集群如何检测并修复它们所遭受的不稳定测试。

ai-agents
testing
ci-cd
reliability
·tian

Agent 的演练日:排演那些无法复现的故障

混沌工程假设故障是可重现的;但 Agent 系统的故障往往通过从不重复的随机路径发生。演练日(Game days)——包括工具故障注入、模型降级演练、上下文污染场景以及升级反馈消防演练——能建立运维人员的肌肉记忆,并暴露重现测试永远无法发现的追踪工具缺陷。

insider
ai-agents
reliability
sre
+2
·tian

GraphQL 终于找到了它的客户端,而且它不是人类

AI Agent 是第一批真正能够自主构建数据需求的客户端——这正是 GraphQL 最初设计的初衷。但 Agent 也放大了导致 GraphQL 在人类客户端竞争中落败的所有弱点。目前行之有效的模式是:Agent 在开发阶段构建查询,由人类进行审核并将其固定为持久化操作。

insider
ai-agents
graphql
api-design
+2
·tian

让 Agent 先接警:AI 故障响应的信任阶梯

故障发生的最初 15 分钟通常是机械化的,Agent 可以在你解锁笔记本电脑前就完成这些工作。这套由叙述者、建议者、受控执行者、受限自动修复者组成的四层信任阶梯,配合基于证据的晋升和有范围的降级机制,比在经历一个糟糕的夜晚后彻底禁用自动化要明智得多。

insider
incident-response
ai-agents
sre
+2
·tian

无代码是一场赌注,赌代码成本将维持在高位。这场赌局刚刚输了

无代码平台曾以昂贵的工程师成本作为定价基准。现在,AI 智能体构建和维护真实应用的成本已经低于一个席位许可费,这种抽象层反而成了上限 —— 而幸存者正在转型,改为销售受治理的数据访问权限。

insider
no-code
ai-agents
internal-tools
+1
显示第 13–24 篇,共 384 篇