跳转到主要内容

384 含有标签「ai-agents」

Posts tagged "ai-agents" on TianPan.co.

查看所有标签

·tian

95% 可靠性幻觉:为什么你的 10 步 Agent 在 40% 的情况下会失败

一个在单步可靠性为 95% 的十步 Agent,其端到端成功率仅为 60%。验证部署、冗余模式和更短的链条是改变这一曲线的架构杠杆。

ai-agents
reliability
evaluation
architecture
·tian

为什么 AI 生成的注释腐烂得比代码还快

AI 智能体为每个函数生成流利的文档字符串,它们往往只是在转述代码逻辑,而非编码意图。一旦代码发生变动,注释就会说谎——而下一位读者往往会相信谎言而非代码。这是一套面向 AI 辅助时代的代码审查规范。

insider
ai-engineering
code-review
technical-debt
+2
·tian

AI 审查 AI:代码审查智能体的非对称架构

当作者和审查智能体共享同一个基础模型时,代码审查就变成了一种信心放大器,而非质量关卡。本文探讨如何通过非对称架构、多轮批评者(multi-pass critics)和评估纪律,将 AI 审查转化为真实有效的信号。

insider
code-review
ai-agents
llm-evaluation
+1
·tian

可申诉性差距:如何工程化设计用户真正可申诉的 AI 决策

生产环境中的 AI 智能体往往会在不经意间将退款拒绝、内容删除和验证驳回变成最终定论。在监管机构或愤怒的用户逼你动手之前,抢先构建持久记录、申诉端点以及真正的二次复审流水线。

insider
ai-agents
governance
compliance
+2
·tian

双写竞态:当你的智能体与用户同时编辑同一个日历事件时

负责编辑日历、CRM 和工单的智能体,继承了一类其工具在设计之初从未考虑过的并发 Bug。修复方案是通过工具层传递版本令牌 (version tokens)。

insider
ai-agents
concurrency
tooling
+1
·tian

你的 Span 名称是未记录的 API:Agent 团队之间的遥测契约

Span 名称和属性键是未记录的 API,其使用者涵盖了成本仪表板、评估流水线和 SLO 告警。请将遥测数据视为带版本的 Schema,否则你将不断因那些无声失败的破坏性变更而接到告警电话。

observability
opentelemetry
telemetry
ai-agents
+1
·tian

Agent 的策略即代码 (Policy-as-Code):OPA、Rego 以及你的工具循环中缺少的决策点

随着工具目录的增长,系统提示词和 YAML 配置清单将不再适用。在每个工具调用前设置一个专用的策略引擎——如使用 Rego 的 OPA 或 AWS Cedar——可以为 Agent 提供提示词工程无法提供的、可审计的策略决策点 (Policy Decision Point)。

security
ai-agents
authorization
policy-as-code
·tian

确认与行动间的鸿沟:智能体的“明白了”并不等同于承诺

生产环境中的智能体经常自信地确认那些从未执行的操作,这是因为开发团队将对话文本误认为是契约,而非工具调用。本文介绍一种将叙述与承诺分离的设计模式。

insider
ai-agents
llm-evaluation
observability
+2
·tian

Agent 回填问题:你的模型升级是对过去 90 天的一次审判

当一个更聪明的模型与你已经发布的模型产生分歧时,每一个持久化的 Agent 决策都会变成一个有争议的记录。这是一个关于评估、决策和动作重放的框架 —— 以及你在下次升级前需要的架构先决条件和策略矩阵。

insider
ai-agents
llmops
model-upgrade
+2
·tian

智能体幂等性是一项编排契约,而非工具属性

当不可预测的规划器(Planner)可能重新发起相同动作时,仅靠工具层面的幂等键是不够的。该契约必须存在于编排边界,并以结构化的运行状态作为键 —— 而非由模型生成的参数作为键。

ai-agents
idempotency
orchestration
reliability
+1
·tian

智能体记忆 Schema 演进:Protobuf 的困难模式

智能体记忆拥有两种 Schema —— 存储层和模型上下文 —— 而其中只有一种可以通过 SQL 脚本进行迁移。本文将探讨为什么 Protobuf 的“仅增量”准则是正确的起点,以及在此基础上影子写入方案还需要哪些补充。

insider
ai-agents
memory
schema-evolution
+2
·tian

静默成功:当你的 Agent 宣告完成但实际上什么也没发生

Agent 往往因为喋喋不休而失败。自信的文字掩盖了工具错误,而写入操作从未真正提交。解决方案是:将模型的声明降级为假设,将工具响应和操作后探测提升为权威信号,并衡量效果落地而非单次对话的成功。

insider
ai-agents
observability
reliability
+1
显示第 229–240 篇,共 384 篇