跳转到主要内容

209 含有标签「agents」

Posts tagged "agents" on TianPan.co.

查看所有标签

·tian

30 秒都去哪了:APM 无法察觉的 Agent 步骤内部延迟归因

传统的 APM 将 Agent 的一个步骤视为单一的粗粒度 Span,导致值班工程师只能靠猜。通过将其分解为七个阶段,区分首字延迟 (Prefill) 与解码 (Decode),并追踪关键路径而非总 Span 时间。

insider
observability
llm
agents
+2
·tian

AI 网络保险:你的智能体会首先发现的保障缺口

大多数网络保险和 E&O 保单是为数据泄露和程序漏洞设计的,而非针对使用你的凭证运行的智能体。这种保障缺口通常在理赔时才会显现,而那时往往没人提前为此做好规划。

insider
ai-engineering
risk-management
cyber-insurance
+2
·tian

校准弃答:你的 LLM 技术栈每一层都在惩罚的能力

LLM 技术栈中的每一项默认设置——预训练、RLHF、裁判 LLM、用户反馈——都在促使模型给出自信的错误答案。只有当你构建了愿意为此付费的评估体系、评分标准和 UI 时,校准弃答才能真正落地。

llm
evaluation
calibration
abstention
+1
·tian

取消安全的智能体:你的“停止”按钮背后已经产生的副作用

“停止”只是一种 UI 手段,而非系统保证。这是一份针对取消安全智能体的从业者指南:持久化副作用账本、作用域授权、补偿操作,以及取消 UI 究竟应该显示什么。

insider
agents
reliability
distributed-systems
+2
·tian

聊天历史是数据库。别再把它当成滚动回溯了。

将对话历史视为滚动回溯(Scrollback),是智能体在第 8 轮对话后就开始跑题,以及上下文费用呈超线性增长的原因。解决办法是回归其本质——一个读密集型数据库——并据此进行设计。

insider
llm
agents
memory
+2
·tian

确定性预算:将随机性视为按层面的分配,而非全局开关

温度不是一个全局开关。应按层面分配随机性——路由、解析、合成、生成、探索——否则你将为不需要的方差付出代价。

insider
agents
llm
evals
+2
·tian

Wiki 迎来了第二位租客:为什么面向 AI Agent 的文档与面向人类的文档截然不同

工程团队正悄悄地为其内部文档积累第二批受众——即每位开发者的 AI 助手。如果团队只为其中一类读者编写文档,那么提供给另一类读者的内容注定是残缺的。

ai-engineering
documentation
developer-experience
agents
+1
·tian

倒置智能体:当用户是规划者,模型是步骤执行者时

大多数智能体产品让模型负责规划,而让用户负责审批。对于高风险工作,这种极性恰恰相反 —— 解决方案是一个不同的产品设计,而非更优的提示词。

agents
ux
ai-engineering
evals
+1
·tian

负载降级是为人类设计的,而 Agent 会放大你正在抵御的风暴

Agent 会围绕 503 错误重新规划并以远超人类的速度重试,将上游的小幅波动演变成关联性停机。本文从实践者视角出发,探讨平台下一步需要的负载降级原语,以及 Agent 为了避免成为“风暴”而必须遵循的纪律。

insider
agents
reliability
sre
+2
·tian

智能体动作空间的可达性分析:为你从未测试过的分支提供评测覆盖

你的工具目录加上规划器构成了一个可达的执行计划图,而你的评测(Evals)可能从未覆盖过这些路径。借鉴编译器的可达性分析方法,找出那些可能最先由事故频道(Incident Channel)发现的隐藏分支。

insider
ai-engineering
agents
evaluation
+2
·tian

重新规划而非重试:为什么大多数智能体错误并非瞬时性的

大多数智能体框架在工具错误时默认使用指数退避重试 —— 这种模式借用自无状态的 HTTP,但在有状态的规划循环中是完全错误的。正确的默认做法应该是重新规划。

agents
llm
error-handling
reliability
+1
·tian

采样参数继承:当 0.7 的温度从规划器泄露到验证器时

将温度沿调用树向下传播的智能体框架,会将规划器的创意旋钮变成验证器的 Bug。本文探讨了基于角色的采样配置文件、默认拒绝继承,以及捕获此类泄露的分歧率评估。

insider
agents
llm
evals
+1
显示第 121–132 篇,共 209 篇