跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

你的智能体对话记录是可被取证的,且法务从未批准过

你的智能体会记录每一个推理步骤,因为可观测性对此有需求,且存储成本低廉。但帮助你调试的 Trace 追踪记录同样也是传票的磁铁。在数据落地前,保留行动账本,让思考过程过期,并脱敏个人隐私信息(PII)。

ai-agents
observability
compliance
data-retention
+1
·tian

你的 AI 账单只是一个未标记的行项目:当 Token 拒绝被标记时的 FinOps

模型 API 按 Key 和时间计费,而不是按功能或客户计费,因此你的 AI 支出最终只是一个未标记的行项目。本文将探讨为什么 Token 成本难以像云资源那样进行标记,以及在调用时应如何进行埋点以解决这一问题。

insider
finops
llm
cost-attribution
+2
·tian

你模型的置信度分数只是一种感觉,而非概率

LLM 自我报告的置信度并非概率 —— 它只是受 RLHF 激励机制影响而产生的流畅 Token。本文将探讨为什么校准是你从未衡量过的特性,以及你应该转而使用什么进行门控。

insider
llm
calibration
ai-reliability
+2
·tian

你的评估测试集对现任模型存在过拟合

私有评估集往往源自单一模型的生产环境故障,因此它会偏向现任模型,并低估所有挑战者。应将回归测试与能力测试分开,并针对真实的业务流量进行测试。

llm
evaluation
model-migration
ml-engineering
·tian

智能体输出的验收抽样:制造业质量保证领先于代码审查的秘诀

智能体每周交付数百个 PR,而其中大多数完全没有经过审查。制造业在一个世纪前就通过验收抽样解决了这个问题——利用 AQL 表、批次拒收和转移规则,将对智能体的信任从“凭感觉”转变为明确且可衡量的制度。

insider
agents
llm
quality-assurance
+1
·tian

对你的工具接收的内容保持严格:波斯塔尔法则在智能体系统中失效

宽容地处理格式错误的工具参数看似健壮,但会悄无声息地将 Schema 违规转化为评估无法发现的数据损坏。严格拒绝并提供模型可读的错误反馈,才是让智能体循环具备自纠错能力的关键。

ai-agents
tool-calling
reliability
api-design
·tian

Best-of-N 是一种架构,而不仅仅是打榜技巧

在一个答案背后运行 N 个并行尝试,往往比大模型的单次输出效果更好——前提是你设计好了评判器,去除了失败的相关性,并根据利害关系设定了 N 的预算。本文涵盖了成本计算、选择器的偏见问题以及“自信的错误者”现象。

insider
ai-engineering
llm
inference
+1
·tian

爆炸半径即权限模型:按‘能破坏什么’而非‘能读取什么’来隔离智能体沙箱

Replit 智能体在删除生产数据库之前执行的每一条命令都经过了授权 —— 权限模型回答了错误的问题。为什么智能体安全取决于执行环境:作用域令牌、临时分支、出站流量白名单、支出上限,以及设置在爆炸半径边界上的审批关卡。

insider
agent-security
llm-agents
ai-engineering
+2
·tian

舰队级 CODEOWNERS:当作者是 AI Agent 时的评审路由

基于路径的 CODEOWNERS 假设作者知道自己在谁的地盘上——而 AI Agent 并不知晓。本文探讨了为什么 Agent 的 diff 会导致评审队列僵局,以及如何通过基于担保人的路由、分目录的自主权预算以及“模式 + 抽样”的 Codemod 评审来解决这一问题。

ai-agents
code-review
devops
engineering-management
·tian

当你最大的客户端是 Prompt 时,如何弃用 API

AI 智能体不会阅读更新日志 —— 它们对你 API 的认知被冻结在 Prompt、工具 schema 和训练数据中。本文将探讨为什么关闭 v1 版本会导致重试风暴而非迁移,以及如何通过适配器、Sunset 响应头和智能体可读的错误信息来解决这一问题。

insider
api-design
ai-agents
versioning
+1
·tian

内部试用 (Dogfooding) 你的 Agent 并不等于 QA

内部用户会默默地修正 Agent 的错误、规避其弱点,并在 Slack 中分享绕过问题的方法 —— 这使得内部试用指标在真实客户流失前看起来异常完美。你应该转而监测修复事件、编辑距离和冷启动用户群组。

ai-agents
evals
observability
product
·tian

Token FinOps:将 AI 支出归因到具体功能

你的 LLM 账单无法告诉你具体是哪个功能在耗钱。本文将探讨为什么提示词缓存、批量 API 和多租户智能体会导致成本归因失效,以及如何通过打标签、Span 级计量和分摊规范来解决这一问题。

finops
llm
cost-optimization
ai-engineering
+1
显示第 37–48 篇,共 2312 篇