跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

RBAC 对 AI Agent 来说还不够:一种实用的授权模型

当 Agent 在任务执行过程中切换权限时,静态的基于角色的访问控制(RBAC)就会失效。本文将介绍如何构建一个真正有效的授权模型:狭窄的工具范围、短期凭据、ABAC 运行时策略以及锚定在 Agent 身份上的审计轨迹。

insider
ai-agents
security
authorization
+1
·tian

推理模型经济学:思维链何时物有所值

深度思考模型的单次查询成本高出 10–50 倍。本文提供了一套任务分类法,告诉你何时这笔溢价是值得的,以及如何构建自动应用该策略的路由架构。

insider
llm
ai-engineering
cost-optimization
+1
·tian

重排序器(Reranker)鸿沟:为什么大多数 RAG 流水线忽略了最重要的一层

大多数 RAG 流水线在向量相似性搜索之后就停止了,并疑惑为什么准确率停滞不前。重排序器(Reranker)就是那层缺失的关键——本文将探讨跳过它的代价,以及如何判断这种权衡是否值得。

rag
retrieval
reranking
production-ai
·tian

串行工具调用瀑布:Agent循环中隐藏的延迟税

Agent框架默认串行执行工具调用,即使这些调用在逻辑上相互独立,造成与N+1查询问题如出一辙的延迟级联。本文介绍如何识别并修复这一问题。

insider
ai-agents
performance
tool-use
+2
·tian

从影子模式到自动驾驶:AI功能自主性的准备框架

将AI从影子模式逐步推进到咨询、副驾驶和自动驾驶阶段,需要明确的质量门控和监控机制,而不仅仅是组织层面的勇气。这里是工程框架。

insider
ai-engineering
mlops
production-ai
+1
·tian

无共享智能体:为水平可扩展性设计 AI 智能体

大多数 AI 智能体无法水平扩展,因为它们积累了将其绑定到单一机器的隐式状态。本文介绍解决这一问题的架构规范。

insider
agent-architecture
distributed-systems
scalability
+1
·tian

六个月悬崖:为什么生产环境中的 AI 系统会在没有一行代码改动的情况下发生退化

你的 AI 功能在发布时表现优异,通过了所有测试。但六个月后,它在悄无声息中退化了 20–40% —— 而你的仪表盘却从未发出警告。本文将探讨这种情况发生的原因以及如何阻止它。

llm
production
monitoring
mlops
+1
·tian

当你的模型偶尔出错时,99.9% 的可用性意味着什么

传统的 SLA 对于成功与否具有概率性的 AI 功能而言毫无意义。本文将介绍合同用语和内部 SLO 设计,让工程团队在不承担无限责任的情况下发布 AI 功能。

insider
ai-engineering
reliability
sla
+1
·tian

生产环境中的结构化输出可靠性:为什么 JSON 模式并非契约

JSON 模式保证了合法的语法 —— 但不能保证正确的答案。本文深入剖析了摧毁生产级 AI 流水线的三种故障模式,并介绍了一个能真正捕获这些问题的三层验证架构。

insider
llm
production-ai
structured-output
+2
·tian

生产AI中的子群体公平性测试:为何聚合准确率会撒谎

聚合准确率掩盖了特定人口统计和语言子群体的系统性失败。本文介绍子群体评估方法论、差异SLO以及在用户规模化之前捕获偏见的生产监控模式。

ai-engineering
evaluation
fairness
production-ai
+1
·tian

谄媚陷阱:为何 AI 验证工具在应该反驳时却选择赞同

经过 RLHF 训练的模型存在系统性的赞同偏差,这使它们在代码审查、事实核查和决策支持场景中极为危险。本文探讨如何衡量这一问题,并恢复模型应有的反驳能力。

insider
llm
production-ai
evaluation
+2
·tian

合成评估冷启动:在没有标注数据的情况下如何构建基准数据集

如何在零标注数据的情况下,利用合成测试生成、人工验证锚点、跨模型分歧和行为不变量构建可用的LLM评估流水线——以及合成评估与被测模型共享的失效模式。

evaluation
llm
testing
evals
+1
显示第 1333–1344 篇,共 2312 篇