跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

没上线新功能的 AI 工程师该如何写晋升材料

那些工作重点在于“预防”的 AI 工程师——比如捕捉到的评估回退、未产生的成本、从未发生的事故——该如何编写一份能让校准委员会给出高分的晋升材料。

ai-engineering
career
promotion
eval
+1
·tian

“什么发生了变化”查询是你的索引无法回答的 RAG 问题

向量相似度检索会将同一文档的两个版本视为近乎相同,因此在处理不断演进的文档时,任何 RAG 系统在处理增量查询时都会静默地产生“没有任何变化”的幻觉。本文将解释这种失败为何是结构性的,以及一个能够感知变化的索引究竟长什么样。

rag
retrieval
llm
vector-search
+1
·tian

视频会议中的数字人:构建用于视频会议的实时对话头像 AI

45 毫秒的音视频偏移是人类将对话头像 AI 判定为伪造的阈值。深入实时工程内部——视素调度、音频主时钟,以及那些从未在离线评估中出现的失败模式。

insider
ai-engineering
real-time
multimodal
+2
·tian

并非“全员回复”:智能体出站扇出风险

智能体对“全员回复”没有肌肉记忆。当发送工具的接收方字段无法区分分发列表与个人时,规划器往往会选择动静最大的那扇门。这里有四种将爆炸半径限制在可控范围内的实践。

agents
security
ai-engineering
tools
+1
·tian

下线一个 Planner 已产生依赖的 Agent 工具

从你的 Agent 工具目录中移除一个函数不仅仅是语法上的更改,更是一次行为迁移。这种阶段式下线模式可以防止回退幻觉和隐性回归。

insider
agents
tool-use
deprecation
+2
·tian

运行时 Prompt 热重载:为什么你的 Prompt 不该被锁定在构建流程中

将 Prompt 变更与部署流水线耦合是一种自我限制。本文将探讨运行时热重载模式、其安全原语,以及那些无人预料到的故障模式。

llmops
prompt-management
deployment
architecture
·tian

影子 AI 治理难题:为什么禁止个人 AI 账号会让安全性变差

阻止员工使用个人 ChatGPT 或 Claude 账号并不能停止 AI 的使用 —— 反而会让其变得不可见。本文将探讨如何调研影子 AI、建立合规渠道,并避免治理演戏。

insider
ai
security
governance
+1
·tian

你的 AI 功能忘记计入的 SIEM 账单

发布 AI 功能会让你的审计日志量增加 10–50 倍。随之而来的 SIEM 续费账单中,包含着失效的检测规则和没人预料到的法律留存问题。

ai-engineering
observability
security
siem
+1
·tian

静默量化:为什么你今天付费的模型不再是上个季度购买的那个

随着推理经济效益的收紧,供应商在相同的模型名称下悄悄切换到了精度更低、成本更廉价的层级。本文将探讨为什么版本字符串不再是一份契约,以及用来替代它的探测集、路由层和 SLA 条款。

llm-ops
inference
evals
vendor-management
+1
·tian

技能即模块:当你的智能体堆栈需要导入系统时

智能体运行时正在拙劣地重新发明导入系统 —— 名称解析、版本锁定、依赖图和冲突检测,这些都是隐藏在技能生态系统下尚未解决的问题。

agents
skills
package-management
runtime
+1
·tian

何时跳过实时 LLM 推理:异步批处理流水线的生产实践

大多数 LLM 工作负载都适合批处理,但团队默认使用同步调用,因为 API 使其变得简单。本文提供了盈亏平衡分析,以及异步方案在成本和用户体验上优于流式处理的功能类别。

llm
production
architecture
cost-optimization
+1
·tian

当你的模型具有随机性时,快照测试在撒谎

快照测试假设相同的输入加上相同的代码等于相同的输出。一旦 LLM 调用进入循环,这一契约就会失效,测试套件也会悄然变成一种走过场的“橡皮图章”。本文介绍了取代它的测试分类法。

llm
testing
ai-engineering
evals
+1
显示第 949–960 篇,共 2312 篇