跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

当硬件说谎时:静默数据损坏遇上随机性软件

大约每千个加速器中就有一个会静默地计算出错误答案,而 LLM 推理是第一个硬件故障与采样噪声看起来完全一致的大规模工作负载。本文将探讨位翻转如何隐藏在随机输出中,以及如何利用金丝雀通道和单机统计数据来捕捉说谎的 GPU。

insider
ai-engineering
reliability
gpu
+2
·tian

一次性软件:编写、运行、删除

AI 让编写一次性脚本的成本比寻找和配置现有工具更低——但这种短暂代码跳过了安全审查并抹去了组织性的经验积累。本文探讨了丢弃式软件的真实成本,以及临时工具必须转化为正式产品的四大准则。

ai
code-generation
software-engineering
governance
·tian

技能是过程性知识的包管理器

RAG 检索事实,但过程性知识必须完整加载或根本不加载。为什么 Agent 技能的表现类似于包生态系统 —— 以及为什么你的操作手册现在需要版本控制、测试、代码审查和负责人。

insider
ai
agents
skills
+1
·tian

你在廉价模型上测试,却在昂贵模型上部署

在廉价模型上运行 CI 和评估,而生产环境却使用尖端模型,这在最关键的地方破坏了开发与生产环境的一致性。本文将探讨为什么层级差距会使你的评估门控失效,以及缩小这一差距的预算计算方法。

insider
llm
evals
ci-cd
+1
·tian

让所有模型都变得平庸的抽象层

多供应商 LLM 网关承诺可以通过一行代码切换模型,但却悄无声息地剥离了提示词缓存、模式强制执行和推理控制——而这些正是决定成本和质量优势的核心功能。本文将探讨何时值得支付这种“可移植性税”,以及如何利用“逃生舱”模式回归供应商原生功能。

llm
ai-engineering
infrastructure
architecture
·tian

无障碍树是你最新的公共 API

浏览器代理读取的是你的 ARIA 角色和 DOM 语义,而不是像素 —— 因此,过去十年推迟的无障碍债务现在变成了与收入挂钩的集成债务。本文将介绍如何像审计公共 API 一样审计你的无障碍树。

ai-agents
accessibility
browser-automation
web-development
·tian

你的 Agent 从未读过的 ADR

编程智能体正以机器速度重新审视每一个未记录的决策。本文探讨了为什么架构决策记录(ADR)已从官僚式的点缀演变为集群基础设施,如何将它们接入智能体上下文,以及无人提醒你的过时 ADR 失效模式。

ai-agents
architecture
documentation
agentic-engineering
·tian

掌握你信用卡的人工智能代理:支出授权、商户欺诈以及当买家是软件时的争议处理

AI 代理在为人类设计的支付轨道上完成了价值 2620 亿美元的节日订单。本文将探讨支出授权、代理令牌和委托证明的工作原理,以及当代理买错东西时,谁来承担损失。

agentic-commerce
payments
ai-agents
fraud
·tian

新员工带来的智能体:个人 AI 记忆是双向的知识产权边界

现在,员工带着个人 AI 助手入职,这些助手的记忆中存储了上一份工作的上下文——而在离职时,你的公司信息又会被吸收到一个你无法审计或擦除的租户中。本文探讨了为什么智能体记忆是一个商业机密管理问题,以及入职、离职流程和雇佣合同需要做出哪些改变。

ai-agents
memory
trade-secrets
enterprise
+1
·tian

批处理层级是 AI 时代的竞价实例

你有一半的智能体工作负载可以忍受数小时的延迟,且供应商为此层级提供了 50% 的折扣——但目前这些任务却都在交互式端点上运行。本文提供了一个根据延迟容忍度对 LLM 任务进行分类的框架,探讨了如何在 24 小时的批处理窗口中生存,并将“延迟执行”作为一种设计决策。

ai-engineering
llm
cost-optimization
agents
+1
·tian

黑板模式回归:1980 年代的 AI 如何处理多智能体协作

通过共享计划文件进行协作的智能体团队正在重新发现 20 世纪 70 年代的黑板架构 —— 但他们只重建了白板,却遗忘了让其发挥作用的调度器、置信度评分和层级结构。

insider
ai-agents
multi-agent-systems
architecture
+1
·tian

编译器是你运行过最廉价的评估 (Eval)

你的语言选择决定了智能体是能在每次编辑时获得一个免费、即时且确定性的验证器,还是将类型错误推迟到昂贵的评估套件和运行时的意外中。模型编写代码的方式如何重构了团队在十年前确定的技术栈权衡。

ai-engineering
coding-agents
programming-languages
type-systems
显示第 61–72 篇,共 2312 篇