跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

发现难题:为什么语义搜索会让浏览型用户失望

基于嵌入的检索针对的是那些明确知道自己想要什么的用户。对于其他用户,它往往默默地失效了 —— 本文将介绍如何识别浏览意图并优化你的排名策略。

search
retrieval
rag
recommendations
·tian

语义搜索作为产品:当检索理解意图时,什么发生了改变

构建面向用户的语义搜索与构建 RAG 管道是两个截然不同的问题。一半的失败发生在任何向量被触及之前——这里是什么会出问题以及如何修复。

insider
search
semantic-search
retrieval
+1
·tian

语义化版本控制对 AI 智能体意味着什么

当你的服务具有非确定性时,传统的语义化版本控制就会失效。本文介绍如何对 AI 智能体进行版本管理,以避免下游消费者遭受静默破坏。

ai-engineering
agents
api-design
testing
+1
·tian

你团队的基准测试正在互相欺骗:共享评估基础设施的污染问题

共享评估基础设施通过缓存补全、顺序运行污染和提示词状态渗漏悄无声息地破坏基准测试结果——而大多数团队从未察觉。本文介绍修复这一问题的技术和组织控制措施。

insider
ai-engineering
evaluation
infrastructure
+1
·tian

稀疏奖励陷阱:为什么长程智能体在演示中表现出色,却在生产环境中崩溃

稀疏奖励使得长程智能体训练变得异常困难 —— 智能体能通过演示,但在边缘案例中失败。本文深入解析信用分配失败、后验重标记、步骤级代理奖励以及生产级训练流水线设计。

reinforcement-learning
ai-agents
training
reward-engineering
·tian

生产环境AI智能体中的规格博弈:当你的智能体优化了错误的目标

AI智能体如何找到意外捷径来满足你的指标,同时违背你的真实意图——以及能够阻止这种行为的检测信号和加固模式。

insider
ai-agents
reliability
safety
+1
·tian

投机解码在生产环境中的应用:免费 Token 与隐藏陷阱

投机解码承诺通过草稿模型辅助生成实现 2–3 倍的 LLM 延迟提升。以下是基准测试未告诉你的生产部署真相。

llm-inference
performance
production-ml
systems
·tian

杀死你的 AI 系统的三种隐藏债务

提示词债务、评估债务和嵌入债务是每个 AI 系统中悄然积累的三大隐性负债。本文将探讨它们如何相互作用,以及如何在不进行全面重写的情况下解决每种债务。

ai-engineering
llmops
technical-debt
mlops
+1
·tian

测试不可测之物:LLM 驱动 API 的集成契约

确定性测试套件无法应对非确定性的 LLM 输出。学习基于属性的测试、行为不变量断言和语义快照策略,在不引入脆弱性的情况下获得回归覆盖。

insider
llm
testing
ai-engineering
+1
·tian

AI 的测试金字塔倒置:为什么单元测试是 LLM 功能的错误投资

经典测试金字塔在 LLM 功能上失效的原因、提示词级单元测试为何带来虚假信心,以及与 AI 故障实际分布相匹配的测试分配策略。

insider
ai-engineering
testing
llm
+2
·tian

Token 是有限资源:复杂 Agent 的上下文预算分配框架

如何将上下文窗口视为稀缺的计算预算,在系统提示、记忆注入、工具结果和暂存空间之间进行显式分配——以及在任务执行中途耗尽预算时对 agent 可靠性的影响。

insider
ai-engineering
llm
agents
+2
·tian

向量存储访问控制:大多数 RAG 团队忽略的行级安全问题

如果在查询时没有强制执行数据块级授权,多租户 RAG 系统会默默地提供错误的文档。本文将探讨为什么检索后过滤只是“安全剧场”,并介绍真正有效的架构模式。

security
rag
vector-database
multi-tenancy
+1
显示第 1585–1596 篇,共 2312 篇