跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

混合 PR 队列:审查者吞吐量已成为瓶颈约束

编程智能体消除了代码编写的约束,并将负载转嫁到了审查队列。如果不重新设计审查机制就直接上线智能体,团队交付的将只是一个积压工作生成器。

coding-agents
code-review
engineering-velocity
pr-workflow
+1
·tian

多维 Agent 二分查找:当回归出现在交互中时

当 Agent 的回归源于新模型与新工具描述之间的交互时,单轴回滚会产生明显的假阴性。解决方案是对模型、Prompt、工具目录、检索索引和采样配置的笛卡尔积进行二分查找——并以命名的版本信封作为回滚的最小单元。

agents
debugging
evals
observability
+1
·tian

多模态通道冲突:当模型在视觉与文本之间自我矛盾时

多模态模型会静默地将冲突的视觉和文本通道融合为自信的混合答案。本文探讨这种失效发生的场景、评估指标为何会漏掉它,以及如何构建一个冲突检测原语。

insider
multimodal
vision-language-models
evaluation
+2
·tian

Prompt 卧推:对“快乐路径”之外的提示词进行压力测试

大多数 prompt 评估只针对“快乐路径”打分而忽略了长尾情况。构建一个涵盖长度、语域、语言和正式程度变化的压力矩阵,并根据性能下降曲线而非单一的准确率数值进行评分。

ai-engineering
evaluation
prompt-engineering
robustness
+1
·tian

Prompt Cache 作为隐蔽信道:TTFT 探测泄露跨租户 Prompt

Prompt 缓存通过在租户间共享 KV 状态,可为缓存请求节省 80–90% 的开销——但也让首词延迟 (TTFT) 变成了一个侧信道,能以 92% 的准确率恢复其他客户的 Prompt。这是大多数团队尚未权衡过的成本与隔离之间的博弈。

insider
ai-security
llm-infrastructure
multi-tenancy
+2
·tian

提示词注入漏洞赏金:当“损坏”没有明确定义时,如何划定程序范围

标准的赏金准则在面对以“提供帮助”为行为规范的 AI 功能时会失效。一个有效的程序需要基于 CIA 的严重性评估标准、概率性复现条款、明确的工具范围清单、安全港协议下的指定测试租户,以及一个受修复 SLA 约束的 AI 团队。

security
ai-agents
bug-bounty
prompt-injection
+1
·tian

量化质量悬崖:当 int4 通过中位数评估却在长尾场景失效时

int4 量化将推理成本减半,且几乎不影响中位数基准测试——却在悄无声息地破坏稀有 Token 补全、低资源语言和长文本推理能力。本文将探讨为什么这种“悬崖式”下降在通过审核的评估套件中是不可见的,以及如何在客户发现之前通过上线纪律让这种退化显现出来。

insider
quantization
llm-inference
model-evaluation
+1
·tian

区域模型发布的“彩票”效应:当你的产品在不同大洲表现各异时

云服务商的模型发布在各区域间并不同步。你的单模型抽象层在不同大洲之间悄然分化,而评估测试集往往是最后才发现这种差异的地方。

insider
ai-engineering
infrastructure
reliability
·tian

当被遗忘权遇上微调:当删除止于快照

一旦客户数据进入损失函数,删除就不再是简单的行操作,而变成了系统重构。本文探讨血缘链、四种政策选择,以及现在已成为阻碍交付关键问题的采购条款。

insider
privacy
gdpr
fine-tuning
+2
·tian

采样漂移:当 Temperature 和 Top-P 变成团队内部的“口头传说”

生产环境中的采样配置往往堆积了大量未经记录的 Temperature、Top-P 和惩罚项数值。当初设置这些参数的理由早已模糊,但其影响却在不断叠加。本文介绍一种捕捉此类问题的工程规范。

llm
sampling
prompt-engineering
ai-engineering
+1
·tian

静默工具截断:你的智能体在不知情下进行推理的默认限制

大多数智能体框架会在超过隐藏的字节或 Token 限制时静默裁剪工具输出。模型会基于一个它无法察觉是被截断后的片段进行推理,而这个 Bug 往往在几个月后才会因客户投诉而浮现。

insider
agents
mcp
llm-ops
+1
·tian

需求文档、代码、测试皆出自一人:你正在悄然失去的独立性

当同一个模型编写需求文档、代码和测试时,“所有测试通过”不再是功能正常的证据 —— 它仅仅证明了模型在逻辑上是自洽的。

ai-engineering
testing
code-review
llm-coding
显示第 625–636 篇,共 2312 篇