跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

Prompt Caching 的隐形代价:当缓存命中提供错误的用户上下文时

Prompt 缓存键是一个正确性边界,而非一个计费开关。如果你只为了提高命中率而设计它,就会引发跨租户上下文泄露和过时的个性化。

ai-agents
prompt-caching
llm
architecture
+1
·tian

Prompt Injection 是混淆代理问题,而非内容过滤问题

将 Prompt Injection 视为内容过滤问题是一场注定失败的军备竞赛。真正的漏洞在于“混淆代理”:即智能体利用借来的权限执行来自不可信渠道的指令。解决方案应当是限制其能力范围。

security
ai-agents
llm
prompt-injection
·tian

对话的平方成本:为什么 AI 聊天支出呈超线性增长

一次 10 轮的对话成本大约是单轮对话的 55 倍,而非 10 倍,因为每一轮都会对整个历史记录重新计费。本文将分析 N 平方背后的数学原理、为什么缓存无法彻底解决问题以及如何对其进行限制。

llm
cost-optimization
unit-economics
context-window
+1
·tian

演变成产品决策的速率限制

供应商配额不再仅仅局限于后端。当智能体在任务执行过程中达到每分钟 Token 数上限时,失败会直接反馈给用户 —— 因此,速率限制现在成了产品设计必须考虑的一部分。

llm
rate-limiting
product-design
agents
+1
·tian

自信地返回错误答案的语义缓存

语义缓存用精确匹配的保证换取了低延迟,而代价则是将误命中作为流畅的事实返回。本文将探讨如何衡量误命中率、选择 Embedding 模型、缓存检索而非生成,并将阈值调优作为一项安全决策。

llm
caching
ai-engineering
rag
+1
·tian

影子 AI:你的团队已经上线的 AI 智能体

你的员工中有一半已经在运行未经批准的 AI 工具,而严厉打击只会让他们转入地下。为什么影子 AI 是官方路径缓慢的症状——以及一条更快的“铺就之路”如何解决这一问题。

shadow-ai
ai-governance
security
llm
+1
·tian

流式回滚问题:你无法收回已发送的 Token

流式输出在任何护栏检查之前就已触达用户。本文将探讨为什么输出审核与 Token 流式传输在结构上存在冲突,以及如何通过缩短暴露窗口来应对这一问题,而非对其视而不见。

insider
llm
guardrails
streaming
+2
·tian

用户过早行动的流式 Token

逐个 Token 的流式传输让助手感觉响应迅速,但它也会将模型未完成的思考作为最终答案展示出来。本文将探讨导致这一问题的竞态条件以及解决该问题的设计模式。

llm
ux
streaming
ai-engineering
+1
·tian

结构化输出并非经过验证的输出

JSON 模式和受限解码只能保证 LLM 响应的形状,而非其含义。本文探讨了为什么通过 Schema 检查只是正确性工作的开始,以及语义验证真正的归宿。

insider
llm
structured-output
validation
+2
·tian

每次事故后你的系统提示词都会增长 —— 而且没人会删掉任何一行

每一个生产事故都会在你的系统提示词中留下一句防御性语句,而且从来没人会删掉它们。本文将探讨为什么提示词积聚是真实的技术债,以及如何通过日期标记、半衰期和消融实验来修剪它。

insider
llm
prompt-engineering
ai-agents
+1
·tian

那个记得你撤回了什么的智能体:将删除作为一等公民的记忆操作

只增(append-only)的智能体记忆存储在存储的事实失效的那一刻就开始腐烂。为什么删除、撤回和失效必须是一等公民操作 —— 以及如何设计可被查找、反驳和移除的记忆写入。

insider
ai-agents
memory
llm
+1
·tian

Token 预算是调度问题,而非提示词问题

当一个冗长的工具结果耗尽上下文窗口时,智能体的质量就会下降。应像对待操作系统内存一样对待 Token 预算:设置上限,按优先级淘汰,并为推理留出空间。

ai-agents
context-engineering
llm
system-design
显示第 121–132 篇,共 778 篇