跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

你的智能体假设存在的“撤销”按钮

AI 智能体在规划时往往假设每个动作都是可以撤销的,这是在可逆的代码沙盒中养成的习惯。通过在工具中编码可逆性分级,确保“单向门”决策的安全性。

insider
ai-agents
llm
system-design
+1
·tian

温池与冷真相:Serverless LLM 推理中隐藏的延迟底线

将 GPU 推理缩容至零会将稳定的资金成本转化为隐藏在 p99 尾部延迟中的尖峰延迟成本。本文将为你介绍盈亏平衡计算方法和缓解工具集。

insider
llm
inference
serverless
+2
·tian

当廉价模型变得更昂贵时

将流量路由到较小的模型虽然降低了每 token 的成本,但可能会增加每个完成任务的成本。本文将分析节省的成本是如何流失的 —— 以及你如何在发布前进行衡量。

llm
cost-optimization
model-routing
evaluation
+1
·tian

Agent 记忆是一个没有失效策略的缓存

长期记忆通常被作为一项功能发布,但它本质上是一个关于不断变化的世界的事实缓存。如果没有失效、溯源和冲突规则,它就会变成一个缓慢发生的正确性 Bug。

ai-agents
memory
caching
llm
+1
·tian

置信度分数税:为什么询问模型它有多确定比直接出错成本更高

在 LLM 输出中添加置信度字段看起来是免费的。但事实并非如此。本文将介绍它所带来的单次请求“税”、为什么该数字很少经过校准,以及在根据它进行生产流量路由之前需要衡量什么。

insider
llm
calibration
ai-engineering
+2
·tian

改变答案的重试:针对非确定性 LLM 调用的幂等键

重试超时的 LLM 调用并不会重新获取相同的答案 —— 而是会采样一个新的。本文将探讨为什么针对非确定性后端的超时重试会失效,以及幂等键如何让它重新变得安全。

insider
llm
reliability
idempotency
+1
·tian

先返回 200 然后失败的流式响应:中途错误如何破坏你的 SLO

流式端点在第一个 token 刷出的瞬间就会确认 200 状态,因此之后发生的每一个失败都会躲过负载均衡器、重试中间件和 SLO 仪表板。本文将介绍如何让响应体承担起 HTTP 头部已无法传达的判定结论。

streaming
observability
reliability
llm
+1
·tian

具有两种延迟的 AI 功能:你衡量的是一种,用户感知的是另一种

流式 AI 功能具有两种分化的延迟 —— 首字时间 (TTFT) 和完成时间 —— 而大多数团队只测量了用户感知最不明显的那一个。本文将介绍如何拆分指标和 SLO。

llm
latency
observability
streaming
+1
·tian

检索引用税:为什么合规性会增加 30% 的 RAG Token 账单

在 RAG 系统中添加引用看起来只是改一行系统提示词。但在受监管的租户中,它会悄无声息地让推理成本增加 25%–40%。本文将探讨为什么这种“税收”是结构性的,以及哪些架构层面的调整可以帮你挽回大部分成本。

insider
rag
ai-engineering
compliance
+2
·tian

二稿 Agent 模式:为什么“先探索再交付”优于“自我批判”

一种双阶段的 Agent 架构 —— 先进行发散性的初稿探索,再在受限上下文中进行精简执行 —— 在质量和成本上通常都优于 n-of-k 的自我批判循环。

insider
ai-agents
llm
agent-patterns
+2
·tian

对话历史是信任边界,而非文本块

对话历史是多源反馈流,而非仅可追加的状态。为每一轮对话的来源打上标签,使用 HMAC 锚定用户回合,并将工具输出封装在信任区内 —— 否则你的 Agent 攻击面将随对话轮数线性增长。

insider
ai-security
agents
prompt-injection
+2
·tian

自我批判税:让模型检查自己的工作如何导致成本翻倍却收益甚微

Self-Refine、验证链(Chain-of-Verification)和反思提示词在基准测试中承诺了巨大的质量提升 —— 但在生产环境中,它们会使成本增加三倍,导致延迟激增,而实际收益却远低于宣传水平。本文将教你如何在上线前评估这项 “自我批判税”。

insider
llm
cost-optimization
reliability
+1
显示第 133–144 篇,共 778 篇