跳转到主要内容

94 含有标签「infrastructure」

Posts tagged "infrastructure" on TianPan.co.

查看所有标签

·tian

长出胳膊和腿的缓存提示词前缀

六个月前你的提示词前缀是 4k tokens,几乎可以摊销到免费。今天它是 11k tokens,你的缓存命中率是 31%,没有人能指出是哪个 PR 干的。

insider
llm
prompt-engineering
cost-optimization
+2
·tian

AI 功能规格说明书中无人提及的碳排放项

每一场 AI 功能评审都在争论延迟、Token 成本和准确率——却唯独没人讨论能耗。本文将介绍如何衡量单次请求的碳排放,并将其转化为团队需要负责的关键指标。

ai-engineering
sustainability
observability
infrastructure
·tian

温池与冷真相:Serverless LLM 推理中隐藏的延迟底线

将 GPU 推理缩容至零会将稳定的资金成本转化为隐藏在 p99 尾部延迟中的尖峰延迟成本。本文将为你介绍盈亏平衡计算方法和缓解工具集。

insider
llm
inference
serverless
+2
·tian

智能体临时目录:无人盘点的无主文件系统 PII 暴露面

智能体工作线程在无人分类的磁盘上累积了临时文件系统状态——提取的 PDF、转录的音频、缓存的附件。解决方案在于为这一层级命名,而非追求架构上的复杂性。

insider
ai-agents
security
data-classification
+2
·tian

区域模型发布的“彩票”效应:当你的产品在不同大洲表现各异时

云服务商的模型发布在各区域间并不同步。你的单模型抽象层在不同大洲之间悄然分化,而评估测试集往往是最后才发现这种差异的地方。

insider
ai-engineering
infrastructure
reliability
·tian

昼夜延迟:为什么你的 AI 功能在东部时间上午 9 点最慢

前沿模型的延迟遵循由他人流量决定的每日曲线。通过分时段队列、批量路由和负载感知故障转移,可以将这种“幽灵般的”性能退化转变为一个调度问题。

insider
llm-ops
latency
observability
+1
·tian

AI 功能依赖图:当多个服务共用同一个模型时的韧性工程

当 15 个产品功能共享同一个嵌入模型和 LLM 端点时,一旦供应商发生故障,就会演变成一场没有堆栈跟踪的分布式系统崩溃。本文将探讨如何映射 AI 功能依赖关系、在每一层应用熔断器,并设计降级链,使功能在故障时能够干净地退出,而不是导致输出错误。

ai-engineering
reliability
llm
infrastructure
·tian

你的负载测试在撒谎:生产环境中的 LLM 供应商容量争用

LLM API 是多租户共享基础设施 —— 你的负载测试在凌晨 2 点通过,但生产环境的延迟在周二上午 9 点却出现飙升。了解共享峰值需求的机制以及保护你 SLO 的架构模式(多供应商对冲、熔断器、预留容量)。

llm
production
reliability
infrastructure
+1
·tian

配额饥饿:当你的 AI 功能相互消耗速率限制时

当多个 AI 功能共享同一个 API 密钥时,优先级由谁先发出请求隐式决定。以下是如何在批处理任务饿死面向用户的功能之前,让配额分配变得明确。

llm
rate-limiting
infrastructure
ai-engineering
·tian

多租户 LLM 推理中的调度公平性:为什么 FIFO 是错误的默认选择

当多个团队共享 LLM 推理基础设施时,朴素的 FIFO 调度会导致优先级反转和 SLO 违规。以下是生产环境中公平调度的真实面貌。

insider
llm
infrastructure
mlops
+1
·tian

向量维度税:嵌入维度如何悄然侵蚀你的预算

大多数团队从模型默认值中选取嵌入维度,而不衡量其成本。本文介绍维度如何影响存储、延迟和质量,以及如何有意识地进行权衡。

embeddings
rag
vector-search
infrastructure
·tian

AI产品的暗能量:没人预算过的后台计算

每个拥有持久化状态的AI产品都在运行不可见的推理,这些推理永远不会出现在你的延迟仪表盘或成本模型中。本文告诉你如何找到它、度量它,并决定是否关掉它。

insider
ai-engineering
cost-optimization
observability
+1
显示第 25–36 篇,共 94 篇