跳转到主要内容

94 含有标签「infrastructure」

Posts tagged "infrastructure" on TianPan.co.

查看所有标签

·tian

跨区域 Prompt 版本偏差:你的 CDN 误运行了六小时的 A/B 测试

通过类似 CDN 的发布系统推送 prompt 时,如果一个区域领先于另一个区域,就会产生隐形的地理分割 A/B 测试。这里介绍了保持 prompt 版本全球一致性的发布规范、可观测性维度和回滚模型。

llm
mlops
deployment
observability
+1
·tian

当你的 CLI 开始说英语:可提示基础设施的最小权限原则

当你的 CLI 开始接受英语时,最小权限原则就失效了。每一个将意图转化为命令的封装层都变成了一个“混淆代理”。目前行之有效的模式包括:锚定已解析计划的意图绑定令牌、强制性模拟运行(dry-run)以及将提示词与动作图关联起来的审计追踪。

insider
security
ai-agents
authorization
+2
·tian

你的智能体发件箱将是你的下一个送达率事故

一个智能体在早餐前发出了 80,000 封邮件,导致重置密码域名的声誉在六周内荡然无存。在第一次发送之前,你需要建立子域名、DKIM 和速率限制的纪律。

insider
agents
email
deliverability
+2
·tian

你的 API 曾假设一次只有一个人类用户。并行智能体打破了这一契约。

内部 API 是为人类节奏的会话而设计的。当用户生成并行智能体时,速率限制、幂等性假设、审计日志架构和 CSRF 流程都会瞬间失效。

insider
agents
apis
infrastructure
+2
·tian

主权崩塌:记录你的 Prompt 究竟去了哪里

应用日志显示请求发送到了 eu-west-1,但提供商在故障转移期间将其路由到了美国和新加坡。构建单次请求的主权路径,将审计转化为可查询的资产。

insider
llm
compliance
gdpr
+2
·tian

Agent 的链路追踪采样:每日千万级 Span 中哪些值得保留

为什么默认的均匀采样在 Agent 工作负载中会失效,以及决定你的链路账单和故障平均修复时间 (MTTR) 的四个关键决策 —— 开始、结束、分层与保留。

agents
observability
llm
sampling
+1
·tian

Embedding API 的 “隐藏税”:为什么向量支出在不知不觉中超过了生成成本

Embedding API 的支出在规模化过程中会悄然增长,并最终超过生成成本。本文将深入分析主导账单的工作负载、扭转成本曲线的架构杠杆,以及自托管的盈亏平衡计算。

embeddings
cost-optimization
vector-database
rag
+1
·tian

你的 P99 正在受陌生人流量的影响:托管 LLM 推理中的“吵闹邻居税”

托管 LLM API 在你从未见过的租户之间共享 GPU、批处理和 KV 缓存预算,因此你的尾部延迟会随陌生人的流量而波动。本文将介绍如何证明这一点、如何缓解,以及何时决定转向专用算力。

llm
infrastructure
observability
latency
+1
·tian

多模型可靠性并非 2 倍:引入第二个 LLM 服务商的非线性成本

团队引入第二个 LLM 服务商通常期望以 2 倍的成本获得近乎完美的可用性。但在生产环境中,运维成本往往是 4-5 倍,相关性故障削弱了可用性增益,而单一服务商内设计良好的降级模式通常更具优势。

insider
llm
reliability
multi-model
+2
·tian

你的 RAG 分块器是一项无人 Review 代码的数据库 Schema

将你的 RAG 分块器视为预处理,每一次边界微调都会变成一次静默的 Schema 迁移。对其进行版本管理、灰度发布,并同步负责检索评估。

insider
rag
retrieval
vector-database
+2
·tian

AI 推理的突发容量规划:当黑色星期五遇上你的 KV Cache

AI 推理负载对流量峰值的响应与传统 API 截然不同——冷 KV Cache、长达数分钟的冷启动、受内存限制的并发,使得响应式自动扩缩容方案完全失效。本文介绍实用的容量规划计算方法、预热策略,以及真正有效的优雅降级模式。

insider
ai-engineering
infrastructure
performance
+2
·tian

AI 工作负载的容量规划:当 Token 成为你的核心资源时,传统方法为何失效

传统供应模型在 LLM 工作负载下会失效。本文介绍了一套考虑 Token 突发性、KV 缓存压力的预测方法,并解释了为何 GPU 利用率是一个误导性信号。

ai-engineering
infrastructure
llm
performance
显示第 49–60 篇,共 94 篇