跳转到主要内容

94 含有标签「infrastructure」

Posts tagged "infrastructure" on TianPan.co.

查看所有标签

·tian

AI功能的隐性税:你的推理账单没有告诉你的事

推理仅占生产环境中运行AI功能真实成本的20-30%。以下是核算完整成本栈的方法——从向量数据库和嵌入,到人工审核和提示工程人力成本。

ai
cost
infrastructure
production
·tian

部署前的自主权红线:团队在事故迫使对话之前跳过的安全演练

一个具体的框架,用于在生产部署之前定义 AI 智能体永远不被允许执行的操作——以及为何将这些限制编码在系统提示词中是不够的。

insider
ai-agents
safety
infrastructure
+1
·tian

推理集群:将SRE规范应用于多供应商LLM依赖管理

生产AI技术栈如今横跨多个供应商、微调端点和自托管模型。管理它们需要SRE风格的集群纪律:服务目录、按供应商的SLO追踪、容量规划以及清晰的所有权模型。

insider
llm
sre
infrastructure
+2
·tian

多区域 AI 部署:数据驻留、模型一致性与被忽视的延迟成本

多区域 AI 部署上线后,三类隐性成本往往被严重低估:模型版本不一致导致的输出差异、GDPR 区域 KV 缓存隔离推高的单 token 成本,以及不了解数据驻留规则的重试逻辑引发的静默合规违规。

llm
deployment
data-residency
compliance
+1
·tian

生产级智能体的 90 秒冷启动:当 LLM 不再是瓶颈时

生产级智能体在模型运行之前,通常需要 60 到 120 秒进行冷启动。解决方案不在于更快的 TTFT — 而在于将冷启动延迟视为一级 SLO,并通过预热池、快照/恢复、工具延迟加载以及 CI 门禁来进行优化。

insider
ai-agents
latency
infrastructure
+2
·tian

没上线新功能的 AI 工程师该如何写晋升材料

那些工作重点在于“预防”的 AI 工程师——比如捕捉到的评估回退、未产生的成本、从未发生的事故——该如何编写一份能让校准委员会给出高分的晋升材料。

ai-engineering
career
promotion
eval
+1
·tian

物理隔离 LLM 蓝图:无出站流量部署的真正需求

云端 AI 栈将出站 HTTPS 视为一种免费的原语。拔掉网线后,每一层(从模型溯源、评估到集群管理和遥测)都必须被迫重新构建那些在云端版本中被悄悄隐藏的原语。

insider
ai
llm
security
+2
·tian

你的 LLM 账单只占 Agent COGS 的一半 —— 另一半是无人监控的部分

推理仅占 Agent 真实成本的 40-60%。另一半则隐藏在向量数据库、检索嵌入、遥测、重试、评估和人工审核中 —— 而这些成本往往没有明确的归口团队。

insider
ai-agents
finops
unit-economics
+2
·tian

你的 APM 正在悄悄丢弃 LLM 遥测数据,而 Bug 就隐藏在这些缝隙中

传统的 APM 是为有限维度和无状态服务设计的。LLM 工作负载的基数特征更接近产品分析,这种不匹配会悄悄抹除那些能暴露提示词故障的唯一信号。

insider
ai-engineering
observability
llm-ops
+2
·tian

Token-Per-Watt:你的仪表盘无法计算的 AI 可持续性指标

幻灯片上显示的总 GWh 并不是 AI 可持续性指标。与产品遥测数据结合的任务瓦特 (Task-watts) 才是 —— 而你的首席财务官 (CFO) 即将要求的仪表盘目前还无法计算它。

insider
ai-engineering
sustainability
finops
+2
·tian

分词器漂移:你的本地计数在撒谎,账单才说真话

本地分词器与供应商计费计数在 CI 从未测试的长尾内容上存在 5%–15% 的差异。这一差距正在吞噬你用户实际使用场景下的安全边界。

llm
tokenization
infrastructure
observability
+1
·tian

反事实日志:通过今天的充足记录,在明年的模型上重放昨天的流量

生产环境中的 LLM 日志能很好地回答“模型说了什么”,却难以回答“模型看到了什么” —— 正是这种差距导致了数月后的模型迁移评估宣告失败。本文介绍了一种用于可重放追踪的实用模式。

insider
ai-engineering
observability
llm-evaluation
+1
显示第 37–48 篇,共 94 篇