跳转到主要内容

94 含有标签「infrastructure」

Posts tagged "infrastructure" on TianPan.co.

查看所有标签

·tian

多租户 LLM 问题:规模化部署中的嘈杂邻居、隔离与公平性

当数千名用户共享同一模型和向量索引时,一次高消耗的会话会拖慢所有人。本文解释了为何多租户 LLM 基础设施比数据库更难处理——以及真正有效的公平性保障方案。

insider
infrastructure
llm
multi-tenancy
+2
·tian

你团队的基准测试正在互相欺骗:共享评估基础设施的污染问题

共享评估基础设施通过缓存补全、顺序运行污染和提示词状态渗漏悄无声息地破坏基准测试结果——而大多数团队从未察觉。本文介绍修复这一问题的技术和组织控制措施。

insider
ai-engineering
evaluation
infrastructure
+1
·tian

AI 依赖足迹:每个功能都在增加新的基础设施所有者

你上线的每一个 AI 功能都会引入新的基础设施依赖——向量数据库、嵌入模型、评估框架、GPU 推理层。问题不在于依赖本身,而在于没有人真正拥有它们。

ai engineering
infrastructure
platform engineering
mlops
·tian

嵌入漂移问题:语义搜索的静默退化

嵌入模型将语言冻结在训练时刻。随着新术语的涌现,你的语义搜索正在悄然失准——没有错误触发,没有告警响起。本文教你如何检测并应对这一问题。

embeddings
vector-search
RAG
production-ml
+1
·tian

共享 LLM 基础设施中的“吵闹邻居”问题:AI 功能的租户模型

当某个功能的批处理作业耗尽了共享的 API 配额时,付费用户会看到 429 错误。本文将介绍共享 LLM 基础设施的检测信号与隔离模式。

insider
llm
infrastructure
ai-engineering
+2
·tian

TTFT 才是用户真正感知到的唯一延迟指标

你的基础设施团队优化的是端到端生成时间,而用户评判响应速度的标准是第一个 Token 何时出现。本文深入解析 TTFT——它的成因、测量方法,以及如何围绕它进行设计。

llm
performance
ux
infrastructure
·tian

智能体系统中的写放大:为什么一次工具调用会命中六个数据库

智能体的一次记忆操作会同时触发对六个存储系统的写入。当第五个写入失败时会发生什么——以及来自数据库内部的预防模式。

insider
agent-architecture
infrastructure
distributed-systems
+1
·tian

LLM 流水线的背压模式:为何指数退避还不够

四种生产模式——令牌桶队列、优先级通道、感知令牌预算的熔断器和负载卸除——在指数退避让系统陷入持续过载振荡时,让 LLM 流水线保持稳定可靠。

llm
infrastructure
rate-limiting
ai-engineering
+1
·tian

大多数团队都会搞错的 LLM 基础设施“自研还是购买”决策

大多数团队在做 LLM 基础设施“自研还是购买”的决策时,都低估了双方的总拥有成本 (TCO)。本文将为你分析各个阶段的盈亏平衡计算,以及那些没人列入预算的隐藏成本。

llm
infrastructure
cost
self-hosting
·tian

供应商可靠性陷阱:你的 LLM 供应商 SLA 已成为你用户的 SLA

你对外宣称 99.9% 的正常运行时间,但你的关键路径却依赖于一个只有 99.5% SLA 的 API——而供应商故障往往集中发生在流量高峰期。以下是在故障找上门之前弥合差距的方法。

insider
reliability
production-ai
infrastructure
+1
·tian

混合 LLM 工作负载的 GPU 调度:那个没人解决好的装箱问题

在共享 GPU 集群上服务多个 LLM 模型会浪费 30–50% 的可用算力。本文解析 Kubernetes GPU 调度为何不适用于 LLM 推理,以及真正有效的解决方案。

insider
llm
infrastructure
gpu
+2
·tian

质量感知模型路由:为什么仅优化成本会毁掉你的 AI 产品

仅优化成本的 LLM 路由虽然省钱,但会悄悄降低最重要查询的质量。本文提供按任务复杂度、模型能力和生产反馈进行路由的实用指南——而不仅仅是按每 token 价格。

ai-engineering
llm
model-routing
production
+1
显示第 73–84 篇,共 94 篇