跳转到主要内容

26 含有标签「ai-infrastructure」

Posts tagged "ai-infrastructure" on TianPan.co.

查看所有标签

·tian

级联路由的可靠性陷阱:当成本优化悄然摧毁你的 p95 延迟

级联路由能够显著降低 LLM 开销 —— 但同时也会悄然降低尾部延迟、污染你的训练数据并使 A/B 测试失效。在成本收益变成可靠性账单之前,以下是你需要进行观测的指标。

insider
llm-routing
observability
reliability
+1
·tian

现在,推理速度已经快过你的数据库了

模型在请求延迟中所占的份额已经大幅下降。你自己的特征存储、身份验证和 Postgres 调用现在成了性能的长尾——而大多数 AI 架构甚至还没察觉到这一点。

insider
ai-infrastructure
performance
observability
+2
·tian

工具输出是 Agent 视为可信的不可信通道

工具输出与系统提示词共享 Token 流,因此每个读取类工具都是一个提示注入面。本文将介绍信任边界模型、四种生产模式以及用于实际衡量你的防御措施是否有效的评估框架。

ai-security
llm-agents
prompt-injection
ai-infrastructure
·tian

工具输出压缩:决定上下文质量的注入策略

AI智能体管道中的工具结果Token密度相差100倍。你选择的注入策略——原始注入、压缩还是提取——从根本上决定了智能体在规模化后的准确率上限、成本上限和延迟下限。

insider
llm-agents
context-engineering
ai-infrastructure
+1
·tian

上下文窗口不是免费存储:显式驱逐策略的必要性

工程团队习惯性地把代码库、历史记录和文档塞进上下文,默默承受成本上升和质量下降,却从不进行度量。本文阐述为何 LLM 上下文需要像 CPU 寄存器一样进行显式管理,以及如何构建切实可行的驱逐策略。

insider
llm-engineering
context-management
ai-infrastructure
+1
·tian

AI数据版本控制:团队发现得太晚的数据集-模型耦合问题

模型回退了通常意味着上游数据变了——本文介绍血缘图模式,让你在浪费一周重新调优提示词之前,就能将生产降级追溯到数据根因。

mlops
data-engineering
ai-infrastructure
data-versioning
·tian

你的标注流水线才是 AI 产品的真正瓶颈

团队在反馈采集 UI 上投入大量精力,而下游的标注流水线 —— 架构版本管理、IAA 评分、队列优先级 —— 却无休止地滞后两个迭代。本文将告诉你如何解决这一问题。

insider
mlops
annotation
rlhf
+2
·tian

Prompt Cache 盈亏平衡点:提供商端前缀缓存何时真正划算的精确数学计算

Prompt caching 宣称在缓存命中时可提供 90% 的折扣,但由于存在写入溢价,低命中率可能导致你支付的成本比完全不使用缓存还要高。本文将为你提供精确的数学计算和会话架构决策建议,帮助你判断是否能真正获得这一折扣。

llm
cost-optimization
prompt-engineering
ai-infrastructure
·tian

LLM 作为 ETL 原语:AI 不仅是产品功能,更是数据管道的核心

大多数团队都在产品中构建 AI 功能。而真正的变革正悄然发生在数据管道内部。在这里,LLM 大规模地对记录进行分类、增强、去重和路由——从而创造出那些仅关注产品的团队无法复制的复合数据资产。

insider
data-engineering
llm
etl
+2
·tian

大规模语料库策展:为什么你的 RAG 质量上限取决于你的文档质量下限

大多数 RAG 失败并不是模型故障,而是数据故障。本文探讨文档质量如何决定你的检索上限,以及在生产环境中语料库卫生究竟意味着什么。

insider
rag
llm
information-retrieval
+2
·tian

为什么你的数据库在AI功能上线后崩溃:LLM感知的连接池设计

AI功能会产生突发性的长时间运行查询模式,耗尽为可预测Web流量设计的连接池。连接池分段、准入控制和'在LLM调用前释放连接'模式可以防止AI工作负载挤占核心产品资源。

insider
database
connection-pool
ai-infrastructure
+1
·tian

数据库原生 AI:当你的 Postgres 学会了嵌入

PostgreSQL 扩展如 pgvector 和 pgai 现在可以在数据库内部处理嵌入生成、向量搜索和 LLM 调用——消除了大多数 RAG 架构所承载的同步管道,并保持向量与源数据的事务一致性。

postgres
vector-search
rag
database
+1
显示第 13–24 篇,共 26 篇