跳转到主要内容

5 含有标签「data-pipelines」

Posts tagged "data-pipelines" on TianPan.co.

查看所有标签

·tian

当你的 RAG 流读取时发生的 Wiki 中途编辑问题

当你的 RAG 摄入任务在作者编辑中途运行时,索引可能会捕获一个在 Wiki 中从未真实存在的状态。本文将探讨为什么基于轮询的流水线在大规模场景下会产生脏读,以及如何通过 CDC、版本锁定和写入静默模式来解决这些问题。

insider
rag
ai-engineering
data-pipelines
+2
·tian

知识图谱的时效性与向量索引的时效性具有不同的 SLA

向量索引的性能是逐渐下降的,但知识图谱的失效则是断裂式的 —— 在同一个 CDC 流水线下运行它们,会导致多跳查询静默地输出错误答案。

rag
knowledge-graphs
vector-search
ai-engineering
+1
·tian

Agentic 数据流水线:大规模离线富化与分类

AI Agent 如何改变 ETL 和批量富化工作流的设计 —— 探讨每条记录的可变计算量、作为操作契约的置信度阈值、面向下游消费者的 Schema 设计,以及区分模型不确定性与数据歧义的监控模式。

ai-engineering
data-pipelines
agents
production
·tian

LLM 作为 ETL 原语:AI 不仅是产品功能,更是数据管道的核心

大多数团队都在产品中构建 AI 功能。而真正的变革正悄然发生在数据管道内部。在这里,LLM 大规模地对记录进行分类、增强、去重和路由——从而创造出那些仅关注产品的团队无法复制的复合数据资产。

insider
data-engineering
llm
etl
+2
·tian

批量 LLM 流水线的盲点:离线 AI 的队列设计、检查点与成本分摊

生产环境中的 LLM 批量流水线如果按照实时服务模式构建,往往会面临失败。在处理离线工作负载时,任务规格选择、检查点续传、死信队列、成本分摊以及队列背压等环节都需要重新思考。

llm-ops
batch-processing
data-pipelines
cost-optimization