跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

上下文填充反模式:为什么更多的上下文反而会让 LLM 变差

将完整文档、原始工具输出和长聊天历史直接塞进 LLM 上下文窗口是一个可靠性陷阱。本文将介绍如何检测上下文何时在损害你的系统 — 以及如何通过具备预算意识的策展模式来修复它。

insider
llm
context-engineering
rag
+2
·tian

你的数据库模式是 AI Agent 的心智模型

规范化程度较差的数据库模式会导致 AI Agent 产生 Join 幻觉、误读关系,并引发不必要的工具链式调用。本文将介绍如何设计一个 Agent 能够真正理解并推理的模式层。

insider
agent-engineering
database
schema-design
+2
·tian

AI 功能标记:LLM 驱动功能的渐进式发布

发布 LLM 驱动的功能不仅需要传统的功能标记。本指南涵盖了提示词变体管理、三层指标栈、多轮会话的群组一致性、静默降级检测以及真正有效的回滚策略。

llm
production
feature-flags
deployment
+1
·tian

微调经济学:投入之前真正的成本计算

大多数团队将微调成本低估了 3–5 倍,因为他们只预算了训练运行的费用。这里有一套完整的成本模型 —— 包括数据整理、失败的实验、部署、维护 —— 以及一个用于判断 LoRA/PEFT 在何时真正胜过长达数月的提示工程的决策框架。

fine-tuning
lora
peft
llm
+1
·tian

生产环境中的 GraphRAG:当向量检索遇到瓶颈时

向量检索在多跳推理查询中往往力不从心。GraphRAG 填补了这一空白,但它也引入了不同的成本结构、失败模式和维护负担,而这些正是大多数团队所低估的。

rag
knowledge-graph
retrieval
llm
+1
·tian

知识蒸馏的经济学:压缩前沿模型真的划算吗?

将前沿模型压缩为专用小模型的真实成本计算——蒸馏何时优于微调、何时不适用,以及学生模型继承教师模型自信错误的失败模式。

insider
llm
knowledge-distillation
cost-optimization
+2
·tian

在不破坏生产环境的情况下发布 AI 功能:LLM 的阴影模式、灰度发布和 A/B 测试

将新的模型版本或提示词更改推送到生产环境存在标准部署流程无法捕捉的风险。本文介绍了阴影模式、灰度发布和 A/B 测试如何协同工作,以实现安全的 LLM 发布。

insider
llm
deployment
a-b-testing
+2
·tian

生产环境中的 LLM 流水线在哪泄露用户数据:PII、数据驻留以及经得起考验的合规模式

大多数 LLM 数据泄露并非来自模型本身,而是源于未脱敏的 RAG 分块、逐字的提示词日志以及可被注入的检索流水线。本文是一份关于生产级 AI 系统中 PII 处理、数据驻留路由和合规日志记录的实用指南。

insider
llm
privacy
security
+2
·tian

长上下文模型 vs. RAG:为什么 1M Token 上下文窗口并非万能

为什么将整个知识库塞进 1M token 的上下文窗口在生产环境中会失败 —— 深入探讨延迟、成本和准确率的权衡,说明为何 RAG 仍是大多数检索任务的首选,并提供一个五个维度的决策框架,帮你判断何时长上下文模型才是更优解。

rag
llm
production
retrieval
+1
·tian

模型升级陷阱:基础模型更新如何静默破坏生产系统

基础模型更新通过行为漂移、拒绝模式改变以及 JSON 序列化不一致,静默地破坏了生产系统 —— 本文为你提供一份关于检测和安全迁移的实用指南。

insider
llm
production-ai
model-versioning
+2
·tian

多租户 LLM API 基础设施:规模化场景下的潜在故障点

在 LLM 供应商前端部署生产级 API 网关可以解决成本归因和速率限制争用问题。然而,分层隔离模型、基于 Token 的限制、故障转移模式以及 KV 缓存安全性带来的复杂性,往往在团队遭遇实际故障前被低估。

llm
api-gateway
infrastructure
multi-tenant
·tian

生产环境中的多模态 LLM 输入:视觉、文档以及那些无人预警的失效模式

一份关于在生产环境中部署多模态 LLM 时工程师会遇到的失效模式的实用指南——涵盖了从视觉 Token 成本的二次方缩放、OCR 与原生视觉的权衡,到 PDF 表格提取、退化图像上的幻觉以及可组合流水线架构等内容。

insider
multimodal
llm
production
+2
显示第 685–696 篇,共 778 篇