跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

知识切断是一个隐形的生产环境 Bug

模型的训练知识切断点不仅仅是文档中的一个脚注 —— 它是一种传统监控无法察觉的延时生产故障。本文将介绍如何检测、遏制并围绕它进行设计。

llm
production
rag
reliability
+1
·tian

生产环境中的实时网络接地:调用搜索 API 只是开始

为什么'直接调用搜索 API'产出的流水线远比工程师预期的差——延迟数学、故障模式,以及将演示级与生产级网络接地区分开来的架构模式。

rag
llm
production
search
+1
·tian

LLM作为标注器的质量控制:当标注者与学生共享训练数据

用LLM为另一个LLM的微调标注数据看似高效——直到两个模型都吸收了同样的互联网文本。本文阐述共享预训练如何造成系统性标注失效,以及真正有效的检测与缓解策略。

llm
fine-tuning
data-quality
annotation
+1
·tian

当大语言模型(LLM)在数据归一化方面超越基于规则的系统时(以及何时无法超越)

LLM 在处理凌乱生产数据的长尾问题上比规则系统表现更好 —— 但其成本往往令大多数团队感到意外。本文将介绍在生产环境中真正经得起考验的混合架构、成本计算模型以及验证模式。

insider
data-engineering
llm
production
+1
·tian

为什么 LLM 在分析你的产品数据时会犯自信的错误

LLM 在分析行为数据时,会自信地幻觉出指标、遗漏分母,并混淆相关性与因果关系。本文将探讨它们的失败之处以及如何安全地使用它们。

insider
ai-engineering
product-analytics
llm
+2
·tian

LLM 服务商故障手册:当 AI 基础设施宕机时如何保持服务在线

当 LLM 服务商宕机时,你只有几分钟时间做出决策。这份操作手册涵盖多服务商故障切换、优雅降级以及用户沟通策略,帮助你的产品在危机中屹立不倒。

llm
production
reliability
incident-response
+1
·tian

LLM 速率限制是一个分布式系统问题

LLM API 速率限制的行为类似于分布式锁 —— 批处理作业通过饥饿、队头阻塞和优先级反转,静默地使面向用户的流程陷入饥饿,而此时你的错误仪表盘依然显示正常。

llm
distributed-systems
rate-limiting
infrastructure
+1
·tian

LLM 供应商锁定的隐性迁移成本

API 兼容性只是冰山一角,更换 LLM 提供商的真实成本藏在提示词重写、评估重建和嵌入重索引中——这里梳理了模型切换后哪些东西能留下、哪些东西会消失。

insider
llm
production-ai
vendor-strategy
+2
·tian

压缩决策:延迟敏感型 AI 功能的量化、蒸馏与端侧推理

当模型路由已不够用,你需要低于 100ms 的响应时间时,就面临一个艰难的压缩决策。本文介绍如何在不破坏关键任务质量的前提下,权衡量化、蒸馏和混合边缘云部署。

ai-engineering
llm
performance
inference
+1
·tian

多区域 LLM 服务:没人警告过你的缓存局部性问题

在不同区域部署 LLM 推理会产生无状态 HTTP 服务所没有的一致性和延迟问题。本文将介绍一种既能解决这些问题,又不会让你的运维负担增加三倍的路由架构。

insider
llm
infrastructure
mlops
+2
·tian

多租户 LLM 问题:规模化部署中的嘈杂邻居、隔离与公平性

当数千名用户共享同一模型和向量索引时,一次高消耗的会话会拖慢所有人。本文解释了为何多租户 LLM 基础设施比数据库更难处理——以及真正有效的公平性保障方案。

insider
infrastructure
llm
multi-tenancy
+2
·tian

多轮对话会话状态坍缩问题

为什么单轮 LLM 故障很容易被发现,而多轮会话状态在 10 轮以上后会悄悄损坏 —— 以及防止 “AI 忘了我是谁” 这种失效模式的检查点、压缩和监控模式。

insider
ai-engineering
llm
session-management
+1
显示第 517–528 篇,共 778 篇