跳转到主要内容

118 含有标签「llm-ops」

Posts tagged "llm-ops" on TianPan.co.

查看所有标签

·tian

模型下线悬崖:当供应商淘汰你产品依赖的模型时会发生什么

强制模型迁移暴露了生产 AI 系统中的隐藏依赖。一份关于回归测试框架、金丝雀发布和构建模型可替换系统的实用指南。

insider
llm-ops
model-migration
production-ai
+1
·tian

AI 技术债务:Sprint 回顾中从未出现的四个类别

提示词腐化、评估漂移、嵌入锁定和影子耦合——传统工程实践无法捕获的四种复合型 AI 技术债务,以及管理每种债务的实用策略。

insider
ai-engineering
technical-debt
llm-ops
+1
·tian

确定性重放:如何调试永远不会以相同方式运行两次的 AI Agent

记录 Agent 执行期间的每个 LLM 调用、工具响应和时间戳,然后重放精确序列来复现故障——因为把 temperature 设为零并不能让你的多步 Agent 变得确定性。

ai-agents
debugging
observability
llm-ops
+1
·tian

供应商锁定深度分析:导致更换 LLM 供应商变成 6 个月工程项目的七个耦合点

从提示词语法、工具调用 Schema 到嵌入空间和计费模型,这七个隐藏的耦合点解释了为什么更换 LLM 供应商需要数月而非数天。本文提供了一个实用的审计框架,帮助你主动管理锁定风险。

insider
llm-ops
vendor-lock-in
ai-infrastructure
+1
·tian

可观测性税:当监控 AI 的成本超过运行 AI 本身

AI 工作负载产生的遥测数据是传统服务的 10-50 倍,导致监控费用超过推理成本。本文提供分层采样、保留策略和工具整合的实用指南,可将可观测性支出降低 50-90%,同时不丢失信号。

observability
llm-ops
cost-optimization
monitoring
·tian

批量 LLM 流水线的盲点:离线 AI 的队列设计、检查点与成本分摊

生产环境中的 LLM 批量流水线如果按照实时服务模式构建,往往会面临失败。在处理离线工作负载时,任务规格选择、检查点续传、死信队列、成本分摊以及队列背压等环节都需要重新思考。

llm-ops
batch-processing
data-pipelines
cost-optimization
·tian

模型迁移指南:如何在不冻结功能开发的情况下更换基础模型

一份分阶段的生产环境指南,用于更换 LLM 基础模型——涵盖了影子部署、跨供应商的提示词重构、嵌入模型重新索引策略,以及为什么仅凭你的评估套件无法捕捉到那些至关重要的回归问题。

insider
llm-ops
model-migration
production-ai
·tian

Prompt Sprawl:当系统提示词演变成难以维护的遗留代码

系统提示词从 200 个 token 膨胀到 4,000 个,会悄然降低 LLM 的性能。本文介绍如何审计、拆解并构建可维护的模块化提示词——将 DRY 原则、关注点分离和版本控制应用于提示词管理。

insider
prompt-engineering
llm-ops
production-ai
+1
·tian

生产环境中的智能体授权:为什么你的 AI 智能体不应该是一个服务账号

给 AI 智能体分配服务账号凭证是发现你的系统漏洞的最快路径——一旦出错,你很快就会知道它们能触达哪些系统。本文探讨了环境授权(ambient authority)、过度授权和冒充令牌如何导致生产事故,以及四种可以正确限制智能体权限的模式。

security
agent-architecture
authorization
llm-ops
·tian

基座工程(Harness Engineering):决定你的 AI Agent 能否真正工作的关键学科

大多数部署 AI 编程 Agent 的团队都专注于模型选择,却忽视了基座(Harness)—— 即决定现实世界可靠性的脚手架、反馈循环和不变性。以下是区分 “能上线的 Agent” 与 “不可控的 Agent” 的关键所在。

ai-agents
agent-harness
software-engineering
llm-ops
+1
显示第 109–118 篇,共 118 篇
上一页10 / 10