跳转到主要内容

118 含有标签「llm-ops」

Posts tagged "llm-ops" on TianPan.co.

查看所有标签

·tian

“每周模型”路线图:当厂商承诺变成确定性依赖

将厂商未发布的模型能力视为确定性的路线图依赖,会将 12 个月的计划变成 30 个月的重建。这是一份关于延迟、准入及重新调整范围风险的实战指南 —— 以及基于现成可用模型进行规划的原则。

insider
ai-strategy
product-roadmap
llm-ops
+1
·tian

提示词所有权问题:当康威定律盯上你的 Prompt 时

提示词往往同时横跨四个团队:编写者、评估者、部署者和技术支持。当没有单一角色负责整个闭环时,康威定律必然会导致静默的质量流失。本文探讨了 RACI 缺口、共享库陷阱,以及如何通过治理角色来确保模型行为的一致性。

prompt-engineering
ai-governance
team-structure
llm-ops
+1
·tian

Prompt 的语义差异分析:为什么 Git Diff 在提示词变更的影响上会误导你

文本层面的差异与 LLM 行为的变化几乎没有相关性。一个三个词的修改可能会导致 30% 的输出发生翻转,而五十行的结构重组可能毫无变化。本文将介绍如何构建一个 PR 评审人员能够真正信任的语义差异工具集。

prompt-engineering
evals
ci-cd
llm-ops
+1
·tian

发布并固定版本之陷阱:模型版本的稳定性如何演变为弃用技术债

固定模型版本虽然换取了短期稳定性,却在悄然积累弃用技术债。通过定期的重新验证、针对下一代模型的漂移监控以及双轨提示词组合,你可以将模型迁移从“救火行动”转变为日常运营。

llm-ops
ai-engineering
model-migration
evals
+1
·tian

Token 消耗是你的 SOC 尚未监控的安全信号

异常的 LLM Token 消耗是 API Key 被盗、提示词注入或数据外泄的最早信号 —— 但目前看板归财务管,响应归安全管。本文将介绍如何将两者打通。

insider
security
llm-ops
finops
+2
·tian

首字延迟 (TTFT) 是你尚未监测的延迟 SLO

p50 和 p99 的总延迟忽略了一个决定你 AI 产品体验的关键指标:首字延迟 (TTFT)。本文将探讨为什么推理模型会让情况变得更糟、需要衡量哪些指标,以及如何通过路由策略来优化它。

llm-ops
observability
latency
streaming
+1
·tian

AI 更新日志问题:为什么你的提示词更新正在破坏其他团队的工作

提示词编辑、模型升级和工具架构调整会在不改变代码的情况下改变行为。这里有能让消费团队保持畅通的更新日志格式和版本控制契约。

insider
ai-engineering
prompt-engineering
versioning
+2
·tian

为什么你的 LLM 告警总是迟到两周

当你的基础设施指标显示正常时,LLM 的质量可能正在悄然下降。了解具体的信号——语义漂移评分、输出 Schema 符合度、用户修复率——以及能够在用户开始提交工单前 11 天捕捉到模型退化的异常检测模式。

observability
monitoring
production-ai
llm-ops
·tian

无需标注的评估:在拥有标准答案前衡量 LLM 质量

一份在第一周 —— 即在你拥有标注数据之前 —— 衡量 LLM 输出质量的实用指南。涵盖了自我一致性、约束满足、行为不变性以及 LLM 作为裁判(LLM-as-judge),并探讨了每种方法的失效模式。

llm-evaluation
ai-engineering
testing
llm-ops
·tian

AI On-Call 心理学:为非确定性告警重建运维直觉

AI 系统的 On-Call 打破了标准的 SRE 直觉。本文提供了一套实用的分类法、轮值设计方案和培训课程,帮助你在不导致团队职业倦怠或错过真实回归的情况下,运行随机性生产系统。

insider
ai-engineering
observability
sre
+2
·tian

提示词契约测试:防止一个团队的修改破坏另一个团队的智能体

提示词是没有契约的共享 API —— 消费者驱动的测试规范能在跨团队的破坏性变更进入生产环境智能体之前将其捕获。

prompt-engineering
contract-testing
llm-ops
release-engineering
+1
·tian

影子提示词库:治理一个无人拥有的资产类别

提示词驱动着生产环境中的 AI 功能,却往往缺乏代码审查、部署流水线或明确的所有者。在监管机构强制执行要求之前,你需一套实用的治理栈 —— 包含注册表、变更审查、模型兼容性和审计追踪。

prompt-engineering
ai-governance
compliance
llm-ops
显示第 97–108 篇,共 118 篇