跳转到主要内容

136 含有标签「mlops」

Posts tagged "mlops" on TianPan.co.

查看所有标签

·tian

那个通过后门污染了你评估集的点赞按钮

隐式的点赞反馈会使你的评估集向点击人群倾斜,而偏离了付费人群。本文将详细分析这种泄漏是如何发生的,以及如何围绕它进行治理。

llm-evaluation
mlops
product-analytics
feedback-loops
·tian

针对你已不再提供服务的模型版本的 Bug 报告

客户针对你上个月已轮换掉的权重提交 Bug 报告的那一刻,你的模型版本控制政策就不再仅仅是内部的 MLOps,而变成了面向客户的可见合约。

insider
ai-engineering
mlops
model-versioning
+1
·tian

询问哪个模型产生了哪个输出的合规审计

终端节点别名并不是一个制品。当审计人员询问是哪个检查点产生了某项决策时,只有针对每项决策的检查点固定才能提供具有辩护力的答案。

ai-compliance
model-provenance
mlops
audit
+1
·tian

让你的 A/B 测试整整一个季度都失效的嵌入模型轮换

为什么供应商端的嵌入模型升级会悄无声息地破坏你对检索功能的 A/B 测试,以及填补这一鸿沟的实验规范。

insider
embeddings
ab-testing
rag
+2
·tian

你在调试时无意中构建的微调数据集

当你在测试环境 UI 中的“踩”按钮被悄悄用作训练流水线时,你实际上是在针对过去六个月里个人的品味、客户文本以及工程师的吐槽进行微调。请务必将调试界面与标注界面分开,否则你交付的模型可能是基于你团队那一周的心情训练出来的。

insider
fine-tuning
mlops
data-quality
+1
·tian

擦除模型原生对齐的微调过程

有监督微调(SFT)会悄然削弱基础模型自带的拒绝训练。本文将探讨为什么仅针对任务的评估会忽略这一点,并介绍在客户发现之前捕捉这种退化的四种实践方法。

fine-tuning
alignment
llm-safety
mlops
+1
·tian

悄然渗入你提示词中的评估集

少样本检索和共享的 CSV 文件如何悄无声息地将精心准备的评估库变成你提供给模型的上下文示例——以及如何通过存储层隔离来阻止这一切。

insider
llm-evaluation
prompt-engineering
mlops
+2
·tian

不可信的 Trace Replay:为什么你的新模型评估在撒谎

Trace replay 在一个已不存在的上下文中验证 LLM 升级。本文将揭示为什么那些绿色的评估指标在撒谎,以及在成本与信号的曲线上,哪些验证原语分别适用于哪个阶段。

llm-migration
evaluation
observability
mlops
·tian

悄无声息击穿提示缓存的那次模型迁移

一次评估全绿、延迟匹配的看似干净的模型迁移,可能会悄悄让供应商的前缀缓存失效,使输入 token 成本飙升数周。本文拆解这个盲区,以及避免它的上线纪律。

prompt-caching
model-migration
llm-cost
mlops
+1
·tian

提示词 Diff 隐藏了自身的爆炸半径

一个三个单词的提示词修改和一段三个段落的重写在文本 Diff 中看起来并无二致,但其行为后果却大相径庭。为什么提示词审查需要评估增量,而不是字符计数。

insider
prompt-engineering
llm
code-review
+2
·tian

那个悄然演变成延迟敏感型服务的夜间批处理作业

随着一个又一个合理需求的加入,一个夜间批处理作业最终演变成了对延迟要求极高的服务。本文将探讨为什么批量推理和在线推理的优化目标截然相反,架构漂移如何导致隐蔽的故障,以及如何有针对性地进行重新架构。

insider
ai-engineering
system-design
mlops
+2
·tian

被你的智能体拙劣重造的特征存储

AI 智能体在每一轮对话中都在重新推导相同的事实——流失风险、账户账龄、订阅层级——没有缓存,没有共享定义,也没有时间点正确性。为什么这会让它们变成一个破碎的特征流水线,以及如何修复它。

ai-agents
feature-store
mlops
data-engineering
+1
显示第 13–24 篇,共 136 篇