跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

上游数据质量是你 AI Agent 的真实瓶颈

生产环境中的大多数 AI Agent 故障并不是模型问题 —— 而是数据问题。本文将介绍如何诊断并修复那些即使进行再多提示词工程(Prompt Engineering)也无法解决的上游数据质量问题。

ai-agents
data-quality
llm
rag
+1
·tian

你的供应商模型卡没有告诉你的事

模型卡报告的是平均基准分数。它们遗漏了尾部行为、系统提示交互效果、文化盲点,以及那些悄悄破坏生产系统的静默回归。以下是各团队正在构建的替代方案。

insider
llm
production-ai
model-evaluation
+1
·tian

当处理方案不确定时如何对 AI 功能进行 A/B 测试

当你的处理方案是 LLM 时,标准 A/B 测试就会失效——输出因每次调用而异,模型更新在实验进行中途上线,而「成功」又难以被清晰量化。以下是使实验结果仍然可信的统计调整方法和实验模式。

experimentation
llm
statistics
ai-engineering
·tian

AI功能维护悬崖:为何你的AI功能老化速度超乎想象

AI功能不只是退化——它们是无声地退化。提示词漂移、模型更新和分布偏移共同侵蚀生产环境中的AI质量,而监控面板全程保持绿色。

llm
production
observability
mlops
·tian

AI 事件响应手册:诊断生产环境中的 LLM 性能退化

当你的 LLM 功能在生产环境中出现退化时,标准的 SRE 运行手册会让你无从下手。这里有一份专门为 AI 系统构建的诊断树、提示词回滚策略和事后分析模板。

ai engineering
reliability
incident response
llm
+1
·tian

AI 事故应对指南:当你的智能体造成现实世界损害时

当 AI 智能体造成现实世界的损害时,你现有的停服应对指南会误导你。这是一份专为随机系统构建的策略:如何在没有堆栈跟踪的情况下界定爆炸半径、在证据消失前进行保全,以及如何在“模型幻觉”之外进行深入调查。

insider
ai-engineering
incident-response
llm
+2
·tian

AI 输出的版权陷阱:工程师在演变成法律问题前需要了解的知识

训练数据记忆、演绎作品原则以及输出所有权是当前存在直接工程影响的法律争议。本文将介绍风险面以及能够切实降低法律责任的管控措施。

ai-engineering
legal
compliance
llm
+1
·tian

标注经济学:每种标签来源背后隐藏的代价

在评测标签来源的选择上——人类领域专家、众包工人、LLM 合成生成和行为推断——的决策框架,以及何时「无标注」才是正确答案。

insider
evaluation
annotation
llm
+1
·tian

基准污染:为什么那个90% MMLU分数并不意味着你想象的那样

前沿模型在标准基准上表现亮眼,但污染——测试数据泄漏到预训练中——会显著虚高这些数字。本文揭示实际差距有多大,以及如何设计能给出诚实信号的评估。

insider
ai-engineering
evaluation
llm
+1
·tian

AI 推理的突发容量规划:当黑色星期五遇上你的 KV Cache

AI 推理负载对流量峰值的响应与传统 API 截然不同——冷 KV Cache、长达数分钟的冷启动、受内存限制的并发,使得响应式自动扩缩容方案完全失效。本文介绍实用的容量规划计算方法、预热策略,以及真正有效的优雅降级模式。

insider
ai-engineering
infrastructure
performance
+2
·tian

能力激发差距:升级到更新模型为何会破坏你的产品

当你升级到更新的前沿模型时,你的产品所依赖的特定能力可能会悄然退化。以下是安全训练导致这一现象的原因、如何检测它,以及在无需微调的情况下恢复被抑制行为的技巧。

insider
llm
rlhf
model-evaluation
+2
·tian

AI 工作负载的容量规划:当 Token 成为你的核心资源时,传统方法为何失效

传统供应模型在 LLM 工作负载下会失效。本文介绍了一套考虑 Token 突发性、KV 缓存压力的预测方法,并解释了为何 GPU 利用率是一个误导性信号。

ai-engineering
infrastructure
llm
performance
显示第 421–432 篇,共 778 篇