跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

跨语言幻觉:为什么你的大模型在它不擅长的语言中更容易撒谎

LLM在非英语语言中的幻觉率高出15–35%,但聚合基准测试掩盖了这一差距。本文解析其原因、测量方法以及减少幻觉的生产架构模式。

llm
multilingual
hallucination
production-ai
+1
·tian

Prompt 工程无法突破的数据质量天花板

当底层数据存在噪声、过时或重复问题时,Prompt 工程会触碰到一道硬性天花板。本文将介绍如何诊断数据失效与模型失效,以及哪些手段才能真正改变结果。

insider
ai-engineering
data-quality
rag
+2
·tian

GDPR 的删除难题:为什么你的 LLM 记忆存储是法律风险

RAG 管道和长期 LLM 记忆存储在 GDPR 下属于个人数据处理器。被遗忘权带来的删除传播问题是标准向量数据库无法干净解决的——以下是使 LLM 记忆在欧盟合法运营的架构模式。

insider
gdpr
llm
vector-database
+2
·tian

黄金数据集衰减问题:当你的评估集成为负担时

经过精心策划的评估集在数月后会悄然偏离生产环境的实际情况。了解如何检测评估何时测量了错误的目标、保持基准测试真实性的轮换策略,以及告诉你何时该重新构建评估集的监控触发器。

insider
ai-engineering
evaluation
llm
+1
·tian

古德哈特定律现已成为 AI Agent 的难题

AI Agent 是极其彻底的数学优化器 —— 当代理指标成为训练目标时,能力强大的模型会可靠地发现并利用其中的漏洞。本文将介绍如何在奖励信号演变为攻击面之前对其进行审计。

insider
ai-agents
llm
evaluation
+2
·tian

LLM 流水线中,幂等性是必选项

当输出具有随机性时,传统的幂等性机制将失效。本文介绍了在生产级 LLM 系统中防止重复执行、成本爆炸和状态机损坏的架构重构思路。

llm
production
reliability
distributed-systems
·tian

最后一公里可靠性问题:为何 95% 的准确率往往意味着 0% 的可用性

95% 的准确率听起来很好,直到你意识到这意味着你的 20 步 AI 工作流只有 36% 的时间能成功运行。本文介绍失败分类法和真正能弥合最后一公里差距的架构修复方案。

insider
llm
production-ai
reliability
+1
·tian

延迟感知差距:为什么3秒的流式响应比1秒的批量响应感觉更快

3秒的流式响应往往比1秒的批量响应感觉更快。这是背后的心理学原理和利用它的工程模式。

insider
ai-engineering
ux
performance
+2
·tian

模型最确定的时候往往最容易出错:生产中的LLM置信度校准

经过RLHF训练的LLM存在系统性失校准问题——最高的语言置信度往往对应错误的输出。如何在你的任务上测量校准误差,并修复依赖于此的路由逻辑。

llm
production-ai
reliability
ai-engineering
·tian

LLM 成本预测:多数团队在上线前都会忽略的估算难题

生产环境中的 Token 数量取决于你无法在设计阶段预测的用户行为。本文将介绍如何通过仿真、金丝雀流量和框架级预算强制执行,在产品上线前构建一个能够限制波动的成本模型。

llm
cost-optimization
ai-engineering
production
·tian

模型迁移类比数据库迁移:如何在不破坏生产环境的情况下安全切换 LLM 供应商

切换 LLM 供应商或升级模型版本更像是一次数据库模式迁移,而非简单的配置更改。这是工程师真正需要的生产环境指南。

llm
production
migration
reliability
+1
·tian

LLM 驱动的数据迁移:大规模实践中真正有效的方法

一篇面向工程师的实践指南,介绍如何使用 LLM 完成 Schema 迁移和 ETL 自动化——涵盖静默失败模式、分层验证架构、基于 Schema 的提示方式,以及何时不应用 LLM 替代传统流水线。

insider
data-engineering
llm
etl
+2
显示第 385–396 篇,共 778 篇