跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

置信度-准确率倒置:为什么大语言模型在听起来最确信的地方往往最容易出错

前沿大语言模型在用户最信任的领域表现出最差的校准性。本文介绍如何量化这一问题,并构建能在真实损害发生前处理过度自信错误答案的系统。

llm
reliability
calibration
production-ai
+1
·tian

AI生成内容中的版权风险:工程团队实用框架

LLM输出可能复现训练数据中的逐字内容,而输出责任可能落在你身上——而非模型提供商。一套用于衡量版权风险、实施切实有效的管控措施,以及理解提供商赔偿局限性的实用工程框架。

insider
ai
copyright
llm
+2
·tian

全球化 AI 产品的文化校准:为什么翻译只解决了 10% 的问题

LLM 精通数十种语言,但往往仅针对一种文化进行了校准。本文将探讨翻译所忽略的内容,以及如何通过工程手段解决这一问题。

insider
ai-engineering
localization
llm
+1
·tian

Agent 链中的截止时间传播:第三跳时你的 p95 SLO 发生了什么

用户可见的延迟约束在穿越多步 agent 管道时悄然消失。本文剖析这一结构性问题,分析主流框架的处理方式(并不理想),以及能真正解决问题的截止时间传播模式。

insider
agents
latency
slo
+2
·tian

废弃 API 陷阱:为何 AI 编码智能体在库更新后频频失效

LLM 会自信流畅地生成引用已不存在 API 的代码。本文分析其根本原因、如何度量问题严重性,以及真正有效的多层防御策略。

ai-engineering
coding-agents
llm
developer-tools
·tian

生产级文档 AI:为什么 PDF 演示会撒谎,而生产流水线不会

一个能跑通的 PDF 演示与可靠的生产流水线之间,鸿沟巨大。本文探讨哪些环节会出问题、如何发现问题,以及如何为每天处理一万份以上文档的场景设计架构。

ai
document-ai
ocr
production
+1
·tian

边缘推理决策框架:何时在本地而非云端运行 AI 模型

为 AI 工程师提供的实用决策框架:分析在哪些情况下端侧和私有化部署的 LLM 推理优于云端 API,以及如何设计连接两者的混合架构。

insider
edge-inference
llm
ai-engineering
+2
·tian

将评估覆盖率作为生产指标:你的测试套件真的在测试用户实际行为吗?

绿色的评估套件可能与悄然劣化的生产质量并存。本文介绍如何衡量你的评估是否真正代表用户的实际意图——以及当二者不匹配时该怎么做。

llm
evaluation
production
mlops
+1
·tian

为什么你的 AI 模型总是滞后 6 个月:缩短反馈循环

AI 模型会悄无声息地退化,因为从用户端出现问题到模型完成更新之间往往存在数月的鸿沟。本文将介绍如何埋点隐式信号、运行在线评估,并利用快速路径微调将这一周期从季度缩短至几天。

mlops
ai-engineering
llm
fine-tuning
·tian

指令复杂度悬崖:为什么大语言模型能可靠遵循 5 条规则却无法遵循 15 条

前沿模型能够可靠地同时满足约 3 个叠加约束,但会遗忘埋藏在长提示词中间的规则。本文将展示关于指令遵循能力退化的实证数据,以及在大规模应用中保持系统提示词可靠性的设计模式。

insider
llm
prompt-engineering
production-ai
+1
·tian

参差不齐的边界:为什么 AI 在简单任务上会失败,以及这对你的产品意味着什么

AI 的能力曲线是参差不齐的,而非平滑的——在某些任务上表现超人,但在相邻任务上却表现得极差。本文将探讨这如何制造了隐形的产品陷阱,以及你该如何应对。

insider
ai-engineering
product-design
llm
+1
·tian

知识污染问题:当你的 RAG 系统忽略自身检索结果时

LLM会自信地从训练记忆中作答,即使检索已提供了更好的事实。本文介绍如何判断模型是忽略了上下文还是检索本身就失败了——以及该如何应对。

rag
llm
retrieval
evaluation
+1
显示第 505–516 篇,共 778 篇