跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

过时的文档,肯定的错误答案:AI 帮助中心里隐藏的失效模式

当 RAG 系统检索到过时的上下文时,幻觉率会飙升 6 倍。如何将文档新鲜度视为一个工程问题——通过 TTL 过滤、时间重排序、过时评分以及在发布后保持 AI 帮助中心准确性的运营模型。

rag
knowledge-base
ai-reliability
documentation
+1
·tian

系统提示中的冲突指令:无人负责的隐性故障模式

系统提示通过拉取请求不断增长,积累相互冲突的指令,并以不可预测的行为漂移形式表现出来。本文介绍如何检测矛盾并构建能够经受变更的提示架构。

insider
llm
prompt-engineering
system-design
+1
·tian

工具调用收敛:设计知道何时停止的智能体

在没有停止条件的情况下循环执行工具调用的智能体会白白消耗 token。本文探讨如何从工程角度判断信息何时已经充足。

ai-engineering
agents
llm
production
·tian

何时选择 LLM,何时选择简单启发式规则:四因素决策框架

四因素框架——信号质量、人类性能上限、数据可用性和可逆性——帮助工程团队判断 AI 真正创造价值的时机,以及何时简单的规则系统才是正确选择。

insider
machine-learning
llm
ai-strategy
+1
·tian

选择评估指标是产品决策,而非技术决策

指标选择编码了团队愿意容忍哪些失败模式。以下是为什么工程驱动的指标选择会系统性地优化错误的事情——以及如何修正它。

insider
ai-engineering
evals
product
+1
·tian

当 AI 听起来正确但事实并非如此:技术与科学领域中的 LLM 虚构现象

LLM 在物理、化学和工程领域表现出极高的虚构迷惑性——在这些领域,“听起来正确”与“事实正确”之间的分歧最为危险。本文将介绍如何构建可靠性架构(Grounding Architectures),在这些“自信但错误”的输出造成实际损害之前将其拦截。

llm
ai-engineering
reliability
hallucination
+1
·tian

A/B 测试陷阱:为什么标准实验设计在 AI 功能中会失效

标准的 A/B 测试在 LLM 驱动的功能中往往会失效 —— 非确定性的输出、异方差性以及无法体现语义质量的参与度指标,这些因素共同导致了虚假的信心。本文将探讨你应该采取的替代方案。

insider
llm
experimentation
ai-engineering
+1
·tian

为什么 AI 工程培训项目永远落后于模型

AI 工程培训项目在结构上注定落后于当前工具 12–18 个月。能跨越模型世代存续的第一性原理课程体系——以及当工具过期速度快于掌握速度时,资历究竟意味着什么。

insider
ai-engineering
skills
training
+2
·tian

AI 原生日志:捕获决策过程,而不仅仅是 I/O

传统日志告诉你 LLM 系统做了什么,AI 原生日志告诉你为什么——捕获决策逻辑、被拒绝的备选方案以及能够解释生产故障的置信度信号。

llm
observability
agents
debugging
+1
·tian

AI 入职差距:为什么工程师无法学习他们无法测试的东西

新工程师无法对 LLM 回归进行二分查找,无法读懂嵌入提示词中的隐性约束,也无法通过测试建立信心。这里是让 AI 系统对没有参与构建的人员也能清晰可读的脚手架。

insider
ai-engineering
llm
onboarding
+2
·tian

AI 流水线异常处理:幻觉、拒绝和格式违规是一等公民错误

如何在生产 LLM 流水线中将幻觉、拒绝和格式违规视为一等公民错误类型——以及每种类型的检测策略和处理模式。

insider
llm
ai-engineering
error-handling
+1
·tian

复合幻觉问题:多阶段 AI 流水线如何放大错误

在多阶段 AI 流水线中,幻觉不仅会持续存在,还会成倍增加。每个阶段都会将前一阶段的输出视为事实,从而将一个简单的错误事实演变成一个看似确凿却完全错误的最终答案。本文将探讨这一系统层面的问题及其解决方案。

insider
ai-engineering
llm
hallucination
+2
显示第 205–216 篇,共 778 篇