跳转到主要内容

11 含有标签「hallucination」

Posts tagged "hallucination" on TianPan.co.

查看所有标签

·tian

你模型的置信度分数只是一种感觉,而非概率

LLM 自我报告的置信度并非概率 —— 它只是受 RLHF 激励机制影响而产生的流畅 Token。本文将探讨为什么校准是你从未衡量过的特性,以及你应该转而使用什么进行门控。

insider
llm
calibration
ai-reliability
+2
·tian

那个本该计算却随口编造数字的智能体

LLM 智能体往往会随口说出一个看似合理的数字,而不是去进行计算,流畅的文字掩盖了缺失的工具调用。本文探讨如何强制使用工具并为每一个数据附上出处。

insider
ai-agents
llm
hallucination
+2
·tian

当 AI 听起来正确但事实并非如此:技术与科学领域中的 LLM 虚构现象

LLM 在物理、化学和工程领域表现出极高的虚构迷惑性——在这些领域,“听起来正确”与“事实正确”之间的分歧最为危险。本文将介绍如何构建可靠性架构(Grounding Architectures),在这些“自信但错误”的输出造成实际损害之前将其拦截。

llm
ai-engineering
reliability
hallucination
+1
·tian

复合幻觉问题:多阶段 AI 流水线如何放大错误

在多阶段 AI 流水线中,幻觉不仅会持续存在,还会成倍增加。每个阶段都会将前一阶段的输出视为事实,从而将一个简单的错误事实演变成一个看似确凿却完全错误的最终答案。本文将探讨这一系统层面的问题及其解决方案。

insider
ai-engineering
llm
hallucination
+2
·tian

乐于助人但却出错:生产环境 AI Agent 中的操作性幻觉问题

事实性幻觉常上头条,但还有一种更隐蔽的失败模式:AI Agent 在方向上看起来合理,但在操作上却是错误的。错误的 API 参数、过时的方法签名、正确的概念配上了错误的实例 —— 而你的评估系统根本无法察觉。

insider
ai-agents
llm
hallucination
+2
·tian

自信的幻觉制造者:生产级 LLM 知识边界信号的运行时模式

LLM 之所以自信地产生幻觉,是因为 RLHF 训练让它们听起来笃定无疑。本文介绍如何检测知识边界、按置信度路由,并构建能在生产环境中将不确定性转化为可操作信号的降级链架构。

llm
production
calibration
hallucination
+1
·tian

知识截止期是 UX 界面,而非脚注

每个大语言模型都有知识截止期,而每个产品都在对此保持沉默。请将内容的新鲜度视为一个经过设计的 UX 界面——而非注脚——否则用户将根据模型本该拒绝回答的内容来评估信任度。

insider
ai-ux
llm
rag
+2
·tian

拒绝训练差距:为什么你的模型对错误的问题说“不”

语言模型中的拒绝机制实际上是两种截然不同的能力,但目前的训练流程往往将它们混为一谈。这导致模型一方面会拦截良性请求,另一方面却对那些无法可靠回答的问题自信地编造答案。

llm
ai-safety
evaluation
calibration
+1
·tian

跨语言幻觉:为什么你的大模型在它不擅长的语言中更容易撒谎

LLM在非英语语言中的幻觉率高出15–35%,但聚合基准测试掩盖了这一差距。本文解析其原因、测量方法以及减少幻觉的生产架构模式。

llm
multilingual
hallucination
production-ai
+1
·tian

公开幻觉应对指南:当你的 AI 在公众场合说出蠢话时该怎么办

为面临公开 AI 幻觉事件的工程师和产品团队提供的实战指南——涵盖分类、根因分析、面向用户的沟通,以及真正能防止再次发生的事件后评估工作。

ai
llm
incident-response
hallucination
+1
·tian

检索空洞问题:为什么你的 RAG 拒绝说“我不知道”

向量搜索总是返回前 K 个结果,无论匹配质量如何,这会将缺失的信息转化为自信的虚构。修复这一问题不仅需要提高阈值——弃权机制必须成为一等输出。

insider
rag
retrieval
llm
+2