·tian
你的产品视图从未呈现的推理 Token
扩展思维在每次调用中都会生成一个推理产物,你的工程师可以看到,但你的支持、PM 和事故处理团队却看不到。这个断层正是客户投诉集中的地方。
insider
observability
reasoning
agents
+1·tian
自相矛盾的流式响应
流式 LLM 会显现用户视作最终答案的部分推理过程。本文探讨为何单次响应内的自相矛盾会破坏 UX 和评估,并介绍了四种重新引入提交边界的模式。
insider
streaming
llm
ux
+2·tian
思维链的两种失败模式,无人谈及
可见推理链本应让AI更透明——但研究表明,它会在用户看到最终答案之前,将其锚定于错误结论,将答案淹没在冗长文字中,并产生误导合规审查人员的虚假审计追踪。
llm
reasoning
ai-engineering
production-ai
·tian
空洞解释问题:当模型的推理只是装饰而非证据
LLM 输出旁生成的解释通常与实际计算没有因果联系。为什么事后合理化比承认不确定性更快地削弱用户信任,以及那些不伪造可解释性的设计模式。
llm
ai-engineering
explainability
trust
+1·tian
LLM 伪造问题:当模型为错误答案构建出令人信服的论据
LLM 不只会幻觉事实——它们还会伪造推理。伪造问题是指模型先做决定再进行解释,以选择性忽略证据为基础构建出听起来合理的综合分析。
insider
llm
ai-engineering
reasoning
+1·tian
认知工具支架:在不增加成本的情况下获得接近推理模型的性能
通过将四种结构化认知操作作为工具调用,可以将标准的 70B 模型在竞赛级数学基准测试中的表现从 13% 提升到 30% —— 以基础模型的价格实现了接近 o1-preview 的效果。本文提供了一个实用的决策框架,探讨何时认知支架方案优于直接购买推理模型。
llm
reasoning
ai-engineering
cost-optimization