跳转到主要内容
Tian Pan

Tian Pan

Software Engineer

查看所有作者

·tian

集成 vs. 辩论:两种多模型验证范式及其失效场景

运行更多模型并不保证更好的答案。当前沿 LLM 共享训练数据时,它们的错误相关性达到 r = 0.77 —— 使得三个模型实际上仅相当于 1.3 个独立模型。本文将深入分析集成与辩论验证、它们各自的失效模式,以及当两种方法都失效时的情况。

insider
multi-agent
llm
evaluation
+1
·tian

企业 AI 的最后一公里难题:为何大多数试点项目从未到达生产

为什么超过 85% 的企业 AI 试点项目在到达生产之前就陷入停滞——以及真正能推动项目落地的组织模式。

insider
ai
enterprise
mlops
+1
·tian

解释债务:为什么用户有权知道你的AI做了什么

团队花费数月优化AI输出质量,却在没有解释层的情况下上线——本文分析了这一选择所积累的代价,以及能够解决问题的轻量级归因模式、置信度信号和申诉机制。

insider
ai-engineering
explainability
ux
+2
·tian

反馈信号时序问题:为何你的 AI 指标正在欺骗你

点赞/踩和 CSAT 评分往往与 AI 产品的长期价值背道而驰。本文介绍如何构建真正能捕捉核心价值的度量体系。

insider
ai
product
metrics
+2
·tian

基于模型性能而非用户分群的 AI 功能灰度控制

传统的特性标志(feature flags)基于用户分群进行控制 —— 但 AI 质量故障会同时影响所有人,且永远不会触发错误警报。本文将介绍基于性能条件的门控如何解决这一问题。

llmops
feature-flags
ai-deployment
model-monitoring
·tian

渐进式上下文替换:在长 AI 对话中保持质量的方法

硬截断和朴素摘要在长 AI 对话中都会导致质量下降。滚动替换模式——对近期轮次保持原始状态,同时对较旧内容进行增量压缩——是在会话超过四十轮时保持质量的有效方法。

insider
ai-engineering
context-management
llm
+1
·tian

你的帮助中心在 AI 功能方面缺失了什么(以及为什么用户不断提交工单)

传统的“操作指南”在面对 AI 功能时往往会失效,因为它们假设行为是确定性的。这里有一些能够切实减少支持工单的文档格式 —— 包括能力展示馆、局限性章节和变异示例。

insider
ai-documentation
product
support
+1
·tian

好帮手 AI 的悖论:为什么遵循指令是一个安全漏洞

让大语言模型(LLM)变得好用的“顺从性”,同时也让它们变得易受攻击。本文将探讨提示词注入攻击背后的工程现实、真实世界的漏洞案例,以及哪些防御措施能真正降低风险。

insider
security
llm
prompt-injection
+1
·tian

HIPAA、SOC2 与你的智能体:合规性对架构产生的实际约束

大多数 AI 团队在审计时才发现合规要求,而不是在第一个迭代周期。本文将探讨 HIPAA 和 SOC2 在架构上的实际要求,以及三个你无法在后期补救的关键决策。

insider
ai-engineering
compliance
hipaa
+2
·tian

人工接管作为一等功能:设计能够优雅降级至人工控制的 AI 系统

大多数 AI 系统将人工接管视为错误状态,而非设计模式。以下是如何将接管协议构建为一等操作路径而非事后补救的方法。

insider
ai-engineering
production-ai
reliability
+1
·tian

隐形作者问题:当 AI 编写大部分代码时如何进行 Git Blame

当 46% 的代码由 AI 生成且不包含溯源元数据时,git blame 止步于一位接受了自己可能并不理解的建议的开发者。本文探讨了哪些环节会出现问题,以及团队正在采取什么应对措施。

ai-engineering
code-review
devops
software-engineering
·tian

LLM-as-Judge 的对抗性失效:当你的评测框架被操控

一个输出固定回复的「空模型」在 AlpacaEval 上拿下了 86.5% 的胜率。本文系统梳理 LLM 评测框架被操控的方式、其内在的结构性偏差,以及让评测流水线保持诚实的审计方案。

insider
evaluation
llm
ai-engineering
+1
显示第 721–732 篇,共 2313 篇