跳转到主要内容

然并卵探测器

阅读需 1 分钟Tian PanTian Pan

商业世界喜欢潜移默化地影响你,它背后的意图可能是为了引导你购买、认同它的品牌、或者纯粹是想要得到你的注意力。这给本就复杂的世界添加了一层无所不在的人为的噪音。Ray Dalio 的工作原则 2.4 说,要记住很多人只是假装为你工作,而实际上是在追求一己私利;他给的建议是注意其中的连带利害关系,不要太天真。

如何判断某些人或者事物真的对自己有帮助?培养自己的"然并卵探测器",时常心中默默发问:你说得都很对,然而真的有用吗?这些都是你们口中的好东西,但是跟我又有什么关系?这样就能够衍生出一系列的与商业社会的相处之道:

  1. 不购买自己不需的东西,不投资自己不懂的公司
  2. 区分集体的成就和个人的成就,个人成就可以和集体成就 align,但是这个 alignment 必须是自己定义的而不是别人给的
  3. 不用刻意巴结资本家,他们不会因为你是朋友而给你钱,他们只会因为你有价值而给你钱 在 AI 的时代,大家最终都会找 AI 做事情,为什么通过你来找 AI 做事情?因为你是他们的朋友,你是一个有趣靠谱的人!
  4. 这些都是好东西,然而跟我没关系。比如:
    1. 读大多数书的方法应该是先看标题和目录,大部分内容略读,少部分内容精读
    2. 不要在所谓的大师身上花费太多时间
    3. 共识不等于 insight
  5. 行为比知识更重要,已知和未知的边界比内部更重要
  6. 判断一个人的建议是否对你真的有帮助,要关注这些内容是否贴合你的具体情况

当然,大量的新信号必然夹杂着大量的新噪音,为了避免固步自封,该多听的还是得多听,具体接受不接受自己决定。

这跟忽悠(bullshit)探测器有什么区别?"忽悠探测器"针的是对人与人之间的具体的交流沟通,而"然并卵探测器"针对的是人与商业社会的关系。

保持联系,关注我获取更多内容

阅读需 8 分钟

语义差异:当行级对比毫无意义时,如何评审 Prompt 变更

仅仅三个词的 Prompt 修改就可能让你的幻觉率翻三倍,而行级对比(Line Diff)看起来却毫无破绽。为什么 Prompt 变更需要语义差异(Semantic Diff)—— 比较行为而非文本 —— 以及如何在 PR 中对此进行门控拦截。

prompt-engineering
llm
阅读需 9 分钟

测试无法察觉却破坏了一切的模型升级

你迁移到了更新的模型,所有评估都通过了,延迟也降低了,但支持工单却不断增加。本文将探讨这类能够绕过所有断言的回归问题,以及如何在用户发现之前捕捉到它们。

insider
llm
阅读需 9 分钟

毫无意义的影子部署:当并行调用错失对话语境时

影子部署看似是验证候选 LLM 的稳妥方式,但从未触达用户的并行调用仅仅是在衡量一段字符串——而非模型在正式上线后实际运行的对话流。

shadow-deployment
llm-evaluation
阅读需 10 分钟

那个由智能体编写的、实际上什么也没测的测试

编程智能体生成的测试套件能够通过测试、提高覆盖率,却抓不住任何 Bug。本文探讨了为什么智能体编写的测试会演变为同义反复,以及变异测试和红绿 TDD 准则如何让它们重新起到约束行为的作用。

ai-engineering
testing
阅读需 12 分钟

无故障停机情况下的面向客户 AI 质量退化复盘指南

状态页显示正常,错误率为零,但客户依然不满意。这是一份关于在没有发生系统崩溃时编写 AI 质量退化复盘报告的实战指南——涵盖了根因术语、严重程度分级以及闭环后续跟进的节奏。

insider
ai-engineering